论文解读

Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning

音频理解 | 6.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7635 字 阅读 →
论文解读

Black-Box Optimization for Identifying and Inverting Audio Dynamic Range Control Effects

音频理解 | 4.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7076 字 阅读 →
论文解读

Improved Monitoring of Honey bee Colony Strength via Audio IoT Sensors, Modulation Tensorgrams and Recurrent Neural Networks

音频事件检测 | 6.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9763 字 阅读 →
论文解读

Layer-Wise Decision Fusion for Fake Audio Detection Using XLS-R

音频理解 | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8024 字 阅读 →
论文解读

Learning the Arabic Dialect Continuum as a Continuous Space: A Regression Approach to Speaker Origin Prediction

Transformer | 7.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8084 字 阅读 →
论文解读

Multimodal Speaker Verification as a Threat to Speaker Anonymization

说话人验证 | 9.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7725 字 阅读 →
论文解读

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

音视频理解 | 6.9/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10082 字 阅读 →
论文解读

RIME: Enabling Large-Scale Agentic Post-Production

大语言模型 | 7.6/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6524 字 阅读 →
论文解读

RPPNet: Perceptually-Grouped Rhythm-Pitch Primitives for Long-Term Structure Melody Generation via Boundary-Aware Modeling

音乐生成 | 6.9/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5701 字 阅读 →
论文解读

Validating the Single Item Kawaii Measure

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8270 字 阅读 →
论文解读

Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8304 字 阅读 →
论文解读

EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation

语音情感识别 | 5.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6251 字 阅读 →
论文解读

End-to-End Markov State Sequence Learning for Auditory Attention Decoding

语音交互 | 8.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7112 字 阅读 →
论文解读

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

基准测试 | 7.2/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9969 字 阅读 →
论文解读

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering

音频理解 | 5.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7727 字 阅读 →
论文解读

Towards a reproducible cross-venue method for quantifying crowd noise in stadiums

音频质量评估 | 5.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6934 字 阅读 →
论文解读

Adaptive Momentum Enhanced Distributed Multichannel Active Noise Control for Faster Convergence under Communication Delays

音频理解 | 6.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7172 字 阅读 →
论文解读

AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification

说话人验证 | 7.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7571 字 阅读 →
论文解读

Dense-Sparse Dynamic Time Warping for Customizing Piano Concerto Accompaniments

音乐源分离 | 7.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7252 字 阅读 →
论文解读

ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions

基准测试 | 8.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7245 字 阅读 →