ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

Auditory Illusion Benchmark for Large Audio Language Models

📄 听错了才是听懂了?当大音频模型遇上人类幻听 英文题目:Auditory Illusion Benchmark for Large Audio Language Models 一句话:论文把十种听觉错觉做成可对照人类听感的选择题来考大音频模型,发现最像人的模型也只有人类一半的易感度,而像人与忠于物理信号之间至今没有模型能兼得,代价是提示词稍改结果就大变。 标签:#音频理解 | #多模态模型 | #基准测试 | #模型评估 评分:6.4/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Hayoon Kim:机构信息未在 arXiv HTML 中可靠披露 Eunice Hong:机构信息未在 arXiv HTML 中可靠披露 Kyogu Lee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把听觉错觉从演示视频变成可跑分、可对照人类分布的基准,这个选题确实抓住了音频评测的盲区。问题是人类基线只靠20名绝对音感听者撑场面,控制准确率又普遍在随机线附近晃悠,所谓最像人的模型更像蒙对了选项而非真听错了。 📌 核心摘要 人类听觉会系统性偏离物理信号,而现有大型音频语言模型评测多围绕转录、分类、检索等客观真值任务,缺乏对主观错觉的系统检验。本文提出首个听觉错觉基准 Auditory Illusion Benchmark,覆盖音乐、声音、语音三大内容域的10种代表性错觉,并按主导机制划分为物理型与物理加知识型,同时配套错觉刺激与匹配控制刺激和人类听觉实验。方法核心是将每种错觉转化为二选一或三选一感知判断题,以人类多数投票定义错觉标签,并用人类相似准确率、现实符合率与错觉易感指数刻画模型位置。与已有视觉错觉基准相比,新意在于面向音频的参数化生成管线与人类同题对照协议,以及对自下而上声学与自上而下先验的分离讨论。关键结果是最佳模型平均错觉易感指数仅约0.455,远低于人类参照的1.0,且高易感常伴随低于随机水平的控制准确率,提示偏差多于感知;知识驱动错觉上多个模型由信号忠实反转为类人易感,提示对齐可能来自语言先验而非共享低层听觉处理。实际意义是为认知对齐提供独立于识别精度的诊断维度,可用于区分字面检测器与类人感知者,并明确高易感在交互场景与安全精密场景下的不同可取性。主要局限是人类样本特殊、合成刺激与自然经验有差距、指令措辞可带来超过模型间差异的波动,外推到一般听众与真实场景时需谨慎。 🔗 开源与复现资源 代码:https://github.com/gillosae/aib 模型权重:论文中未提及 数据集:AIB基准数据集,包含10种听觉错觉,共10385个错觉刺激和4444个对照刺激,总计14829个样本,另有包含1032个错觉刺激和534个对照刺激的mini子集,总计1566个样本,获取链接为 https://github.com/gillosae/aib Demo:论文中未提及 复现材料:论文提及提供用于系统生成基准错觉的开源实现以及通过受控听觉实验构建的人类基线数据,获取方式为访问 https://github.com/gillosae/aib,论文证据中未提及训练配置与检查点细节 论文中引用的开源项目:评估中提及 Pengi、Voxtral-Mini、MuLLaMa、Kimi-Audio-Instruct、Audio Flamingo 3、Fun-Audio-Chat、Qwen-Audio-Chat、Qwen2-Audio-Instruct、GLM-4-Voice、Gemini 3.1 Pro,论文证据中未给出上述项目的HTTPS链接 资源可达性验证:code=temporarily_unreachable;dataset=temporarily_unreachable;reproduction=temporarily_unreachable 🧭 深度解读 耳朵为什么总在骗大脑? 想象你在琴房里听老师弹了一个低音,你发誓听到了那个浑厚的根音,可频谱仪却告诉你那个频率根本没有发出。这不是你走神,而是听觉系统在主动补全。人类听声音从来不是麦克风式的忠实录音,大脑会用谐波关系、掩蔽记忆、节奏预期和语言知识去猜测世界,这种猜测大多数时候高效,偶尔就会系统性跑偏,形成听觉错觉。 ...

2026-09-03 · 更新于 2026-09-04 · 3 min · 550 words

TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models

📄 会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒 英文题目:TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models 一句话:TAG-Bench 把时序音频定位从 30 秒单区间拉到 20 分钟一对多枚举,用 1750 条人工校验问答与并集 IoU/计数/格式三层度量揭示即使最强的 FireRedAudio 也仅 31.2 mIoU 且所有模型计数准确率不过 13.2% 的系统性短板。 标签:#音频理解 | #音频大模型 | #音频事件检测 | #基准测试 | #长音频处理 评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuhang Dai:机构信息未在 arXiv HTML 中可靠披露 Xin Shu:机构信息未在 arXiv HTML 中可靠披露 Zengxi Li:机构信息未在 arXiv HTML 中可靠披露 Lei Xie:机构信息未在 arXiv HTML 中可靠披露 Xiangang Li:机构信息未在 arXiv HTML 中可靠披露 Jianwei Yu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音频时序定位从 30 秒短片段与单区间检测拉到 20 分钟长音频与一对多枚举的真实痛点,并用 21 个系统的统一自由文本评测撕开了当前大音频语言模型连时间都说不清的遮羞布;短板是所有结论都建立在规则解析的混合度量上,数据与评测代码承诺尚未兑现,且 1750 条查询在 8 个子集上的诊断粒度与统计效力仍显单薄。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1668 words

VoiceLongMemEval: Do Assistants Remember How You Sounded?

📄 只记得你说了什么,却忘了你怎么说的:长程副语言记忆的缺口 英文题目:VoiceLongMemEval: Do Assistants Remember How You Sounded? 一句话:VoiceLongMemEval 把“怎么说”埋进约 10 万 token 的多会话历史,用三级对抗门控逼答案只能从副语言恢复,证明 8 个模型在描述条件下均显著超越盲文本、而 Whisper 级联会系统性丢掉递送信号,代价是全合成数据与仅 oracle 区间的有限外推。 标签:#语音情感识别 | #大语言模型 | #音频理解 | #基准测试 评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Ramit Pahwa:机构信息未在 arXiv HTML 中可靠披露 Parivesh Priye:机构信息未在 arXiv HTML 中可靠披露 Apoorva Beedu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 首次把副语言记忆从单句感知拉长到约 100k tokens 的多会话记忆,设计三级对抗门控确保答案不可从文本推断,概念干净且切中级联式语音助手的结构性缺陷;短板是 523 题全部为大语言模型合成与 Dia 1.6B 合成语音,仅 202 题核心集过盲对抗门控,衍生 321 题未单独门控,音频验证仅限 2 个 7B 模型且为 evidence-only 的 Oracle 评测,生态说服力与自然度仍有距离。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1422 words

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

📄 长字幕为什么总在最后两层才说谎:用问答把数据、训练和推理锁在一起 英文题目:Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning 一句话:针对长段落音频字幕同时要求长片段、长文本与逐字转录保真的结构性缺口,论文用音频锚定问答统一检验数据、训练与推理三阶段,并以层间曲率抑制迟滞坍缩,在保持开源骨干不变的前提下把字幕的下游可用性推到接近闭源旗舰的水平。 标签:#音频字幕生成 #SFT #音频理解 #音频大模型 #数据集 评分:6.8/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fengji Ma:The Hong Kong University of Science and Technology (Guangzhou) Yan Rong:The Hong Kong University of Science and Technology (Guangzhou) Xu Li:机构信息未在 arXiv HTML 中可靠披露 Chen Zhang:Kling Team, Kuaishou Technology Pengfei Wan:Kling Team, Kuaishou Technology Li Liu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音频锚定问答(audio-grounded question answering)这一单一验证原语贯穿数据、训练、推理三阶段,并用层间曲率捕捉迟滞坍缩这一可验证的幻觉信号,思路比单纯堆数据更干净。短板是核心数据管线完全依赖 Gemini 3.1 Pro 这一闭源黑盒自检,成本与可复现性存疑,且 Late-Layer Semantic-Entropy Collapse 的理论刻画仍停留在现象描述与二阶差分启发式层面,缺乏形式化假设与边界分析。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1068 words

HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding

📄 听见是谁在说:用反事实声纹逼语音模型从猜文本回到听声音 英文题目:HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding 一句话:针对多说话人场景下语音模型靠语义先验猜测谁说了什么的问题,论文以 Erber 听觉层级构建 HEAR 诊断基准与声纹交换的 CASH 硬负样本,并用转录优先的 GRPO 训练 A2R,在配对评估与三项零样本迁移上显著提升声学接地,代价是显式转录带来的延迟与合成分布局限。 标签:#说话人日志 #强化学习 #语音识别 #音频理解 #基准测试 评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Dongwook Lee:IPAI, Seoul National University (SNU) Sangkwon Park:Department of ECE, SNU Eunwoo Song:Department of EE, Yonsei University Che Hyun Lee:Department of ECE, SNU Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Junho Kim:机构信息未在 arXiv HTML 中可靠披露 June Young Yi:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用反事实语音克隆把语义先验与声学身份彻底解耦,配上配对评估让依赖文本捷径的模型无处遁形,诊断非常犀利。短板是 CASH 完全依赖合成语音构建 hard negative,且仅在 Qwen3-Omni 单一基座上验证 GRPO 收益,对真实声学多样性和架构泛化性的说服力仍显单薄。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1590 words

Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper

📄 1500 个音频 token 真的都需要吗?用等间隔抽样戳破 Whisper 的时域冗余 英文题目:Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper 一句话:针对 Whisper 固定 1500 token 接口的时域冗余,论文用无训练的等间隔 stride-k 索引在卷积茎后与编码器后两处降采样,证明 k=2 在多数任务上接近基线且复合后可削减 75% 音频 token、降低约 52-58% GFLOPs 并在语音大模型上兑现 19-28% 延迟收益,但代价在困难语料与细粒度时序任务上显著放大。 标签:#语音识别 #模型压缩 #音频理解 #高效推理 评分:7.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Chanhee Cho:Department of Artificial Intelligence Junhyuk Choi:Chung-Ang University, Seoul, Republic of Korea Bugeun Kim:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把 Whisper 固定 1500 token 接口的冗余用最朴素的等间隔索引一次性捅破,并用感受野计算与中心核对齐(Centered Kernel Alignment,CKA)衰减曲线把输入侧与输出侧的不对称讲清楚,工程上零训练零额外计算即可复用。短板是所有结论都锁死在重叠窗口加卷积茎这一前端假设上,对原始波形编码器直接失效,且 Common Voice 等困难场景下复合降采样仍带来近 10 个点的词错率(Word Error Rate,WER)恶化,却未给出任何自适应回退策略。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1729 words

A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls

📄 文字答得滴水不漏,声音却露了怯:财报电话会里的双重规避 英文题目:A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls 一句话:论文把财报问答的规避拆成文字是否答到点上与声音是否听起来自信两个独立维度,用 505 条双标注样本证明三成以上的回答存在跨模态不一致,并以文本接近人类而声音非自信类 F1 仅 38 左右的落差揭示现有音频大模型不会做说话人基线校准。 标签:#语音情感识别 #多模态模型 #音频理解 #基准测试 评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Mirae Kim:Financial Tech Lab, KakaoBank Corp. Seonghun Jeong:Financial Tech Lab, KakaoBank Corp.;Yonsei University Youngjun Kwak:Financial Tech Lab, KakaoBank Corp. 💬 毒舌点评 亮点在于首次将财报电话会中的文本规避与声音自信度解耦标注,并用32.1%的跨模态不一致比例有力证明单看文本会系统性漏掉关键信号。短板是505条样本撑起的基准规模过小且声音维度被压缩为二分类自信度,所谓市场波动回归更像用60次电话会硬做叙事,模型在非自信类上38左右的F1也暴露了当前音频大模型对说话人基线校准的无力。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 863 words

Exploring the Design Space of Representation Learning for Audio Transformations

📄 效果是效果,声音是声音:当表征必须同时记住与忘记内容 英文题目:Exploring the Design Space of Representation Learning for Audio Transformations 一句话:论文把分散的音频效果表征路线收敛为处理一致性、描述对齐与等变预测三个可组合的对比目标,并在同一冻结前端与受控批次下证明变换嵌入与处理后音频嵌入的分工互补——前者靠几何组织赢得跨音源检索与风格迁移,后者靠信息丰度赢得探针估计,代价是对结构化描述与 Fx 归一化的依赖。 标签:#音频检索 #对比学习 #音频理解 #自监督学习 #Transformer 评分:8.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Sungho Lee:机构信息未在 arXiv HTML 中可靠披露 Marco Martínez-Ramírez:机构信息未在 arXiv HTML 中可靠披露 Junghyun Koo:机构信息未在 arXiv HTML 中可靠披露 Wei-Hsiang Liao:机构信息未在 arXiv HTML 中可靠披露 Kyogu Lee:机构信息未在 arXiv HTML 中可靠披露 Yuki Mitsufuji:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把音频效果表征长期各说各话的对比式、标签式与等变式路线收敛为三个可组合目标,并在同一冻结 SAO 前端与受控批次下做全组合消融,控制变量堪称典范,变换嵌入与处理后音频嵌入的互补分工也解释了检索与探针结果的背离。代价是所有结论仍被锁在自建 PyTorch 处理器库与 Fx 归一化后的 MUSDB 分轨上,对真实插件预设分布、无归一化原始录音以及并行/侧链等复杂路由的外推力未被证伪,描述对齐对结构化参数的依赖也让无描述场景只能回退到次优组合。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 1031 words

Not all generalisation failures can be bought back: four boundaries in affective audio modelling

📄 泛化失效有两种:能用标注买回的,和换什么表征也买不回的 英文题目:Not all generalisation failures can be bought back: four boundaries in affective audio modelling 一句话:论文把同一个声学到唤醒度的映射依次推过换库、换域、换合成、换生理通道与换人五道坎,用同一指标报告每道坎的天花板、幸存率和买回价格,证明同域损失可用百例标注回收三分之二,而跨音乐与环境声、跨到生理的损失在四类预训练表征下均未被买回。 标签:#音频理解 #迁移学习 #音乐理解 #对比学习 评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.4/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Jingyi Zhang:Shanghai Huangan Technology Co., Ltd., Shanghai, China;Systems Neuroscience, Institute for Neuroscience, Department of Health Sciences and Technology (D-HEST), ETH Zurich, Zurich, Switzerland Xiaotong Yao:Correspondence: Jingyi Zhang, jingyi.zhang@hest.ethz.ch;Shanghai Huangan Technology Co., Ltd., Shanghai, China 💬 毒舌点评 把“模型不泛化”这句正确的废话拆成可证伪、可报价的两种诊断,并用跨语料、跨合成、跨通道、跨个体的四重边界在同一流程下兑现,统计对照与证伪实验的诚实度在情感音频领域罕见。短板是所有生理学结论仍被锁在单次实验室会话与人均约30试次量级,作者自称未测得生理目标上的学习曲线,却仍要给出信息受限标签,语气比证据多走半步。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 767 words