ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-08-14 · 108 min · 22980 words

HybridSB-MoE: Dual-Domain Schrödinger Bridges with Scene-Adaptive Expert Routing for Speech Enhancement

📄 HybridSB-MoE: Dual-Domain Schrödinger Bridges with Scene-Adaptive Expert Routing for Speech Enhancement 标签:#语音增强 #扩散模型 #模型评估 5.9/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #扩散模型 | #模型评估 | arxiv 👥 作者与机构 第一作者:Zhengyi Lu(Oakland University, Department of Computer Science and Engineering) 通讯作者:未说明 作者列表:Zhengyi Lu、Aswini Sivakumar、Jie Hu、Yao Qiang,均来自 Oakland University, Department of Computer Science and Engineering, Rochester, MI 48309 邮箱:{zhengyilu, aswinisivakumar, jiehu, qiang}@oakland.edu 💡 毒舌点评 这篇论文有一个较有洞察力的设计:把谱域 MoE 的认知不确定性 u_epi 与波形 Schrödinger Bridge 的偶然不确定性 u_ale 设为非对称路由信号,让融合机制在“哪种误差更可信”之间切换,而不是对两个预测做对称平均。与此配套的效率主张也有一定价值:路径一致性与轨迹正则被写入 K 步离散误差的 2-Wasserstein 界,为小步数推理提供了训练目标层面的解释。 ...

2026-08-14 · 更新于 2026-08-14 · 4 min · 697 words

Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones

📄 Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones 标签:#语音增强 #CNN #RNN #多通道 #模型评估 5.1/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 📝 5.1/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音增强 | #CNN | #RNN #多通道 | arxiv 👥 作者与机构 第一作者:Oshan A. B. Yalegama(Department of Electronic and Telecommunication Engineering, University of Moratuwa, Sri Lanka) 第二作者:Wageesha N. Manamperi(School of Engineering, The Australian National University, Australia;其邮箱为 University of Moratuwa 邮箱,机构标注与邮箱存在不一致) 通讯作者:论文未明确标注通讯作者,仅通过脚注列出两位作者的邮箱 yalegamammoab.20@uom.lk 和 wageesham@uom.lk 💡 毒舌点评 本文首次把 ReTM 估计从协方差基线推进到监督深度学习,三种架构分别覆盖 STFT 深度卷积、时域滤波器组和 BiLSTM 时序建模,FuSNet 在仿真指标上确实有明显提升,LAeNet 的下游降噪效果也值得关注。但实验规模极小、完全依赖仿真,测试集在多数场景中只有 10 秒;正文与表格之间存在“场景 B 中 SCoNet MSE 优于 FuSNet”这类直接与数据相悖的表述;FuSNet 在下游语音增强中反而从 Baseline 的 4.07 dB 跌到 −1.19 dB,说明 ReTM 精度高不等于降噪有用;LAeNet 训练时拼接了目标信号却未说明推断输入,存在训练/推断不一致的严重疑点。再加上只给了音频样本、没有代码和权重,论文可靠性被明显拖累。 ...

2026-08-13 · 更新于 2026-08-14 · 5 min · 973 words

Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec

📄 Rethinking Language Model-Based Generative Speech Enhancement in the Latent Space of a Neural Audio Codec 标签:#语音增强 #语音大模型 #扩散模型 #流匹配 #自监督学习 7.1/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #语音大模型 | #扩散模型 #流匹配 | arxiv 👥 作者与机构 论文文本未提供作者与机构信息;需从 arXiv 页面另行确认。 💡 毒舌点评 这篇论文最有价值的地方是把六种 LM-based 语音增强范式放进同一个框架里做了一次难得的公平比较,并用侵入式指标补足了该方向常被忽略的评估盲区。但它更像一份高质量的系统化 benchmark,而非方法创新;缺少与外部 URgent 挑战系统的直接对比,也让“CNAR 最优”的结论略显内部化。 ...

2026-08-13 · 更新于 2026-08-14 · 5 min · 858 words

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

📄 RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation 标签:#语音增强 #知识蒸馏 #流式处理 #实时处理 #模型压缩 6.6/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #知识蒸馏 | #流式处理 #实时处理 | arxiv 👥 作者与机构 论文未提供作者-机构的逐人数字映射;脚注机构列表为:Academia Sinica, Taiwan;National Taiwan University, Taiwan;Kore University of Enna, Italy;University of Palermo, Italy;NVIDIA。 ...

2026-08-13 · 更新于 2026-08-14 · 5 min · 1037 words

BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays

📄 BiTSE: Binaural Target Speaker Extraction in Noisy Multi-Talker Environments for AR Glass Arrays 标签:#语音分离 #Transformer #语音增强 #多通道 5.0/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5 📝 5.0/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音分离 | #Transformer | #语音增强 #多通道 | arxiv 👥 作者与机构 第一作者:Selani A. Indrapala(斯里兰卡莫拉图瓦大学,电子与电信工程系) 通讯作者:未说明 作者列表:Selani A. Indrapala(斯里兰卡莫拉图瓦大学电子与电信工程系)、Wageesha N. Manamperi(斯里兰卡莫拉图瓦大学电子与电信工程系) 资助来源:“Accelerating Higher Education Expansion and Development (AHEAD)” 项目(编号 6026-LK/8743-LK)及斯里兰卡电信监管委员会(TRCSL)2024 研发基金 💡 毒舌点评 用 oracle DoA/VAD 把 SegSNR 从 -8.69 拉到 -2.57,说明空间与活动性信息确实能带来可观增益;但所谓“目标说话人提取”既依赖真值标签,又未与任何已有 TSE 方法对比,更像“带 oracle 指导的 BCCTN 增强”。更扎眼的是引言末尾宣称 “consistently surpasses state-of-the-art methods”,而全文的对比基线只有 MVDR 和自己使用的 BCCTN 系列,SOTA 声称没有实质证据支撑,离 AR 眼镜实际部署还有很大距离。 ...

2026-08-12 · 更新于 2026-08-14 · 6 min · 1193 words

Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice

📄 Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice 标签:#语音增强 #端到端 #模型评估 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:应用研究 | 评分置信度:中 | #语音增强 | #端到端 | #模型评估 | arxiv 👥 作者与机构 作者列表(按论文原文顺序):Reyhaneh Abbasi、Peter Balazs、Vincent Lostanlen、Clara Hollomey、Dustin J. Penn、Sarah M. Zala、Nicki Holighaus。 机构信息: Reyhaneh Abbasi:奥地利科学院(ÖAW)声学研究所(Acoustics Research Institute);维也纳大学维也纳认知、行为与神经科学博士学院(Vienna Doctoral School of Cognition, Behavior, and Neuroscience)。 Peter Balazs:奥地利科学院声学研究所;奥地利林茨跨学科转型大学(IT:U)。 Vincent Lostanlen:法国南特大学/南特中央理工/CNRS/LS2N UMR 6004。 Clara Hollomey:奥地利圣珀尔滕应用科学大学创意媒体技术研究所(Institute for Creative Media Technologies)。 Dustin J. Penn、Sarah M. Zala:维也纳兽医大学康拉德·洛伦兹动物行为学研究所(Konrad Lorenz Institute of Ethology)。 Nicki Holighaus:奥地利科学院声学研究所。 通讯作者:Reyhaneh Abbasi(reyhaneh.abbasi@oeaw.ac.at)。 💡 毒舌点评 用脊线自己合成干净目标,再让同一个脊线跟踪器来打分,这套“自产自销”的闭环在工程上确实漂亮——绕开了生物声学最缺的干净标注,还把脊线位置塞进 loss 里一鱼两吃。但 SI-SDR 的漂亮数字更像是系统内部的自洽证明:训练目标、测试参考和评价指标全部来源于同一套合成管线,离真实野外噪声到底有多远没有说清。再加上分类实验里 BootSnap 自带降噪没被拆除,增益归因也留了一笔糊涂账。方法对调性发声有效,但离“通用生物声学降噪”还有一层窗户纸。 ...

2026-08-12 · 更新于 2026-08-14 · 5 min · 889 words

DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation

📄 DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation 标签:#音视频语音分离 #多任务学习 #语音增强 #鲁棒性 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频语音分离 | #多任务学习 | #语音增强 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Wei Zhou(Yijiahe AI) 通讯作者:Wanyi Ning(Yijiahe AI / 天津大学) 作者列表:Wei Zhou(Yijiahe AI)、Wanyi Ning(Yijiahe AI / 天津大学)、Yinshang Guo(南京大学)、Qianxiao Fang(Yijiahe AI)、Haitao Qian(Yijiahe AI)、Yingpeng Li(Yijiahe AI) 💡 毒舌点评 DAVE 的设计直觉很清醒:视觉不是用来重建波形的,而是用来做身份归属的低带宽决策,这比把不可靠视觉特征硬塞进分离网络更符合真实场景。可惜“certified”这个说法撑不住:场景分类器只有 98.13% 准确率,误路由会让“结构性不降级”不成立;官方排行榜上 DAVE 主要靠 UTMOS 和 DNSMOS-OVRL 两项无参考感知指标领先,SI-SDR、CER、说话人相似度都不是最优,平均排名只在 4.00/4.14,明显落后于 AITD 和 audioman。再加上没有开源代码、权重或 DAVE-Corpus 下载入口,这套系统更像一个工程报告而不能称为可复现的方法贡献。 ...

2026-08-11 · 更新于 2026-08-14 · 5 min · 886 words

Mitigating Over-Suppression in Speech Enhancement via Inference-Time Rethink-and-Refine Correction Module

📄 Mitigating Over-Suppression in Speech Enhancement via Inference-Time Rethink-and-Refine Correction Module 标签:#语音增强 #测试时自适应 #鲁棒性 #语音质量评估 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #测试时自适应 | #鲁棒性 #语音质量评估 | arxiv 👥 作者与机构 第一作者:Mike Qu(机构未说明) 通讯作者:未说明 作者列表:Mike Qu、Yu-Wen Chen、Julia Hirschberg(机构信息均在原文中未说明) 💡 毒舌点评 把 over-suppression 校正拆成 ASR 对齐的“反思-修复”在直觉上很务实,免训练、即插即用、多数据集多模型验证也是加分项;但核心主张“ASR 局部权重优于已有全局插值/SNR 检测式校正”没有用 observation-adding 或 NRSER 做任何数值对照,双视图重调和、fallback、分段粒度也全部没有消融。工程上像是一个有用的输出级修补件,但学习率、迭代次数、ASR 切分参数等复现关键信息缺失,且没有代码或 demo,离“系统性新方法”还差至少一轮严格的消融与开源支撑。 ...

2026-08-11 · 更新于 2026-08-14 · 4 min · 695 words

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

📄 Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement 标签:#语音增强 #知识蒸馏 #多通道 #实时处理 #高效推理 6.0/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #知识蒸馏 | #多通道 #实时处理 | arxiv 👥 作者与机构 第一作者:Xulin Fan(University of Illinois Urbana-Champaign, USA) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Xulin Fan(University of Illinois Urbana-Champaign)、Juan Azcarreta(Meta Reality Labs Research)、Ashutosh Pandey(Meta Reality Labs Research)、Jesus Alvarez(Meta Reality Labs Research)、Ke Tan(Meta Reality Labs Research)、Jacob Donley(Meta Reality Labs Research)、Ritwik Giri(Meta Reality Labs Research)、Buye Xu(Meta Reality Labs Research) 💡 毒舌点评 把服务器端 SpatialNet 的延迟增强谱、中间层特征和空间统计量一起“搬”到边缘端,确实让 TinyGRU+MCWF 在合成低 SNR 测试集上获得 3.77 dB 和 3.49 dB 的 SI-SDR 提升,而边缘端参数只增加约 1.5%、计算量只增加约 2.4%,这个端云协作 pipeline 有工程启发。但实验基本局限于同一套 Pyroomacoustics 合成 RIR 与固定延迟仿真:没有与原始 Knowledge Boosting 直接对比,没有真实设备、动态网络延迟、丢包或带宽测试,也没有统计显著性检验。更刺眼的是 PESQ 没有随 SI-SDR 同步上升,完整模型的 PESQ 甚至低于中间消融配置。目前的结论更适合表述为“仿真环境下端云协作增强的可行性验证”,而非成熟的部署级方案。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 712 words