ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations

📄 一次解完还是逐帧死磕:在连续编解码空间里数着步子去噪 英文题目:Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations 一句话:论文把语音增强写成连续编解码隐空间上的掩码自回归块解码,用同一 Conformer 公平比较因果与非因果策略,证明 10 步迭代能在质量与可懂度之间取得可调折中,但随机非因果并未超越因果且高斯假设偏弱。 标签:#语音增强 | #自回归模型 | #语音质量评估 评分:6.4/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Yoto Fujita:机构信息未在 arXiv HTML 中可靠披露 Simon Leglaive:机构信息未在 arXiv HTML 中可靠披露 Laurent Girin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用同一 Conformer、同一 DAC 连续表征和同一训练流程把单步非自回归、块级因果自回归、帧级因果自回归和随机与 oracle 非因果放在同一标尺下比较,权衡曲线干净可信。短板是所谓统一框架只是高斯均值回归下的掩码均方误差重训,原掩码自回归 Masked Autoregressive / MAR 中的扩散头被简化为单高斯,表达力自认较弱;非因果随机策略无实用增益,oracle 增益不可落地,方法增量感偏重。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 971 words

Neural Music Enhancement with Dual Time-Frequency Spectral Representations for Prediction and Discrimination

📄 一个管重建、一个管审美:用两套频谱分工修音乐 英文题目:Neural Music Enhancement with Dual Time-Frequency Spectral Representations for Prediction and Discrimination 一句话:针对在线音乐同时被噪声和混响污染且复调泛音难保真的问题,DSME 让短时傅里叶变换负责可逆的幅度相位重建、让恒 Q 变换负责符合八度感知的判别并辅以色度损失,在单库模拟三任务上取得客观与主观领先,代价是双变换训练更重且野外高采样验证缺席。 标签:#语音增强 | #生成对抗网络 | #音乐生成 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Fei Liu:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用短时傅里叶变换做预测、恒Q变换做判别的分工直觉漂亮且贴合音乐八度结构,色度损失也算对症下药。短板在于生成器基本沿用语音增强套路、判别器与损失的因果证据单薄,消融只做混合失真且部分指标反而倒挂,说服力打了折扣。 📌 核心摘要 非职业设备在非受控环境录制的在线音乐常同时受加性噪声与混响污染,复调、宽动态与严格听感要求使语音增强方法直接迁移效果有限。本文提出双谱音乐增强模型(Dual-Spectrum Music Enhancement,DSME),在生成对抗网络(Generative Adversarial Network,GAN)框架下让生成器预测短时傅里叶变换(Short-Time Fourier Transform,STFT)幅度与相位、让判别器在恒Q变换(Constant-Q Transform,CQT)域做八度分段判别,并辅以色度谱(Chroma Spectrum)损失约束音高与和声一致性。相对已有音乐去噪与复用管线,新意在于把可逆且预测友好的线性谱用于重建、把对数频率且变窗长的音乐友好谱用于对抗引导,二者各司其职。在Medley-solos-DB构建的去噪、去混响与混合失真三项任务上,DSME在频率加权分段信噪比等多项客观指标及混合失真ABX主观偏好上整体优于3个重训基线,混合任务主观偏好领先幅度显著。实际意义是为用户生成内容打标、推荐与转录提供更干净的前端,局限是仅在单数据集模拟失真与窄带采样下验证,对真实野外录音与高采样保真度的外推尚未证明。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 803 words

StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution

📄 不看未来,也要补出高频:StreamWSR 的零前视波形赌局 英文题目:StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution 一句话:针对低延迟语音超分辨率需要零前视流式推理的难题,StreamWSR 选择全因果波形域直接映射加训练期多分辨率 MDCT 谱监督,在 VCTK 2 kHz 到 16 kHz 上以 9.03 M 参数和 2.12 G 计算量取得 ViSQOL 3.81 的感知质量,代价是验证仍局限于干净英文朗读且缺乏实测延迟与主观听感。 标签:#语音增强 | #生成对抗网络 | #流式处理 | #高效推理 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuan Tian:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把波形域直接建模与零前视因果约束真正做成了可流式部署的轻量系统,避免了声码器和显式相位预测的复杂管线。短板在于仅在单一英文干净数据集上验证且缺少延迟实测与主观听感评估,零前视优势更多停留在结构因果层面而非系统级验证。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1015 words

StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios

📄 失真缠在一起时,谁来决定先修什么、用什么修 英文题目:StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios 一句话:真实语音常是噪声混响多人说话耦合且修法因人而异,StrixAE 让多模态大模型先听诊再调度外部专家工具链,并以格式结构感知三路奖励做强化学习,在真实录音与个性化任务上取得局部最优但以级联误差与复现缺失为代价。 标签:#语音增强 | #音频大模型 | #强化学习 | #基准测试 评分:5.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.5/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Chenglin Wu:Xiamen University Junjie Wu:Xiamen University Jinhang Chen:Xiamen University Mingyang Chen:Xiamen University Zixu Lin:Xiamen University Jiabian Chen:Fuyao University of Science and TechnologyEqual contribution. Xinghao Ding:Xiamen University Xiaotong Tu:Xiamen University 💬 毒舌点评 把耦合失真增强重构为可执行工具链调度问题的工程直觉是对的,用格式与结构奖励约束幻觉也有针对性。短板是写作与证据链粗糙:强化学习算法在 APRL 与 GRPO-AE 之间摇摆,URGENT 表格出现四行完全相同的第三名,闭源基线命名与虚构感极强的大模型版本让人难以信任所谓全面最优。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 986 words

Test-time adaptation for speech enhancement with an autoregressive speech prior

📄 一句话没有干净答案时,让干净语音的记忆来校准耳朵 英文题目:Test-time adaptation for speech enhancement with an autoregressive speech prior 一句话:针对训练与测试噪声失配导致增强失效的问题,该文冻结编解码器潜空间上的自回归干净语音先验并以 KL 散度做单句测试时微调,在 DNS V5 上事后最优提升整体质量 0.18 与背景抑制 0.23,但预测早停仅保留约三分之一增益且对本来已干净的样本可能退化。 标签:#语音增强 | #测试时自适应 | #自回归模型 | #鲁棒性 评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Sofiene Kammoun:机构信息未在 arXiv HTML 中可靠披露 Simon Leglaive:机构信息未在 arXiv HTML 中可靠披露 Xavier Alameda-Pineda:机构信息未在 arXiv HTML 中可靠披露 Timo Gerkmann:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用神经音频编解码器潜空间上的干净语音先验做单句测试时自适应,思路干净且与回归型增强任务适配性好。短板在于缺少与主流测试时自适应基线的同条件对比,且最优停止严重依赖事后挑选,实际落地时的无监督早停仍未解决。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 839 words

Sensing Bone-Conducted Speech with Earbuds

📄 耳塞在震动什么:骨导语音的低频直线与单轴传感器的容差 英文题目:Sensing Bone-Conducted Speech with Earbuds 一句话:这项工作用两款耳塞的同步测量标定佩戴者语音诱发的机壳振动,证明高功率集中在 400 Hz 以下且沿耳道口内外直线振动,使有利安装的单轴传感器仅损失 0.7 至 1.5 dB,而高频与机型差异仍需多轴与更低本底来覆盖。 标签:#语音增强 | #端到端 | #鲁棒性 | #工业应用 评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Christoph Weyer:Institute of Communication Systems (IKS), RWTH Aachen University, Aachen, Germany Peter Jax:Institute of Communication Systems (IKS), RWTH Aachen University, Aachen, Germany 💬 毒舌点评 把耳塞壳体振动这个长期凭经验用的模态做了频域加空间的联合标定,并给出单轴替代三轴的定量衰减依据,工程指向清晰。短板是17人中14男3女且多为欧洲背景、仅两款耳塞、无下游增强或检测验证,高频结论受三轴器件本底限制,向通用形态与真实噪声外推仍单薄。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 853 words

VAANI Noise Event Dataset: A curated spontaneous speech dataset annotated with timestamps for noise events

📄 在喇叭与犬吠同时响起时听清人声:VAANI 如何把印度田野噪声钉在时间轴上 英文题目:VAANI Noise Event Dataset: A curated spontaneous speech dataset annotated with timestamps for noise events 一句话:针对印度移动端自发语音中噪声与语音自然重叠却缺乏精确标注的难题,论文用原位录音加跨度级重叠时间戳与七类语义体系构建 72756 段 122.17 小时的标注层,最强证据是 106892 个事件的分布与双层质检规模,最大的代价是零基线验证与印地语高度集中。 标签:#语音识别 | #语音增强 | #多语言 评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Pavan Kumar J:机构信息未在 arXiv HTML 中可靠披露 Agneedh Basu:机构信息未在 arXiv HTML 中可靠披露 Pranav Bhat:机构信息未在 arXiv HTML 中可靠披露 Sujith Pulikodan:机构信息未在 arXiv HTML 中可靠披露 Suryansh Shukla:机构信息未在 arXiv HTML 中可靠披露 Nihar Desai Prasanta K. Ghosh:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把印度田野自发语音与重叠噪声起止时间配对记录,补上了合成混合与弱标签资源之间的空白,定位清晰。短板是全文零基线、零一致性量化、零下载链接,所谓支撑噪声鲁棒自动语音识别(Automatic Speech Recognition,ASR)、声音事件检测(Sound Event Detection,SED)与语音增强仍停留在宣称层面。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 948 words

ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids

📄 开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消? 英文题目:ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids 一句话:为解决开耳式助听器通气孔泄漏污染增强语音的问题,ABSE-NET 用 BMVDR 做保留空间线索的粗增强,再用仅 0.112M 参数的轻量网络联合完成泄漏对消与失真补偿,在合成双耳数据上以 0.184G FLOPs 取得 PESQ 3.626 与 STOI 0.955,但验证仍局限于仿真声学环境。 标签:#语音增强 | #CNN | #主动降噪 | #助听器 | #模型压缩 评分:7.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 De Hu:机构信息未在 arXiv HTML 中可靠披露 Xue Du:机构信息未在 arXiv HTML 中可靠披露 Qingying Zhao:机构信息未在 arXiv HTML 中可靠披露 Qintuya Si:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把双耳最小方差无失真响应波束形成器(binaural minimum variance distortionless response beamformer,BMVDR)与轻量后滤波级联,用 0.112M 参数实现开耳式场景下的泄漏对消且摆脱耳内误差麦克风,工程指向清晰。短板是评估完全依赖 Hearpiece 实测头相关脉冲响应(head-related impulse response,HRIR)合成的 24 小时仿真数据,未见真实开耳助听器佩戴、非线性次级路径或主观听感验证,且核心公式中空间线索误差定义存在明显笔误,削弱严谨性观感。 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1735 words

U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement

📄 相位不再复用:当 Transformer 学会看懂复数谱图 英文题目:U-PAST: A Phase-Aware Audio Spectrogram Transformer-U-Net for Single-Channel Speech Enhancement 一句话:针对卷积难以捕捉长程时频依赖且复用含噪相位限制音质的问题,U-PAST 用复数谱图的 Transformer 编码加 U-Net 解码直接重建幅度和相位,在混响失配下取得最优 SI-SDR,并在匹配条件下以小参数取得最高 PESQ-wb,但低计算量尚未转化为时延优势。 标签:#语音增强 | #Transformer | #模型评估 评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Cao Duong Ly:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129 Jörn Anemüller:Department of Medical Physics and Acoustics;Carl von Ossietzky University Oldenburg;Oldenburg, Germany 26129 💬 毒舌点评 用 1.17M 至 2.40M 参数和 4.39G 至 4.71G MACs 在混响失配下实现对全部基线的 SI-SDR 超越,证明了复数域 Transformer-U-Net 对相位感知与长程建模的协同价值,效率-鲁棒性权衡清晰。短板是所谓首个复数混合架构本质为 AST 分块嵌入与复数 U-Net 的工程拼接,未提出新注意力或复数算子,在其余 3 个条件下仍落后 TF-GridNet 1.62 dB 至 2.44 dB SI-SDR,且未开源任何代码与权重,复现与落地价值受限,低 MACs 也未转化为时延优势。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1637 words