ICML 2026 语音/音频论文详细分析

ICML 2026 语音/音频论文详细分析 共分析 137 篇 ICML 2026 论文 🎯 任务分类 点击任务标签查看该方向所有论文: 音视频理解(18篇) 音视频生成(10篇) 音频分类(9篇) 音频理解(8篇) 音乐生成(8篇) 语音合成(8篇) 音视频问答(8篇) 语音识别(5篇) 语音伪造检测(4篇) 语音交互(4篇) 语音增强(4篇) 语音编码(4篇) 多模态模型(3篇) 音频伪造检测(3篇) 音频分离(2篇) 空间音频(2篇) 音频编码(2篇) 音频修复(2篇) 语音属性识别(2篇) 音频生成(2篇) ⚡ 会议概览 📥 ICML 2026 接收 6341 篇论文 → 🔍 关键词 + LLM 筛选 137 篇音频/语音/音乐相关 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频理解 18篇 ██████████████████ #音视频生成 10篇 ██████████ #音频分类 9篇 █████████ #音频理解 8篇 ████████ #音乐生成 8篇 ████████ #语音合成 8篇 ████████ #音视频问答 8篇 ████████ #语音识别 5篇 █████ #语音伪造检测 4篇 ████ #语音交互 4篇 ████ #语音增强 4篇 ████ #语音编码 4篇 ████ #多模态模型 3篇 ███ #音频伪造检测 3篇 ███ #音频分离 2篇 ██ 📊 论文评分排行榜(137 篇,按分数降序) 排名 论文 评分 分档 主任务 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with T 9.4分 前10% #音视频理解 🥈 Joint Enhancement and Classification using Coupled Diff 9.3分 前10% #语音识别 🥉 Learning Tight Rejection Boundaries without Negatives f 9.3分 前10% #语音伪造检测 4. AVTrack: Audio-Visual Tracking in Human-centric Complex 9.3分 前10% #音视频理解 5. A Semantically Consistent Dataset for Data-Efficient Qu 9.2分 前10% #音频分离 6. SAM Audio: Segment Anything in Audio 9.2分 前10% #音频分离 7. MECAT: A Multi-Experts Constructed Benchmark for Fine-G 9.1分 前10% #音频理解 8. $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on 9.1分 前10% #语音交互 9. PhaseCoder: Microphone Geometry-Agnostic Spatial Audio 8.7分 前25% #空间音频 10. BAT: Better Audio Transformer Guided by Convex Gated Pr 8.6分 前25% #音频分类 11. SPEAR: A Unified SSL Framework for Learning Speech and 8.4分 前25% #音频理解 12. Dual-View Predictive Diffusion: Lightweight Speech Enha 8.4分 前25% #语音增强 13. Unlocking Cross-Modal Biosignal Synthesis: A Temporally 8.3分 前25% - 14. CoLA: Cross-Modal Low-rank Adaptation for Multimodal Do 8.3分 前25% #音视频理解 15. Speech-Audio Compositional Attacks on Multimodal LLMs a 8.3分 前25% #音频理解 16. MoST: Mixing Speech and Text with Modality-Aware Mixtur 8.2分 前25% - 17. IVQ: Structured and Lightweight Vector Quantization via 8.2分 前25% #音频编码 18. Spherical Procrustes Alignment for Reliable Medical Aud 8.2分 前25% #音频分类 19. Attend to Anything: Foundation Model for Unified Human 8.2分 前25% #音视频理解 20. VocSim A Training-free Benchmark for Zero-shot Content 8.2分 前25% #音频检索 21. JAEGER: Joint 3D Audio-Visual Grounding and Reasoning i 8.1分 前25% #声源定位 22. LALM-as-a-Judge: Benchmarking Large Audio-Language Mode 8.1分 前25% #语音交互 23. Pianist Transformer: Towards Expressive Piano Performan 8.1分 前25% #音乐生成 24. Simultaneous Speech-to-Speech Translation Without Align 8.0分 前25% #语音翻译 25. PHALAR: Phasors for Learned Musical Audio Representatio 8.0分 前25% #音乐生成 26. Optimality of FSQ Tokens for Continuous Diffusion for C 8.0分 前25% #语音合成 27. SonicMaster: Towards Controllable All-in-One Music Rest 8.0分 前25% #音频修复 28. Do Audio LLMs Listen or Read? Analyzing and Mitigating 8.0分 前25% #语音属性识别 29. Multiple Choice Learning of Low-Rank Adapters for Langu 8.0分 前25% #多模态模型 30. Bridging the Stability-Expressivity Gap: Synthetic Data 8.0分 前25% #语音合成 31. FutureOmni: Evaluating Future Forecasting from Omni-Mod 8.0分 前25% #音视频问答 32. Acoustic Interference: A New Paradigm Weaponizing Acous 8.0分 前25% #音频理解 33. ReGen: Hierarchical Multi-Prompt Representation Generat 8.0分 前25% #语音编码 34. DiscoForcing: A Unified Framework for Real-Time Audio-D 8.0分 前25% #音乐生成 35. DreamID-Omni: Unified Framework for Controllable Human- 8.0分 前25% #音视频生成 36. AgentSteerTTS: A Multi-Agent Closed-Loop Framework for 7.9分 前25% #语音合成 37. STAR-VAE: Structured Topology-Aware Regularization for 7.9分 前25% #音频生成 38. HyperPotter: Spell the Charm of High-Order Interactions 7.9分 前25% #音频伪造检测 39. T2AV-Compass: Towards Unified Evaluation for Text-to-Au 7.9分 前25% #音视频生成 40. Decoupling The “What” and “Where” With Polar Coordinate 7.8分 前25% #音乐生成 41. V-LynX: Token Interface Alignment for Video+X LLMs 7.8分 前25% #音视频问答 42. Ariadne’s Thread of LipSync: Unraveling Forgeries via I 7.8分 前25% #音视频理解 43. SONAR: Spectral‑Contrastive Audio Residuals for General 7.8分 前25% #语音伪造检测 44. TMD-Bench: A Multi-Level Evaluation Paradigm for Music– 7.7分 前25% #音视频生成 45. AudioMosaic: Contrastive Masked Audio Representation Le 7.7分 前25% #音频分类 46. BFCL Audio: An Audio Function Calling Evaluation for La 7.7分 前25% #语音交互 47. SALSA-V: Shortcut-Augmented Long-form Synchronized Audi 7.6分 前25% #音视频生成 48. BEAT: Tokenizing and Generating Symbolic Music by Unifo 7.6分 前25% #音乐生成 49. From Inpainting to Editing: Unlocking Robust Mask-Free 7.6分 前25% #扩散模型 50. Hearing Without Noticing? Attention-Aware Stealthy Blac 7.6分 前25% #语音识别 51. AVGen-Bench: A Task-Driven Benchmark for Multi-Granular 7.6分 前25% #音视频生成 52. Alethia: a Foundational Encoder for Voice Deepfakes 7.6分 前25% #语音伪造检测 53. AG-REPA: Causal Layer Selection for Representation Alig 7.6分 前25% #语音合成 54. AVI-Bench: Toward Human-like Audio-Visual Intelligence 7.6分 前25% #音视频理解 55. Two-dimensional quantization for geometry-aware audio c 7.6分 前25% #语音编码 56. Abstraction Induces the Brain Alignment of Language and 7.5分 前25% #语音编码 57. Self-Guidance: Enhancing Neural Codecs via Decoder Mani 7.5分 前25% #语音编码 58. OmniVideo-R1: Reinforcing Audio-visual Reasoning with Q 7.5分 前25% #音视频问答 59. Listening Through the Noise: Cauchy-Driven Diffusion Br 7.4分 前50% #音频修复 60. MoshiRAG: Asynchronous Knowledge Retrieval for Full-Dup 7.4分 前50% - 61. Omni-Perception Policy Optimization for Multimodal Emot 7.4分 前50% #音视频理解 62. video-SALMONN S: Memory-Enhanced Streaming Audio-Visual 7.3分 前50% #音视频问答 63. Group Cognition Learning: Making Everything Better Thro 7.3分 前50% #音视频理解 64. REST: Diffusion-based Real-time End-to-end Streaming Ta 7.3分 前50% #音视频生成 65. PhoStream: Benchmarking Real-World Streaming for Omnimo 7.3分 前50% #音视频问答 66. ProactiveLLM: Learning Active Interaction for Streaming 7.2分 前50% #语音识别 67. Stream RAG: Instant and Accurate Spoken Dialogue System 7.2分 前50% #流式处理 68. Probing Cross-modal Information Hubs in Audio-Visual LL 7.2分 前50% #音视频理解 69. Efficient Multi-modal Dataset Distillation via Analytic 7.2分 前50% #对比学习 70. Self-Supervised Flow Matching for Scalable Multi-Modal 7.2分 前50% #音视频生成 71. CoCoEmo: Composable and Controllable Human-Like Emotion 7.1分 前50% #语音合成 72. Scaling Transformers for End-to-End Discrete Audio Toke 7.1分 前50% #音频编码 73. Query-Based Asymmetric Modeling with Decoupled Input–Ou 7.1分 前50% #语音增强 74. OmniSIFT: Modality-Asymmetric Token Compression for Eff 7.1分 前50% #音视频问答 75. Sparse Autoencoders for Interpretable Emotion Control i 7.0分 前50% #语音合成 76. The Silent Thought: Modeling Internal Cognition in Full 7.0分 前50% #知识蒸馏 77. Hidden in Plain Tokens: Simply Robust, Gradient-Free Wa 7.0分 前50% #音频水印 78. Efficient Distributed MLLM Training with Cornstarch 7.0分 前50% #音视频理解 79. Reasoning LLM Improves Speaker Recognition in Long-form 7.0分 前50% - 80. Real-World Unsupervised Models Generalize to Predict Br 6.9分 前50% #模型评估 81. From Talking to Singing: A New Challenge for Audio-Visu 6.9分 前50% #音视频理解 82. OmniShow: Unifying Multimodal Conditions for Human-Obje 6.9分 前50% #音视频生成 83. E-VAds: An E-commerce Short Videos Understanding Benchm 6.9分 前50% #音视频问答 84. STARCaster: Spatio-Temporal AutoRegressive Video Diffus 6.8分 前50% #音视频生成 85. Zero-Shot Rankability: Revealing Latent Ordinal Structu 6.8分 前50% #音视频理解 86. An Exterior Method for Nonnegative Matrix Factorization 6.8分 前50% #音频分类 87. FoeGlass: Simple In-Context Learning Is Enough for Red 6.8分 前50% #语音伪造检测 88. Native Active Perception as Reasoning for Omni-Modal Un 6.8分 前50% #音视频理解 89. Unlocking Speech–Text Compositional Powers: Instruction 6.7分 前50% #语音交互 90. UltraLIF: Fully Differentiable Spiking Neural Networks 6.7分 前50% #音频分类 91. Towards Streaming Synchronized Spatial Audio Generation 6.6分 前50% #音视频生成 92. TextME: Bridging Unseen Modalities Through Text Descrip 6.6分 前50% - 93. Evaluating and Rewarding LALMs for Expressive Role-Play 6.6分 前50% #语音合成 94. PADS-TAL: Padding-Annealed Diffusion Sampling in Text-A 6.6分 前50% #音乐生成 95. ADEPT: RL-Aligned Agentic Decoding of Emotion via Evide 6.5分 前50% #语音情感识别 96. Universal Algorithm-Implicit Learning 6.5分 前50% #音频分类 97. SARSteer: Safeguarding Large Audio Language Models via 6.5分 前50% - 98. MetaPerch: Learning from metadata for bioacoustics foun 6.5分 前50% #音频分类 99. Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Mus 6.5分 前50% #音乐生成 100. CMI-RewardBench: Evaluating Music Reward Models with Co 6.4分 前50% #音乐生成 101. Multimodal Fact-Level Attribution for Verifiable Reason 6.4分 前50% #音频理解 102. MedMosaic: A Challenging Large Scale Benchmark of Diver 6.4分 前50% #音频理解 103. INFER: Learning Implicit Neural Frequency Response Fiel 6.4分 前50% #空间音频 104. Characterizing the Predictive Impact of Modalities with 6.4分 前50% - 105. PCRNet: Phase-aware Complex Refinement Network for EEG- 6.4分 前50% #实时处理 106. OmniFit: Bridging Modalities via Layer-Adaptive Token C 6.3分 前50% #音视频理解 107. EchoingPixels: Aliasing-Resistant Joint Token Reduction 6.3分 前50% #音视频理解 108. Quaternion Self-Attention with Shared Scores 6.3分 前50% #语音增强 109. LightAVSeg: Lightweight Audio-Visual Segmentation 6.3分 前50% #模型压缩 110. SURF: Separation via Unsupervised Remixing Flow 6.2分 前50% #语音分离 111. Neural-Inspired Modeling of Auditory Selection and Comp 6.2分 前50% #音视频语音分离 112. AuTAgent: A Reinforcement Learning Framework for Tool-A 6.2分 前50% #音频理解 113. Multimodal Latent Language Modeling with Next-Token Dif 6.1分 前50% #语音合成 114. FakeWorld 1.0: An Omni-modal Benchmark for Fake Media a 6.1分 前50% #可解释性 115. ConsMSA: Semantic Distribution Consistency Learning for 6.1分 前50% #多模态模型 116. MusicDET: Zero-Shot AI-Generated Music Detection 6.1分 前50% #音频伪造检测 117. Convex Low-resource Accent-Robust Language Detection in 6.0分 前50% #语音识别 118. NeuroCLUS: A Foundation Model with Functional Clusterin 6.0分 前50% #语音识别 119. Sparse Tokens Suffice: Jailbreaking Audio Language Mode 5.9分 前50% #模型剪枝 120. Scaling Behavior in Model Fine-tuning for Audio DeepFak 5.9分 前50% #音频伪造检测 121. Bioacoustic Geolocation: Species Sounds as Geographic S 5.8分 前50% #音频理解 122. AudioChat: Unified Audio Storytelling, Editing, and Und 5.8分 前50% #音频生成 123. Omni-Diffusion: Unified Multimodal Understanding and Ge 5.8分 前50% - 124. Robust Signal Enhancement via Fractional Detail Views a 5.7分 前50% #语音增强 125. Multimodal Fusion via Self-Consistent Task-Gradient Fie 5.5分 前50% #鲁棒性 126. NAACA: Training-Free NeuroAuditory Attentive Cognitive 5.5分 前50% #音频事件检测 127. Language Model Augmented Semi-Supervised Statistical In 5.4分 后50% #语音属性识别 128. MER-DG: Modality-Entropy Regularization for Multimodal 5.4分 后50% #音视频理解 129. Towards Understanding Modality Interaction in Multimoda 5.3分 后50% #音视频理解 130. Stable Spectral Copula Alignment for Robust Multimodal 5.2分 后50% #鲁棒性 131. Multimodal Meta-Verifier with Explicit Structured Recal 5.2分 后50% #多模态模型 132. WaveSSM: Multiscale State-Space Models for Non-stationa 4.8分 后50% #音频分类 133. Efficient, Property-Aligned Fan-Out Retrieval via RL-Co 4.7分 后50% #音乐检索 134. VIBE: Disentangling Social Dynamics via Kinematics-Info 4.6分 后50% - 135. UniFLoW: Universal Multi-Modal Federated LoRA Fine-Tuni 4.4分 后50% #音视频问答 136. Rethinking Attention in Spiking Transformers: Overcomin 3.6分 后50% #音频分类 137. PRIM:Cooperative Dynamic Token Compression for Efficien 3.6分 后50% #音视频理解 📋 论文列表 🥇 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions 🔥 9.4/10 | 前10% | #音视频理解 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 影响 0.9/1.5 | 开源 1.5/1.5 ...

2026-07-04 · 更新于 2026-09-04 · 108 min · 22980 words

Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

📄 不抄答案抄思路:把蒸馏钉在量化器之前 英文题目:Compressing Streaming Neural Audio Encoders via Latent-Space Distillation 一句话:面向端侧听写的常驻音频编码器,论文用冻结教师的量化前潜变量做无标签回归蒸馏,在 2.8 倍压缩下六组师生有五组保持在 1.9% 相对词错误率内,同容量独立训练则落后 3.9%,代价是阶段一波动大且缺少替代目标的直接消融。 标签:#语音识别 | #知识蒸馏 | #模型压缩 | #多语言 评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Prasanth Yadla:Apple Mohammad Samragh:Apple Dongseong Hwang:Apple Mingbin Xu:Apple Yuanyuan Zhang:Apple Chung-Cheng Chiu:Apple Yongqiang Wang:Apple Yuan Liu:Apple Zhen Huang:Apple Xiaodan Zhuang:Apple 💬 毒舌点评 把蒸馏目标钉在量化器前潜变量上的选择干净利落,一份配方同时覆盖离散与连续两种入模接口值得肯定。但全文对为何不直接蒸馏离散标识或解码器输出只有动机论述而无实证对照,阶段一中有一组学生反超教师的异常现象也未被真正解释清楚。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 786 words

Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition

📄 该归一的漏掉,不该归一的乱改:双形式识别如何管住数字 英文题目:Dual-Form ASR: Semantics-Aware Inverse Text Normalization for Chinese Speech Recognition 一句话:中文语音识别同时要忠实记录怎么说、又要得体呈现怎么写,论文用提示词切换的口语与书面配对监督加数字敏感的序列优化,在必需归一上做到 4.64% I-CER 与 94.85% 关键词 F1、在禁用保留上做到 95.18% 保留率,代价是训练数字覆盖仅 4.4% 且评测局限于离线小规模人工集。 标签:#语音识别 | #语音大模型 | #大语言模型 | #基准测试 评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fengrun Zhang:机构信息未在 arXiv HTML 中可靠披露 Li Fu:机构信息未在 arXiv HTML 中可靠披露 Wangjin Zhou:机构信息未在 arXiv HTML 中可靠披露 Lu Fan:机构信息未在 arXiv HTML 中可靠披露 Youzheng Wu:机构信息未在 arXiv HTML 中可靠披露 Xiaodong He:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把中文逆文本归一化从级联后处理收编为提示词可控的双形式联合建模,并用 Require-ITN 与 Forbid-ITN 把该归一和不该归一拆开考核,是切中部署痛点的设计。短板是书面目标中含阿拉伯数字的时长仅占4.4%,评测只靠772条与309条的单一SpeechIO衍生集,序列级奖励相对验证后监督的增益有限却包装成核心方法贡献。 ...

2026-09-04 · 更新于 2026-09-04 · 2 min · 296 words

Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR

📄 平均分好看,重度患者却依然听不懂:在 Jetson 上重算唇腭裂语音的公平账 英文题目:Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR 一句话:针对通用模型在唇腭裂不同严重度上系统性失效且云端不可靠的问题,论文用固定 280 条预算的严重度组合微调 Whisper-small 并在 Jetson 上做 FP16 端侧实测,以 NOMIMOSE 把汇总 WER 从 62.46% 降到 22.72% 且 RTF 保持 0.167 为证据,代价是重度组仍高达 54.96% 且仅在单一儿童语料上验证。 标签:#语音识别 | #迁移学习 | #低资源 评分:5.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Susmita Bhattacharjee:Indian Institute of Technology Guwahati, India Himashri Deka:Indian Institute of Technology Guwahati, India H.S. Shekhawat:Indian Institute of Technology Guwahati, India S.R.M. Prasanna:Indian Institute of Technology Dharwad, India 💬 毒舌点评 把严重度公平性与 Jetson 端侧实测放进同一闭环,直面了病理语音最痛的分布不均,选题切口准。短板是仅靠 280 条训练的单一儿童语料自证,重度词错误率仍在 55% 上下却被包装成均衡胜利,边缘侧也只是现成 Whisper 的半精度搬运。 ...

2026-09-04 · 更新于 2026-09-04 · 6 min · 1115 words

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

📄 暖启动之后,基座模型还记得什么:用隐状态几何找回被遗忘的人名 英文题目:Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions 一句话:针对暖启动语音大模型对命名实体等多词元词的系统性误识,论文用语音模型与自身基座模型的层间角度与幅度几何做门控,只在约 10% 高语义依赖位置做束搜索与概率插值,以约 1.4 倍贪心代价恢复束搜索 96.4% 命名实体增益并在两遍纠错中把平均命名实体错误率从 18.29% 降到 17.69% 且总体词错误率不恶化。 标签:#语音识别 | #多模态模型 | #参数高效微调 | #鲁棒性 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Chan-Jan Hsu:机构信息未在 arXiv HTML 中可靠披露 Jaeyeon Kim:机构信息未在 arXiv HTML 中可靠披露 Chao-Han Huck Yang:NVIDIA Shinji Watanabe:机构信息未在 arXiv HTML 中可靠披露 Hung-yi Lee:机构信息未在 arXiv HTML 中可靠披露 Carlos Busso:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把适配后残留的基座大语言模型变成免费校正器,用跨模型隐状态几何做门控,避免全局融合的幻觉灾难,想法干净。短板是所谓自校正高度依赖在 YODAS 上拟合的高斯门限与延续词元规则,换模型换领域就要重标定,完整端到端只验了一个 Phi-4-Multimodal,离通用解码器还差一口气。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 937 words

Summary of the ChinaVoices Challenge 2026: Data, Tasks, Baseline, and Methods

📄 十六种乡音一张卷:ChinaVoices 如何让方言识别与转写同场可比 英文题目:Summary of the ChinaVoices Challenge 2026: Data, Tasks, Baseline, and Methods 一句话:ChinaVoices 为 16 类中文方言建立辨识与识别共享音频的统一评测,用三级说话人无关划分与隐藏集复核给出可比起点,头部受限系统达到 83.19% 辨识准确率与 11.08% 转写字错率,代价是数据组合不受控而难以分离数据与方法增益。 标签:#语音识别 | #参数高效微调 | #低资源 | #基准测试 评分:6.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yujie Liao:机构信息未在 arXiv HTML 中可靠披露 Bingshen Mu:机构信息未在 arXiv HTML 中可靠披露 Shuiyuan Wang:机构信息未在 arXiv HTML 中可靠披露 Liumeng Xue:School of Intelligence Science and Technology, Nanjing University Hexin Liu:Nanyang Technological University Xian Shi:Independent Researcher Jie Hu:Beijing Huiting Technology Co., Ltd. Lei Xie:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于为长期各自为战的中文方言评测提供了统一的16方言双任务平台与隐藏集复核流程,分析扎实且对工业界有直接参考价值。短板在于科学增量有限,基线偏弱且未控制训练资源变量,导致排行榜更多反映工程堆料而非可归因的方法突破。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 764 words

The 2026 PNPL Competition: Word Classification and Efficient Cross-Subject Generalisation in LibriBrain100

📄 八十小时练一人,十分钟认新人:词分类竞赛把跨被试泛化变成硬指标 英文题目:The 2026 PNPL Competition: Word Classification and Efficient Cross-Subject Generalisation in LibriBrain100 一句话:论文以 LibriBrain100 的约 80 小时单被试深度与 32 人广度为底,用固定 50 词加 Moses 50 加 OVMI 三重评估组织深广双赛道,深度基线 BAcc@10 达 73.23% 而广度仅 42.96% 且 OVMI 低至 0.014,证明分钟级跨被试仍是最大鸿沟。 标签:#语音识别 | #自监督学习 | #低资源 | #基准测试 评分:7.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Francesco Mantegna:PNPL, Department of Engineering Science, University of Oxford, UK Gereon Elvers:PNPL, Department of Engineering Science, University of Oxford, UK Dulhan Jayalath:PNPL, Department of Engineering Science, University of Oxford, UK Gilad Landau:PNPL, Department of Engineering Science, University of Oxford, UK Tasha Kim:PNPL, Department of Engineering Science, University of Oxford, UK Miran Özdogan:PNPL, Department of Engineering Science, University of Oxford, UK Luisa Kurth:PNPL, Department of Engineering Science, University of Oxford, UK Teyun Kwon:PNPL, Department of Engineering Science, University of Oxford, UK SungJun Cho:PNPL, Department of Engineering Science, University of Oxford, UK;OHBA, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK Benjamin Ballyk:PNPL, Department of Engineering Science, University of Oxford, UK Alex Fung:PNPL, Department of Engineering Science, University of Oxford, UK;FMRIB, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK Anna Greer:PNPL, Department of Engineering Science, University of Oxford, UK Pratik Somaiya:PNPL, Department of Engineering Science, University of Oxford, UK Christian Herff:Maastricht University, The Netherlands Yorguin Mantilla Ramos:UNIQUE, Université de Montréal, Canada Hamza Abdelhedi:UNIQUE, Université de Montréal, Canada Karim Jerbi:UNIQUE, Université de Montréal, Canada;Mila–Quebec AI Institute, Canada Greg Farquhar:Google DeepMind, UKJoint first authors Brendan Shillingford:Google DeepMind, UKJoint first authors Mark Woolrich:OHBA, Oxford Centre for Integrative Neuroimaging, University of Oxford, UK Oiwi Parker Jones:PNPL, Department of Engineering Science, University of Oxford, UK 💬 毒舌点评 把非侵入语音解码从单被试刷分拉向临床最痛的跨被试少样本与零样本,课程设计与双轨评估颇有野心。短板是全篇零新模型,两个参考模型均为旧工作复用,宽松的 Top-10 指标叠加功能词为主的词表让绝对分数虚胖,OVMI 揭开后通信价值几乎归零。 ...

2026-09-04 · 更新于 2026-09-04 · 7 min · 1491 words

A Common Measure of Communication for Speech Brain-Computer Interfaces

📄 百分之百的正确,也可能只说出了百分之五:语音脑机接口需要一把共同的尺子 英文题目:A Common Measure of Communication for Speech Brain-Computer Interfaces 一句话:针对语音脑机接口词表各异导致准确率与词错误率不可比的问题,论文提出以参考分布加权的开放词汇互信息统一度量覆盖与保真,并在八个异构系统与三域选词实验中验证其排序与最高 16.3% 相对增益,代价是依赖均匀误差与词独立假设的标量近似。 标签:#语音识别 | #对比学习 | #模型评估 | #低资源 评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Dulhan Jayalath:Neural Processing Lab (PNPL), University of Oxford Benjamin Ballyk:Neural Processing Lab (PNPL), University of Oxford Oiwi Parker Jones:Neural Processing Lab (PNPL), University of Oxford 💬 毒舌点评 把词表覆盖率与词表内保真度乘进同一个互信息量,让侵入式尝试言语与非侵入感知语音终于能在同一标尺下对账,这是该领域久缺的诚实度量。代价是历史比较几乎全靠均匀误差对称信道与 \(P=1-\mathrm{WER}\) 换算硬撑,最脆弱的信道建模恰恰被平均掉了。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 730 words

AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking

📄 别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正 英文题目:AVERT: Audio-Verified Adjudication for Spoken Dialogue State Tracking 一句话:口语对话状态跟踪中实体误识会跨轮污染累积状态,AVERT 冻结基座与文本编辑器、只训练一个音频验证器对候选值打分再做投票补全替换,在 SpokenWOZ 上从 38.34 提升到 40.13 联合准确率,代价是双解码器与字面佐证覆盖有限。 标签:#语音识别 | #多模态模型 | #参数高效微调 评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.5/1.5 👥 作者与机构 Chunggi Lee:Harvard University;Cambridge, Massachusetts, USA Hanspeter Pfister:Harvard University;Cambridge, Massachusetts, USA 💬 毒舌点评 把音频从生成器降级为验尸官是聪明的偷懒,用两倍解码器参数换取长对话稳定性也算诚实交易;可惜字面首词匹配的门控把近八成错误直接判了死刑,验证器那点增益更像给跨轮投票打了一针弱效强心剂。 📌 核心摘要 口语对话状态跟踪需要从含噪语音中恢复累积槽值状态,实体名与数字的识别错误会在多轮中持续污染后续预测。AVERT保持基座语音模型与文本编辑器冻结,新增音频条件验证器对已形成候选值逐个打分,再与跨轮加权一致性及词面佐证门控结合。投票、补全与替换三个算子分别处理不一致、遗漏和音频不支持三类可恢复错误,且每个算子仅在开发集选定的槽子集上启用。在SpokenWOZ因果评测下,管线从基座的33.04联合目标准确率提升到编辑器的38.34,再到AVERT的40.13,超过读取完整语音历史的1B对照系统的39.32。该设计使音频上下文不随轮数增长,相对增益随对话变长而放大。局限在于字面佐证覆盖率低、仅验证1B主干且槽选择依赖目标域开发集。 🔗 开源与复现资源 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:SpokenWOZ测试集用于评估,Loquacious与Fisher用于ASR预训练,论文说明SpokenWOZ与Loquacious为开放获取而Fisher需要LDC许可,论文中未提及数据集下载链接 Demo:论文中未提及 复现材料:基座模型RR采用WavLM-large编码器接入冻结的OLMo-2-1B并搭配rank-16 LoRA微调。第1阶段训练占用4张NVIDIA A100 GPU。第2阶段微调与验证器训练各占用1张GPU。验证器每槽每轮采样8个候选值并以focal二元交叉熵优化。增加阈值为0.3。论文中未提及检查点下载链接 论文中引用的开源项目:提及WavLM-large,OLMo-2-1B,SpokenWOZ,Loquacious与Fisher等但论文中未提及下载链接 资源可达性验证:未发现可验证的官方 HTTPS 资源 URL。 🧭 深度解读 语音助手最怕的不是听不清,而是记错还不改 想象你对语音助手说从剑桥到莱斯特,登记在詹姆斯名下。它把莱斯特听成近音词,把詹姆斯听成杰伊。这个错误不会只停在这一轮,下一轮它会带着错误的地名继续订票,再下一轮还会用错名字取票。对刚入门的同学,关键是理解口语对话的累积性:每一轮的状态都是历史槽值的并集,1 次实体误识会被后续所有轮次继承。 ...

2026-09-03 · 更新于 2026-09-04 · 3 min · 590 words

Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases

📄 一个人、一套配方、七种适配器:重度构音障碍识别该押注哪种微调 英文题目:Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases 一句话:在同一位匈牙利语重度构音障碍说话人和固定小数据配方下比较七种低秩适配器与两种语音基座,发现只有标准低秩家族真正有效且内部打成平手,于是选择更简单省时的标准低秩作为每患者部署默认,并用注册时长与适配位置阶梯标定临床代价。 标签:#语音识别 | #参数高效微调 | #低资源 | #医疗音频 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.4/0.5 | 工程/实践 1/1.5 👥 作者与机构 Bernard Muller:The Scott-Morgan Foundation, Torquay, United Kingdom László Tóth:Institute of Informatics, University of Szeged, Szeged, Hungary LaVonne Roberts:The Scott-Morgan Foundation, Torquay, United Kingdom 💬 毒舌点评 把每患者独立适配器这一生产设定做成控制变量的诚实对照值得肯定,还敢把NeMo崩溃和匈牙利语热启动回退写成命名小节。但证据厚度只有单说话人单语言单病因,核心选型结论建立在复用评测集和单样本区间上,跨变体推广更像临床备忘而非可泛化结论。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 906 words