会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
论文解读

谁来打标签、谁来稳住训练:半监督联邦语音识别的在线教师与服务器锚点

该文研究服务器只有少量标注种子、客户端只有无标注语音的半监督联邦 ASR,用每客户端在线教师打伪标签加轮间服务器有监督更新做锚点,最强证据是稳定后在线教师在域内和多数跨域上持平或超过全局教师,代价是必须把服务器增强强度和批量调进稳定区间否则发散。

 · 约 20 分钟 · 9640 字 阅读 →
论文解读

不换模型换前端:儿童语音的时间包络与可学习归一化如何补上 Whisper

针对儿童语音声学变异大而 Whisper 固定对数梅尔前端丢失连续包络结构的问题,该文用时域子带希尔伯特包络加可学习逐通道能量归一化替换前端,在相同 Whisper-small 微调下把 MyST 清洗测试集词错误率从 13.16% 降到 11.08%,代价是删除错误小幅上升且低频保留原因仍待验证。

 · 约 17 分钟 · 8261 字 阅读 →
论文解读

暂停更安静却漂移更大:语音编码器表示漂移与任务损失的错位

该研究冻结八个语音编码器并在整段、仅语音、仅暂停三种放置下加入非语音干扰,用余弦漂移与四项下游任务损失对比,显示整段干扰下漂移可按声音排序任务损失,而安静到中等强度下暂停干扰漂移更大但语音干扰任务损失更大,且低于估计背景的干扰已可达到重复录制级别的漂移。

 · 约 23 分钟 · 11094 字 阅读 →
论文解读

同形异读被折叠时:用注音绑定把读音留存在监督目标里

针对日语音形多对多导致正字法监督折叠词位读音的问题,论文把目标细化为 span 绑定的 ruby 序列并用 Qwen3-ASR 加 mora 级 CTC 联合训练,在五项基准上以加权 Kana CER 3.75% 改善读音直读而字形转写未退化,但自发语音与罕见词形仍是主要瓶颈。

 · 约 20 分钟 · 9862 字 阅读 →
论文解读

两人对话先分清谁在说,再听懂整场在说什么:第二届 MLC-SLM 的多任务设定

该挑战用约 2100 小时 14 语言双人对话同时考 diarization 加识别与整场理解,基线显示长时说话人对齐与语义推理是主要瓶颈,而参赛系统靠域内 diarization 适配与音频依赖监督把误差与准确率推到新水平。

 · 约 20 分钟 · 9734 字 阅读 →
论文解读

先转写再翻译为何在训练时作弊:用联合奖励把生成的前缀拉回推理分布

针对转写链式思维在有监督微调中用参考转写做前缀而推理用自生成转写的不一致,论文用 GRPO 同时奖励自生成转写和以其为条件的翻译,在相同 CoVoST 2 训练样本下 CoT GRPO 在两套测试上 BLEU 领先并把 WER 相对降低 8.8% 和 7.2%,代价是需要多样本 rollout 和显式调 ASR 权重。

 · 约 7 分钟 · 3185 字 阅读 →
论文解读

解码器不敢再自由发挥:用不确定性路由的稀疏编辑把语音识别拉回声学证据

针对注意力编码器解码器语音基座模型在无语音与弱证据下产生无声学支撑文本的问题,AURA 冻结原模型并只编辑解码器交叉注意力的少量头输出,用交叉注意力不确定性做逐词门控,在非语音上把幻觉率从 89.18% 降到 1.94%,代价是训练轮数增加后干净语音词错误率上升的权衡。

 · 更新于 2026-09-24 · 约 19 分钟 · 9337 字 阅读 →
论文解读

不拼向量而是换切分:用三种编码器视角训练同一个解码器

针对离散词元依赖单一编码器切分的问题,该文把三个固定自监督编码器当作同一句话的多种分词器来训练一个共享大语言模型解码器,在保持单编码器推理成本下把 WavLM 视角做到 LibriSpeech 干净集 3.30% 与其他集 8.13%,再用三路 ROVER 投票做到 3.03% 和 7.38%,代价是训练量变为三倍且泛化仍受限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8073 字 阅读 →
论文解读

约旦方言低资源语音转写:用自监督预训练加噪声学生训练吃掉未标注语音

针对约旦方言标注语音稀缺问题,论文用 Wav2Vec 2.0 自监督表示做起点,再以五轮噪声学生训练迭代利用未标注与增强语音,在 12.5 小时标注加五批各 2.5 小时未标注条件下把词错误率降到 51%,代价是多轮大模型迭代需要双卡 83 小时级训练开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8017 字 阅读 →
论文解读

联邦多语语音大模型:编码器与解码器谁更怕客户端漂移

该研究在 316 个按说话人划分的多语联邦客户端上比较四种语音大模型与 FedAvg 和 FedProx,最强证据是 Whisper 加 EuroLLM 在解冻编码器并调低其学习率时取得 0.1170 词错率,而 FedProx 只在该多语解码器上有效,代价是联邦仍远差于集中训练且对编码器预训练类型高度敏感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9442 字 阅读 →
论文解读

长尾之下适度再平衡:平方根采样为何优于自然与均匀采样

针对 16 类非言语发声联合转写任务,该工作用跨数据集标签归一加平方根采样后接均匀微调,在官方评测得到 63.86 分排名第四,代价是第二阶段在本地验证集上从 66.25 分回落到 58.91 分且多数类别 F1 下降。

 · 更新于 2026-09-24 · 约 18 分钟 · 8547 字 阅读 →
论文解读

长对话问答不缺音频而缺取舍:按问题动态分配文本与声学证据

针对多语言双人长对话口语问答中不同问题依赖不同证据的问题,该工作用带说话人时间戳的转写做主干、按问题动态挂接局部或全局音频,开发集任务二达到 94.84% 准确率,但消融无法完全分离标签质量与证据分配的因果。

 · 更新于 2026-09-24 · 约 20 分钟 · 9904 字 阅读 →
论文解读

乐观的录音与悲观的转写:Vimarsha 如何同时校正印度语 ASR 评测的两端偏差

针对印度 22 种官方语言语音识别评测中干净音频导致分数虚高与单参考转写导致有效变体被误罚的问题,Vimarsha 用 43.3 小时受控田野录音加 56.1 小时难例野外音频与每词平均 1.5 个可接受变体的格状参考进行评测,发现 10 个主流模型在野外条件下排名大幅变动且最佳系统词错误率从约 10–15% 升至 27–34%,代价是多格评估与人工校验成本 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9829 字 阅读 →
论文解读

词错率好看却漏掉关键信息:口音对话中实体与填充词如何被找回

针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。

 · 更新于 2026-09-24 · 约 19 分钟 · 9498 字 阅读 →
论文解读

边听边说还要调工具:NemotronLabs VoiceChat 如何把全双工对话与函数调用装进一个流式系统

针对全双工语音交互中打断、回切与外部工具调用难以共存的问题,该工作用并行智能体文本流与函数调用流加流式 TTS 与 RNN-T 转写的统一架构实现边听边说边调工具,最强证据是工具选择 F1 达 82.5% 且打断后恢复质量 4.33/5,代价是参数准确率与端到端执行仍明显落后且工具执行期间不支持打断。

 · 更新于 2026-09-24 · 约 25 分钟 · 12382 字 阅读 →
论文解读

少看一点反而写得更好:用一个旋钮控制流式解码器能看多少

论文研究视频字幕与语音转写在流式条件下如何决定每写一个词可见多少源,用单参数幂律窗口替代固定等待,在三个公开集上以 29M 解码器在低延迟处保持质量并给出结构化不偷看证明,代价是长度估计与单轮运行噪声仍需复核。

 · 更新于 2026-09-24 · 约 16 分钟 · 7597 字 阅读 →
论文解读

先分清谁在说话、再转写说什么:Transsion 级联式多语说话人归属转写系统解读

针对无预先切分的多语会话转写任务,该工作用说话人日志、长语音识别与 CTC 对齐加融合的级联路线,在官方评测集上报告 tcpMER 为 15.41% 获得第二名,代价是三模块串行依赖与多阶段微调成本。

 · 更新于 2026-09-24 · 约 18 分钟 · 8539 字 阅读 →
论文解读

在低秩优化器里加旧任务曲率:CGaLore 如何让 ASR 基座模型记得住又学得进

针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。

 · 更新于 2026-09-24 · 约 19 分钟 · 9335 字 阅读 →
论文解读

词错率低不等于意思对:用人偏好重测 WER、CER 与语义指标

该文用 1000 组英文转写偏好标注比较词错率、字错率与多配置语义指标,发现词错率与人判断一致度最低而最优语义距离略优但未显著超过字错率,因此主张默认报告字错率并辅以语义指标。

 · 更新于 2026-09-24 · 约 16 分钟 · 7928 字 阅读 →