会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
论文解读

只调时长就能学会重读吗:EmphTTS 用强化学习对齐时长预测器

针对词级重读控制难的问题,EmphTTS 冻结已微调的 F5-TTS 主体、只用带重读定位奖励的 GRPO 优化时长预测器,在 TinyStress-15k 上取得 StressLM F1 0.75 的最佳客观重读效果,但整体可懂度和说话人相似度仍明显低于大规模基线。

 · 约 20 分钟 · 9899 字 阅读 →
论文解读

听不清细节的音频大模型:用可验证的合成音频一轮轮自己出题

针对音频语言模型能懂语义却听不准声学细节的问题,EvoAudio 用当前模型的弱项决定下一轮练什么、工具合成波形保证答案可验证、GRPO 训练加留出集晋级做 13 轮递归进化,最强证据是五个不同骨干平均最高且总体最高提升 6.3 点,代价是工具覆盖不到的语义文化推理提升有限且后期收益变平。

 · 约 19 分钟 · 9393 字 阅读 →
论文解读

不是越不像越好:把遗忘相似度锚定到陌生人水平的说话人遗忘

针对零样本语音合成中退出说话人仍可被画廊检索重新识别的问题,GUARD 在冻结主干上用门控加逐层激活 steering 并以生成后奖励把遗忘相似度推向人群冒名者水平,在 CosyVoice2 上把遗忘相似度从 0.541 降到 0.103、150 人画廊重识别从 73.5% 降到 0.5%,代价是保留集与可懂度基本不变但新增门控与奖励调参依赖。

 · 约 18 分钟 · 8712 字 阅读 →
论文解读

只拼模态不够:用静态属性与动态事件补上物理监督

针对通用多模态只学语义对齐而缺物理量监督的问题,OmniFysics-Nano-V2 用静态属性 grounding 与动态视听事件对齐的双分支数据加两阶段 GRPO,在 21 项中 17 项领先同类全模态模型,代价是依赖商用大模型标注与多阶段训练流程。

 · 约 22 分钟 · 10584 字 阅读 →
论文解读

可见不等于送达:只给留存下来的译文记功的流式语音翻译

针对可修订流式语音到文本翻译中可见草稿会奖励随后被撤回内容的问题,论文提出持续交付优化,用留存前缀的参考覆盖累积中间奖励并单独计最终质量,在 7.49 小时 FLEURS 适配下相对 History-SFT 降低平均与 P90 终结感知延迟 10.8% 与 11.3% 并降低归一化擦除 15.8%,代价是需要完整轨迹回放计算回报且中间奖励依赖词面覆盖。

 · 约 17 分钟 · 8029 字 阅读 →
论文解读

从能说话到能办事:Qwen-Audio-3.1-Realtime 如何把推理、执行与说话时机分开训练

该工作把实时语音交互拆为思考、行动与说话协调三层,用文本教师蒸馏加可执行环境强化学习提升多轮约束跟踪与工具执行,在半双工语音版 τ-Voice 上总成功率从 78.4% 升至 82.0%,代价是部分流畅性与延迟指标并未同步最优且长时程口语任务仍未验证。

 · 约 23 分钟 · 11201 字 阅读 →
论文解读

先转写再翻译为何在训练时作弊:用联合奖励把生成的前缀拉回推理分布

针对转写链式思维在有监督微调中用参考转写做前缀而推理用自生成转写的不一致,论文用 GRPO 同时奖励自生成转写和以其为条件的翻译,在相同 CoVoST 2 训练样本下 CoT GRPO 在两套测试上 BLEU 领先并把 WER 相对降低 8.8% 和 7.2%,代价是需要多样本 rollout 和显式调 ASR 权重。

 · 约 7 分钟 · 3185 字 阅读 →
论文解读

固定窗长不够用:用探针状态让强化学习逐次决定听多久

针对反无人机音频定位中固定窗长在声学证据与时间对应延迟之间的矛盾,该工作用最小探针提取无标签声学状态并以 PPO 同时选择窗口长度与 Mamba 时间特征权重,在 MMAUD-V1 上以 0.23 s 平均窗口取得 0.30 m 误差与 0.136 s 延迟,代价是需要三阶段训练与跟踪反馈维持。

 · 更新于 2026-09-24 · 约 21 分钟 · 10282 字 阅读 →
论文解读

用可恢复的声音档案让合成与理解互相验算:CycleSpeech 的双向对齐

CycleSpeech 以结构化声音档案为共享可验证目标,先联合监督微调再用 CycleGRPO 交替优化合成与理解,在中英文指令匹配上相对基座提升 4.50 和 10.06 个百分点,代价是需要 20,046 条对齐语料与多步采样奖励计算。

 · 更新于 2026-09-24 · 约 22 分钟 · 10988 字 阅读 →
论文解读

先听清再推理:用声音证据校准无标签测试时更新

论文先量化大音频语言模型对声音的依赖再提出感知 grounded 的测试时强化学习,用多数票伪标签乘以声学支撑权重更新策略,在 MMAR 上最高提升 4.6 个点、在 MMAU 上最高提升 4.9 个点,代价是每步需额外做遮蔽前向与分组投票计算。

 · 更新于 2026-09-24 · 约 20 分钟 · 9639 字 阅读 →
论文解读

先说一遍再改一遍:让语音模型听见自己的草稿并真正改好

针对复杂风格指令一次合成难以兼顾音高、语速与情感的问题,该工作用同一大音频语言模型做草稿生成加文本批评加二次精修,并以组相对策略优化训练精修能力,在 InstructTTSEval 上精修输出相对零样本平均风格一致性提升约 6.5% 至 7.2%,代价是两遍推理与奖励建模依赖。

 · 更新于 2026-09-24 · 约 19 分钟 · 9272 字 阅读 →
论文解读

缺哪条补哪条:用验证器把乐谱约束变成可分级的训练信号

针对多约束联合满足急剧下降的问题,论文用八族程序化验证器构造基准并以硬门加分级奖励做 GRPO,把 Qwen3-4B 在 Mixed 上的全满足率从 0.160 提升到 0.807,代价是奖励与评测共用同一套验证器且只度量合规不度量听感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9241 字 阅读 →
论文解读

不用转写也能对话:用合成音视频同时练理解、判分与强化

针对原生音视频直接对话缺数据、难评测的问题,该工作用多智能体合成对话同时做评测集与强化训练语料,报告在合成集从 0.465 到 0.652、在真人实拍集从 0.402 到 0.632 的提升,代价是回复变短且效率与风格奖励之间存在权衡。

 · 更新于 2026-09-24 · 约 22 分钟 · 10775 字 阅读 →
论文解读

总体偏好裹挟维度打分:直播语音评测如何把四个韵律维度拆开判

针对直播带货语音合成中流畅度、语调、情感和直播感需要分维度评价的问题,论文先把 Gemini 的成对判断蒸馏为开源的 Live-ProsodyJudge,再用去掉总体结论、按维度掩码与分段归因的 Decoupled 版本解决维度塌缩,十次平衡顺序采样的 LPJ 在四个主测试集点准确率高于单次 Gemini 调用,而 D-LPJ 的混合维度一致率达到 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9797 字 阅读 →
论文解读

先互相增强语义再记忆历史:CTAN 用循环一致与时间门控做声音导航

针对深度与双耳音频简单拼接会丢失几何语义关联的问题,CTAN 用双向重构交叉注意力做主动语义增强、用门控时间记忆桥接听觉死区,在 Replica 与 Matterport3D 未见环境中相对 SoundSpaces 基线提升了未听过声音下的成功率与路径效率,但消融显示各模块贡献与听觉死区恢复能力仍受场景规模与声音泛化条件限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8723 字 阅读 →
论文解读

名义延迟不够用:用实测词延迟联合奖励重排流式识别的输出时机

针对延迟流建模中结构延迟不能代表用户等待且固定对齐迫使模型晚输出的问题,论文引入词级实测延迟并在单点用准确率加延迟联合奖励做 GRPO 后训练,在 80 ms 处把词错误率相对降低 30.8% 且在 480 ms 处把中位延迟从 1.17s 降到 1.04s。

 · 更新于 2026-09-24 · 约 17 分钟 · 8503 字 阅读 →
论文解读

看不清就撞一下再改路:TDGP 用令牌融合定方向、用碰撞删边改路径

针对被动视觉缺失与误导导致的音频视觉导航失败,论文用高层 Transformer 令牌融合选 3×3 局部目标、低层碰撞惩罚图规划转原子动作,在 Replica 与 MP3D 的听过与未听过电话声划分上报告了路径效率与成功率提升,但碰撞图依赖静态假设且仍受深度噪声与仿真条件限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8733 字 阅读 →
论文解读

听不见还硬说:用冻结声学裁判在训练时管住语音大模型的插入幻觉

针对语音大模型强化学习只看文本词错率而放任语言先验补词的问题,该研究在训练期叠加冻结字符级 CTC 声学裁判做组内奖励,用一次贪心解码在 AMI 远场会议上把插入错误降低 22.3% 至 28.3%,代价是少量删除错误上升且只验证了单个 7B 策略与 0.3B 裁判组合。

 · 更新于 2026-09-24 · 约 22 分钟 · 10827 字 阅读 →
论文解读

先看到的不等于已证实:用未来可验声明管住流式音视记忆

针对流式中视觉先成熟、音频后到达导致的过早跨模态承诺问题,OST 用未来声明加到期验证加谱系回撤加回答门控组织记忆,在冻结 Qwen3-Omni-30B-A3B 上提升流式与音视基准并在诊断集上降低视觉诱发的听觉幻觉,但重写对比与多阶段训练带来额外推理与训练代价。

 · 更新于 2026-09-24 · 约 24 分钟 · 11690 字 阅读 →