ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。
针对可修订流式语音到文本翻译中可见草稿会奖励随后被撤回内容的问题,论文提出持续交付优化,用留存前缀的参考覆盖累积中间奖励并单独计最终质量,在 7.49 小时 FLEURS 适配下相对 History-SFT 降低平均与 P90 终结感知延迟 10.8% 与 11.3% 并降低归一化擦除 15.8%,代价是需要完整轨迹回放计算回报且中间奖励依赖词面覆盖。
针对串行先想后说导致长时间无声等待的问题,该工作用推理主路加轻量报幕支路的异步结构,在保持串行推理问答精度基本相当的同时,把用户可感知的静音大幅压低,代价是需要额外的报幕生成与动态调度。
MECT 针对全监督说话人确认中卷积局部建模与 Transformer 全局建模难以兼顾的问题,把四种混合专家结构放进 Transformer 前馈位置,用帧级稠密 4 专家在 VoxCeleb 上取得 minDCF 0.012、0.026、0.048 的报告结果,代价是参数从 9.40M 增至 9.57M 并需因果重训才支持 100 ms 流式。
针对级联对话中上游大模型流式输出与下游语音合成之间的非标准词歧义,StreamTN 用基于 Qwen3-0.6B 的双轨延迟架构做增量规范化,在 4 帧延迟下报告 Micro-F1 为 0.8937 并以 213 ms 的首包延迟换取流式可用性,代价是复杂数理化表达式仍明显更差且更大延迟才能继续提升精度。
AVTR-1 用 153M 参数的双音频条件流匹配模型生成头部与表情动作,再用常开的渲染与调度循环把外部语音智能体的可变语音片段变成同步音视频,并用延迟分解与 R-DGG 验证了可交互性与说话人依赖,代价是仍依赖外部语音智能体与固定的窗口节拍。
针对全双工语音交互中打断、回切与外部工具调用难以共存的问题,该工作用并行智能体文本流与函数调用流加流式 TTS 与 RNN-T 转写的统一架构实现边听边说边调工具,最强证据是工具选择 F1 达 82.5% 且打断后恢复质量 4.33/5,代价是参数准确率与端到端执行仍明显落后且工具执行期间不支持打断。
论文研究视频字幕与语音转写在流式条件下如何决定每写一个词可见多少源,用单参数幂律窗口替代固定等待,在三个公开集上以 29M 解码器在低延迟处保持质量并给出结构化不偷看证明,代价是长度估计与单轮运行噪声仍需复核。
论文把连续音频监护形式化为四态打断或静默决策,用两个特殊词嵌入解码,在 ESC-50 上报告 99.6% 中断 F1 与 100.0% 去重召回,在未训练的 Epic-Sounds 上保持 96.7% 起始召回,代价是嘈杂域静默召回仅 10.1% 与平均 3.5 秒流式延迟。
Voice-Light 研究全双工级联语音交互中的轮次判断与重叠处理,用共享流式识别编码器的因果适配器加可逆混合控制器与私有推测生成,在 1673 个静音候选的锁定测试中学习策略仅获 12.53% 召回而保留混合控制器,在 36 轮真机麦克风案例中取得 758 毫秒中位响应但以 800 毫秒超时兜底。
针对全双工语音模型工具调用弱的问题,论文用前端判何时委派、后端做多轮工具调用再预填回前端复述的办法,在单轮调用召回 92%-97% 与多域语音代理任务上取得可比效果,代价是打断率偏高与合成数据带来的识别与暂停处理退化。
针对交错式流式语音识别大模型中外部强制对齐与模型自身对齐不一致的问题,该文用冻结非流式教师的文本音频注意力经置信度回退和单调搜索构造学生训练序列,并叠加 logit 与隐状态蒸馏,以聚合错误率从 9.35% 降至 7.80% 为最强证据,代价是相同蒸馏配置下闪烁高于强制对齐对照。
论文把电话诈骗检测写成弱监督增量打分问题,用冻结语音编码器加有界窗口循环建模与聚合器实现每 2 秒更新,在受控英文合成基准上报告终局 ROC-AUC 约 0.9953,而消融显示循环上下文是主要贡献且全局模型终局数值更强。
论文冻结分离主干只换状态机制,用 22 组启发式更新测出稳定性-可塑性前沿,再用闭环元训练的 41k 参数锚定快权重在严重失配下达 10.9 dB 并在 30 s 缺席后保留 6.2 dB,代价是匹配短句略低于静态注册且依赖通道增强覆盖。
论文把只检测持续在场主讲人的前景语音检测形式化为免注册逐帧二分类,用前景标签不变加竞争说话人混合的自动监督 recipe 让轻量流式 Mamba 在受控混合与真实远场上压低背景误报,同时在常规检测上保持可用,代价是目标不再占优与强语音形掩蔽下召回下降。
针对电子喉语音与健康语音域失配且大模型难流式部署的问题,论文用冻结自监督模型的离散音素目标加电子喉微调识别模型的瓶颈特征做三阶段渐进蒸馏,最好的 Mel-Conformer 把电子喉词错误率从最强零样本基线的 39.3% 降到 21.2%,代价是仍需平行语料做对齐且只用识别探测验证,ONNX 单核实时率为 0.30。
针对延迟流建模中结构延迟不能代表用户等待且固定对齐迫使模型晚输出的问题,论文引入词级实测延迟并在单点用准确率加延迟联合奖励做 GRPO 后训练,在 80 ms 处把词错误率相对降低 30.8% 且在 480 ms 处把中位延迟从 1.17s 降到 1.04s。
针对全双工语音到语音模型缺用户侧流式转写的问题,论文在复用同一解码器大模型主干上并行增加轻量 ASR 头并用帧级强制对齐训练,在双工框架内报告平均 WER 为 10.21%,独立识别配置报告为 7.73%,代价是平滑轮转延迟上升与部分打断指标未占优。
Realtime-Venus 用两个 9B 前端分别处理音视频与纯音频全双工对话,用双环运行时把即时说话与后台推理工具执行解耦,最强证据是 Omni 在六项视频基准领先与 Audio 在 MMAU 等四项音频问答领先,代价是打断响应与参数准确率仍落后及委派判断存在漏委派与过度委派的权衡。