ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
该文研究服务器只有少量标注种子、客户端只有无标注语音的半监督联邦 ASR,用每客户端在线教师打伪标签加轮间服务器有监督更新做锚点,最强证据是稳定后在线教师在域内和多数跨域上持平或超过全局教师,代价是必须把服务器增强强度和批量调进稳定区间否则发散。
针对儿童语音声学变异大而 Whisper 固定对数梅尔前端丢失连续包络结构的问题,该文用时域子带希尔伯特包络加可学习逐通道能量归一化替换前端,在相同 Whisper-small 微调下把 MyST 清洗测试集词错误率从 13.16% 降到 11.08%,代价是删除错误小幅上升且低频保留原因仍待验证。
该研究冻结八个语音编码器并在整段、仅语音、仅暂停三种放置下加入非语音干扰,用余弦漂移与四项下游任务损失对比,显示整段干扰下漂移可按声音排序任务损失,而安静到中等强度下暂停干扰漂移更大但语音干扰任务损失更大,且低于估计背景的干扰已可达到重复录制级别的漂移。
针对日语音形多对多导致正字法监督折叠词位读音的问题,论文把目标细化为 span 绑定的 ruby 序列并用 Qwen3-ASR 加 mora 级 CTC 联合训练,在五项基准上以加权 Kana CER 3.75% 改善读音直读而字形转写未退化,但自发语音与罕见词形仍是主要瓶颈。
该挑战用约 2100 小时 14 语言双人对话同时考 diarization 加识别与整场理解,基线显示长时说话人对齐与语义推理是主要瓶颈,而参赛系统靠域内 diarization 适配与音频依赖监督把误差与准确率推到新水平。
针对转写链式思维在有监督微调中用参考转写做前缀而推理用自生成转写的不一致,论文用 GRPO 同时奖励自生成转写和以其为条件的翻译,在相同 CoVoST 2 训练样本下 CoT GRPO 在两套测试上 BLEU 领先并把 WER 相对降低 8.8% 和 7.2%,代价是需要多样本 rollout 和显式调 ASR 权重。
针对注意力编码器解码器语音基座模型在无语音与弱证据下产生无声学支撑文本的问题,AURA 冻结原模型并只编辑解码器交叉注意力的少量头输出,用交叉注意力不确定性做逐词门控,在非语音上把幻觉率从 89.18% 降到 1.94%,代价是训练轮数增加后干净语音词错误率上升的权衡。
针对离散词元依赖单一编码器切分的问题,该文把三个固定自监督编码器当作同一句话的多种分词器来训练一个共享大语言模型解码器,在保持单编码器推理成本下把 WavLM 视角做到 LibriSpeech 干净集 3.30% 与其他集 8.13%,再用三路 ROVER 投票做到 3.03% 和 7.38%,代价是训练量变为三倍且泛化仍受限。
针对约旦方言标注语音稀缺问题,论文用 Wav2Vec 2.0 自监督表示做起点,再以五轮噪声学生训练迭代利用未标注与增强语音,在 12.5 小时标注加五批各 2.5 小时未标注条件下把词错误率降到 51%,代价是多轮大模型迭代需要双卡 83 小时级训练开销。
该研究在 316 个按说话人划分的多语联邦客户端上比较四种语音大模型与 FedAvg 和 FedProx,最强证据是 Whisper 加 EuroLLM 在解冻编码器并调低其学习率时取得 0.1170 词错率,而 FedProx 只在该多语解码器上有效,代价是联邦仍远差于集中训练且对编码器预训练类型高度敏感。
针对 16 类非言语发声联合转写任务,该工作用跨数据集标签归一加平方根采样后接均匀微调,在官方评测得到 63.86 分排名第四,代价是第二阶段在本地验证集上从 66.25 分回落到 58.91 分且多数类别 F1 下降。
针对多语言双人长对话口语问答中不同问题依赖不同证据的问题,该工作用带说话人时间戳的转写做主干、按问题动态挂接局部或全局音频,开发集任务二达到 94.84% 准确率,但消融无法完全分离标签质量与证据分配的因果。
针对印度 22 种官方语言语音识别评测中干净音频导致分数虚高与单参考转写导致有效变体被误罚的问题,Vimarsha 用 43.3 小时受控田野录音加 56.1 小时难例野外音频与每词平均 1.5 个可接受变体的格状参考进行评测,发现 10 个主流模型在野外条件下排名大幅变动且最佳系统词错误率从约 10–15% 升至 27–34%,代价是多格评估与人工校验成本 …
针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。
针对全双工语音交互中打断、回切与外部工具调用难以共存的问题,该工作用并行智能体文本流与函数调用流加流式 TTS 与 RNN-T 转写的统一架构实现边听边说边调工具,最强证据是工具选择 F1 达 82.5% 且打断后恢复质量 4.33/5,代价是参数准确率与端到端执行仍明显落后且工具执行期间不支持打断。
论文研究视频字幕与语音转写在流式条件下如何决定每写一个词可见多少源,用单参数幂律窗口替代固定等待,在三个公开集上以 29M 解码器在低延迟处保持质量并给出结构化不偷看证明,代价是长度估计与单轮运行噪声仍需复核。
针对无预先切分的多语会话转写任务,该工作用说话人日志、长语音识别与 CTC 对齐加融合的级联路线,在官方评测集上报告 tcpMER 为 15.41% 获得第二名,代价是三模块串行依赖与多阶段微调成本。
针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。
该文用 1000 组英文转写偏好标注比较词错率、字错率与多配置语义指标,发现词错率与人判断一致度最低而最优语义距离略优但未显著超过字错率,因此主张默认报告字错率并辅以语义指标。