会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
论文解读

只听一句不够:用前面二十多秒对话为当前语音补上情绪走向

针对单句语音情绪识别忽略对话连续性的问题,论文提出只用前文音频做均值池化增强的 ACERT 模块,在 IEMOCAP 上以 25 秒前文将无上下文基线从 68.38% 提高到 79.08%,代价是情绪快速翻转的多人对话如 MELD 几乎无增益。

 · 约 18 分钟 · 8938 字 阅读 →
论文解读

从单句朗读到整场演戏:SceneTTS-Bench 如何量角色稳定、演技与节奏

针对戏剧配音中角色跨轮音色漂移、高潮台词演绎不足与长句分段节奏断裂三类场景级失效,SceneTTS-Bench 用统一输入协议与 SCS、UAR、RDR 三条自动诊断链在 160 场双语剧本上测出四套系统的互补短板,且场景级排序与句级可懂度排序明显背离。

 · 约 21 分钟 · 10476 字 阅读 →
论文解读

删掉画面还要删掉声音:文本与已编辑视频如何共同指定要压制的声源

针对视频物体移除后原声残留导致视听不一致的问题,TV-AudioRemover 用已编辑视频加文字指令做选择性声移除,并用百万级单物体对齐数据、多任务与由易到难的两阶段混合训练支撑细粒度区分,其代价是对上游视觉编辑质量和纠缠声源仍有依赖。

 · 约 17 分钟 · 8034 字 阅读 →
论文解读

分母不清的检测比较不可比:用内容血缘重定 AI 音乐检测评估

该文把 AI 音乐检测当作评估治理问题,用内容摘要与血缘分组冻结 828 轨主队列并分离校准与密封测试,在 562 轨四模型公共成功交集上报告 ArtifactNet 以 0.982 AUROC 领先但 Udio 补充集回落至 0.650,而聚合 F1 掩盖的生成器与真音乐域偏移与缺失覆盖决定了排名是否可比。

 · 更新于 2026-09-24 · 约 19 分钟 · 9195 字 阅读 →
论文解读

听声辨位再行动:OmniEcho 用四通道空间音频补上具身感知的方向感

针对具身智能体难以利用空间音频做问答与导航的问题,论文构建 197 场景问答与 30 场景导航的实录基准并用可控渲染补大规模仿真训练,提出保留语义通路另加 FOA 空间编码器的 OmniEcho,其问答总体 28.5 分与声音导航 16.2% 成功率接近部分文本导航基线,但精细定位与自主停止仍是主要代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9568 字 阅读 →
论文解读

不等整句到齐就开口:双轨延迟如何换来可控的首包文本规范化

针对级联对话中上游大模型流式输出与下游语音合成之间的非标准词歧义,StreamTN 用基于 Qwen3-0.6B 的双轨延迟架构做增量规范化,在 4 帧延迟下报告 Micro-F1 为 0.8937 并以 213 ms 的首包延迟换取流式可用性,代价是复杂数理化表达式仍明显更差且更大延迟才能继续提升精度。

 · 更新于 2026-09-24 · 约 19 分钟 · 9265 字 阅读 →
论文解读

乐观的录音与悲观的转写:Vimarsha 如何同时校正印度语 ASR 评测的两端偏差

针对印度 22 种官方语言语音识别评测中干净音频导致分数虚高与单参考转写导致有效变体被误罚的问题,Vimarsha 用 43.3 小时受控田野录音加 56.1 小时难例野外音频与每词平均 1.5 个可接受变体的格状参考进行评测,发现 10 个主流模型在野外条件下排名大幅变动且最佳系统词错误率从约 10–15% 升至 27–34%,代价是多格评估与人工校验成本 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9829 字 阅读 →
论文解读

缺哪条补哪条:用验证器把乐谱约束变成可分级的训练信号

针对多约束联合满足急剧下降的问题,论文用八族程序化验证器构造基准并以硬门加分级奖励做 GRPO,把 Qwen3-4B 在 Mixed 上的全满足率从 0.160 提升到 0.807,代价是奖励与评测共用同一套验证器且只度量合规不度量听感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9241 字 阅读 →
论文解读

先想好怎么说,再开口说:COT-TTS 把对话历史变成可检查的说话计划

COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。

 · 更新于 2026-09-24 · 约 21 分钟 · 10461 字 阅读 →
论文解读

唱歌头比说话头难在哪:Hi-Singers 用 170 小时野外数据补节奏与表情缺口

针对说话数据训练的模型在唱歌时出现节奏漂移和表情受限的问题,论文用三阶段过滤构建 29500 余段野外唱歌头数据,并在 Hallo 等架构上验证了唇同步与节奏对齐的提升,但高强度筛选只保留约 6.9% 原料且依赖人工打分融合。

 · 更新于 2026-09-24 · 约 18 分钟 · 8748 字 阅读 →
论文解读

不只听懂说了什么:用 22 个副语言特征和两阶段课程统一说话方式与声学环境理解

针对音频大模型能转写却听不懂说话方式与声学环境的问题,论文用 22 维特征定义、120 万音频问答对与先单属性后多属性的两阶段课程训练 ParA-LLM,在 ParA-Bench 总体上报告 43.53% 准确率并在外部语音基准上同步提升,代价是声学单项仍弱于 GPT-4o-Audio 且绝对准确率仍远低于人类。

 · 更新于 2026-09-24 · 约 17 分钟 · 8324 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26987 字 阅读 →
论文解读

先判断有没有需求,再补全没说出口的那一半:ODU 把需求理解做成显式考题

论文把多模态交互中的用户需求理解定义为先判存在再补全意图的上下文推理任务,用 2078 个合成与真人实录场景和五维指标测 14 个原生模型,最强系统在需上下文的关键信息上仅恢复 44.7% 且误触发普遍超过 50%,而给定标准需求标注能显著改善下游回复。

 · 更新于 2026-09-24 · 约 20 分钟 · 9904 字 阅读 →
论文解读

不用转写也能对话:用合成音视频同时练理解、判分与强化

针对原生音视频直接对话缺数据、难评测的问题,该工作用多智能体合成对话同时做评测集与强化训练语料,报告在合成集从 0.465 到 0.652、在真人实拍集从 0.402 到 0.632 的提升,代价是回复变短且效率与风格奖励之间存在权衡。

 · 更新于 2026-09-24 · 约 22 分钟 · 10775 字 阅读 →
论文解读

幻灯片能帮耳朵认词吗:用合成讲稿重测多语言语音识别

该研究把朗读维基百科的语音按小节配上大模型规划加规则渲染的合成幻灯片,在英德荷三语上只用音频测出最佳平均微观词错率 10.23% 与字错率 6.48%,而全量幻灯片文本或图片的零样本提示因大段复制与插入错误而失效。

 · 更新于 2026-09-24 · 约 15 分钟 · 7363 字 阅读 →
论文解读

能说出事件不等于能定住时间:AVTrace 如何拆解音画时间推理

AVTrace 把音画时间能力拆成七类可复算的定位与排序任务,用固定测试集显示现有全模态模型语义描述尚可但时间定位与同步判断偏弱,而针对 Gemma4-E4B 的时间后训练能在部分指标上提升但伴随外部任务的涨跌。

 · 更新于 2026-09-24 · 约 20 分钟 · 9866 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-20

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 3 分钟 · 1104 字 阅读 →
论文解读

前景语音检测:只跟主讲人,靠监督而不是靠更长记忆学会挑人

论文把只检测持续在场主讲人的前景语音检测形式化为免注册逐帧二分类,用前景标签不变加竞争说话人混合的自动监督 recipe 让轻量流式 Mamba 在受控混合与真实远场上压低背景误报,同时在常规检测上保持可用,代价是目标不再占优与强语音形掩蔽下召回下降。

 · 更新于 2026-09-24 · 约 21 分钟 · 10092 字 阅读 →
论文解读

只看谱面判乐器:词序列加预训练的取舍与边界

该研究把 8 类独奏谱面图像转成 bootleg score 词序列做文本分类,用无标注语言模型预训练把 RoBERTa 片段准确率从 34.5% 提升到 42.9%,再用移调式训练与测试增强推到 58.8%,代价是长片段整页推理退化和大偏移抹掉音域线索。

 · 更新于 2026-09-24 · 约 18 分钟 · 8548 字 阅读 →