会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
论文解读

把无条件分支换成可学习的向量:语音合成中更稳的引导基线

该研究把固定零向量换成每个条件各学一个无条件嵌入,并在相同训练步数与数据下比较固定与可学习两种做法,最强证据是可学习基线在大引导权重下更稳定,代价是说话人保真提升时绝对质量分可能下降且需要分别调节两个权重。

 · 约 21 分钟 · 10440 字 阅读 →
论文解读

不看配对样本,如何学到从退化到干净的随机输运

SE-MSB 用扩散薛定谔桥在干净与退化语音分布之间学习双向随机输运,并以端到端 Mamba 波形模型实现,在去混响与混合退化上报告可比拟配对方法的效果,同时保持少步采样与低计算量。

 · 约 18 分钟 · 8882 字 阅读 →
论文解读

训练走解析路径、推理走自生轨迹:纠正性强制如何统一后训练扩散与流

针对解析训练态与自生 rollout 态的暴露偏差,纠正性强制用动态 rollout 纠正加反事实转移一致性统一后训练 SB-VE 与 OT-CFM,在 VoiceBank 上把 SB-VE 的 PESQ 从 3.07 提升到 3.21 并稳定多步 SI-SDR,代价是 UTMOS 提升有限且需额外 rollout 开销。

 · 更新于 2026-09-24 · 约 23 分钟 · 11351 字 阅读 →
论文解读

混响下高阶缺失难定解:把上采样做成条件生成的取舍

该文把一阶到三阶上采样定义为给定低阶信号生成缺失高阶通道的条件分布,用流匹配与得分扩散同骨干对比,在混响语音上流匹配信号与听感占优但参数与采样代价明显更大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8343 字 阅读 →
论文解读

先看听者再说话:用回应前一秒表情规划下一句怎么说

针对对话语音只看文本历史会漏掉听者即时非言语线索的问题,用回应前 1 秒听者人脸时序做显式回应规划,在严格双人 MELD 协议上时序模型宏平均 F1 和 VAD 一致性略高于纯文本而准确率基本不变,合成阶段仅证明可端到端连通而未改善可懂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8603 字 阅读 →
论文解读

混合不分离直接估计合成参数:扩散先验如何压住时间抖动

针对和声乐器混合的逐帧合成参数估计易出现时间抖动的问题,该文用乐谱条件扩散模型学习参数轨迹分布并以多尺度频谱重构误差引导逆扩散,在木管与弦乐合奏上改善了响度与音色特征并保留可复述的实验条件。

 · 更新于 2026-09-24 · 约 24 分钟 · 11741 字 阅读 →
论文解读

把笑声叹息放进指定位置:连续隐变量、长尾补数据与多指标选样的可控语音

为在指定文本位置可靠生成 16 类非言语发声,该工作用连续隐变量 DiTAR 加专用标签与停顿判别建模,以双语预训练加针对性合成与频率重采样补长尾,再用解码参数搜索与五选一多指标选样提升鲁棒性,最终以双语加权 62.786 获 Track 2 总分第一,代价是额外推理计算与英文控制仍待加强。

 · 更新于 2026-09-24 · 约 20 分钟 · 9653 字 阅读 →
论文解读

长语音越说越飘、难句反复打转:DiTAR+ 用扩张视野与分层遮蔽稳住自回归扩散

针对连续隐变量自回归扩散在长句和难句上的发音错误与语义幻觉,DiTAR+ 用扩张上下文采样扩大历史视野、用分层声学遮蔽先对齐语义再渲染声学,在 ZH-Hard 上把词错误率从 12.478% 降到 9.893%,在 25 到 35 秒长句上把说话人相似度从 0.741 提升到 0.759,同时词错误率从 2.778% 降到 2.173%,代价是质量主观分相对 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9543 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

年轮作穹顶:把生态录音与语言痕迹做成同心的时间尺度

该作品以树木年轮为结构隐喻,用颗粒与频谱处理、VBAP 穹顶空间化与文本到三维扩散生成,把约八分半钟的微观到宏观生态时间做成穹顶声像层,其代价是垂直声像不如水平声像清晰且缺乏可量化的听众评估。

 · 更新于 2026-09-24 · 约 21 分钟 · 10513 字 阅读 →
论文解读

把做乐器的扩散模型拿去换嗓:统一条件如何同时管住音高、音素与演唱者

论文把多乐器音乐合成的注意力扩散模型改造为语音与歌声转换,用音素后验、基频与演唱者嵌入做条件,在自然度与演唱者相似度上追平专用转换模型,但音素保真下降且加入器乐数据会拉低人声质量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8901 字 阅读 →
论文解读

把七种模态塞进一个自回归模型:Archon 用语义视频与模态链思考做整人生成

Archon 针对文本音频动作视觉碎片化问题,用统一离散词表加自回归语言模型统一七种模态,以语义视频实现约 4 倍 token 压缩并用语义驱动扩散恢复高清视频,最强证据是语音驱动视频与图条件语音任务上与专用模型相当或更优,代价是两阶段训练与推理链更长且本次未能确认代码模型公开。

 · 更新于 2026-09-24 · 约 24 分钟 · 11704 字 阅读 →
论文解读

从噪声中途上车:暖初始化让同一个扩散模型做音色迁移与音频修复

论文用暖初始化把预训练音频扩散模型的逆向过程从引导信号中途启动,以双簧管转钢琴等实验研究初始化时间与噪声比例的取舍,报告在杰卡德距离低于 0.6 且弗雷歇音频距离低于 0.7 附近存在可用工作点,代价是对人声与强打击乐等成分处理不稳定且依赖高引导强度等超参数。

 · 更新于 2026-09-24 · 约 21 分钟 · 10477 字 阅读 →
论文解读

绕开姿态瓶颈:用音频直驱三维高斯粒子的全身说话人

针对单图全身会话化身中音频到姿态再到渲染的误差累积与口手细节丢失问题,论文用音频直接调制三维高斯粒子变形场并蒸馏大视频扩散先验,消融显示轨迹对齐与分数蒸馏分别控制同步与平滑,但自建评测与合成监督带来泛化边界。

 · 更新于 2026-09-24 · 约 18 分钟 · 8866 字 阅读 →
论文解读

简单输入画不准、精细能量难手绘:AudioSketch 如何调制出有语义的时间能量

针对单张图像对应多种合理声音的一对多图像到音频生成问题,AudioSketch 用轻量图像到音频映射复用预训练文本到音频扩散模型并以 ControlNet 注入能量轨迹,再用语义条件能量调制器把简单时间戳转换为精炼能量,在 VisualSound 上无控制时以 16.21 的 FD 与 12.41 的 IS 领先同类,而代价是对平滑归一化选择敏感且客观起振对 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8996 字 阅读 →
论文解读

长叙事音频为何要先分段推理再逐段生成:AudioStory 的分工与衔接

针对长时叙事音频的时间连贯与组合推理难题,AudioStory 用大语言模型做分段规划加扩散模型逐段合成,在自建 AudioStory-10K 上以显式推理和语义加残差双桥接实现更强的指令遵循,但多段拼接与长时一致性仍受训练数据和评估条件的限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8736 字 阅读 →
论文解读

边听边说还不能卡:用因果扩散迫使头像实时接住用户

针对双人对话头像需要实时响应用户语音与动作、且倾听表情难以标注的问题,论文用因果扩散强迫在动作隐空间逐块生成并用丢用户条件的合成负样本做偏好优化,报告约 500 ms 延迟、6.8 倍加速与超 80% 人工偏好,代价是口型与画质只保持可比而非全面领先。

 · 更新于 2026-09-24 · 约 17 分钟 · 8137 字 阅读 →
论文解读

缺模态下先补语义再算不确定性:超图引导扩散与双通道证据融合

针对对话情感识别中随机缺失模态导致语义不一致与模态冲突,论文用掩码超图注意力为扩散恢复提供条件并用特征源与判别双通道估计不确定性做证据融合,在缺失率 0.0 至 0.7 下保持最高准确率,代价是两阶段训练与 300 步扩散采样开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9807 字 阅读 →
论文解读

用手势字幕补上语义:CoordSpeaker 如何让说话人边说边做指定动作

针对手势数据缺描述文本导致的语义先验缺口与音频加描述难以协调控制的问题,CoordSpeaker 先用动作语言模型离线生成多粒度手势字幕,再用统一表示的潜在扩散加分层去噪器实现语音节奏与字幕语义的联合生成,最强证据是推理耗时大幅下降与文本对齐指标领先,代价是部分重建指标未占优且长序列时序感知仍有限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9508 字 阅读 →