论文解读

把说话声放进场景里:语音与环境为何要分流建模再对齐

针对带背景声的语音合成中可懂度与场景一致性难兼顾的问题,ImmersiveTTS 用双流扩散 Transformer 做联合注意力交互并以语音与音频双教师做表示对齐,在 25 步采样下取得更低词错率与更好音频保真度,代价是对双重引导强度敏感且训练依赖人工混合数据。

 · 更新于 2026-09-24 · 约 21 分钟 · 10169 字 阅读 →
论文解读

把推理也当训练来扩展:掩码流匹配如何一步步重写音频

针对文本到音频中推理扩展不足与偏好错位问题,论文用连续掩码流匹配加迭代掩码重预测扩展推理计算,并用奖励加权微调对齐文本对应与审美,主证据是在 AudioCaps 上 FAD 为 1.10、KL 为 1.30、MOS-Q 为 78.87,代价是需要多步 ODE 求解与多轮掩码迭代。

 · 更新于 2026-09-24 · 约 18 分钟 · 8555 字 阅读 →
论文解读

一步跨越整条轨迹:MeanAudio 以平均速度实现单步文本转音频

针对流式与扩散式文本转音频需数十至数百步积分导致延迟高的问题,MeanAudio 以均值流回归区间平均速度并配合双文本编码与瞬时到平均课程,在 AudioCaps 上用 120M 参数实现单步 FD 14.30 与 RTF 0.013,代价是长音频与语音生成仍受限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8822 字 阅读 →
论文解读

从局部连乘到全局直测:用三层约束补回骨骼结构的可懂复述

针对随语音生成全身动作时末端抖动与误差沿骨骼链放大的问题,论文把扩散建模搬到全局旋转空间并用关节、骨骼、时序三层约束补回结构,消融表显示完整约束取得最低分布距离,但节奏对齐仍有基线未被全面超越的代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9461 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

不用人工偏好标注:用大音频语言模型反馈做连续自回归非言语发声的偏好优化

针对连续自回归语音模型没有显式序列似然而难以直接做直接偏好优化的问题,该工作用大音频语言模型自动构造同提示 chosen-rejected 对,并以拒绝采样微调冷启动加带监督锚的流匹配偏好优化做两阶段对齐,在 1600 句官方测试上把最终分从 73.96 提高到 75.80,而整体质量基本保持稳定。

 · 更新于 2026-09-24 · 约 21 分钟 · 10217 字 阅读 →
论文解读

高唤醒一用力就含糊:用矫正起点与动态引导拉住情感轨迹

针对尖叫哭喊等高唤醒合成中保字准就会丢情感、追情感就会念糊的矛盾,论文提出只改推理的情感矫正噪声先验与似然逆引导,在不重训下把 F5-TTS 词错率从 4.41% 降到 2.53% 并提升情感分,但纯度与截断仍需折中且不适用于非迭代架构。

 · 更新于 2026-09-24 · 约 18 分钟 · 8940 字 阅读 →
论文解读

先猜五维再对波形:可微合成与粒子群如何把板混响参数推到近乎完全恢复

任务是从脉冲响应估计六维板物理参数,方法用共享编码器先估计五个归一化参数再解析恢复面密度,合成匹配集上的精修使两条路线波形与参数误差都下降三个数量级以上,而粒子群路线参数误差低两个数量级以上,代价是每条脉冲响应数分钟的合成与优化开销且仅在匹配合成条件下验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9470 字 阅读 →
论文解读

把结构化语音与非结构化音效装进同一指令接口:UniSonate 的对齐与课程设计

UniSonate 用指令与内容双流加动态音效令牌统一语音音乐音效生成,在语音可懂度和音乐连贯性上报告最优值,而音效保真度仍落后于专用模型并受短时长与推理开销限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9402 字 阅读 →
论文解读

以小波分频外推替代部分 ODE 求解:WaveEx 的加速逻辑与适用边界

针对流匹配语音生成中 ODE 反复调用神经网络导致推理慢的问题,WaveEx 用单层小波分解加一阶泰勒分频外推替代部分求解步骤,在四类任务上报告 2.75-5.73 倍加速,代价是早期高曲率段仍需保留少量 ODE 步且高频外推带来轻微波动。

 · 更新于 2026-09-24 · 约 22 分钟 · 10760 字 阅读 →
论文解读

直接学对话会失语:用课程学习与说话轮次嵌入让流匹配学会双人对话

针对双人自发对话需要同时保证可懂度与正确分声道轮转的问题,ZipVoice-Dialog 在单人流匹配基础上引入单人预训练到对话微调的课程与说话轮次嵌入,最强证据是 6.8k 小时 OpenDialog 与对比基线上的可懂度和轮转精度提升,代价是仍集中于双人单声道且表达力受小模型限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9541 字 阅读 →
论文解读

把口型与情绪放在同一运动空间里采样:情绪子空间加十步流匹配的实时说话头

该文把语音驱动的人脸运动看作情绪条件下的运动隐空间分布,用正交运动字典加情绪子空间保留发音与情感耦合,再用逐层跨注意力融合音频与情绪去调制流匹配速度场,在 MEAD 上取得 82.05% 情绪准确率与 22.58 dB PSNR 并以十步采样实现实时推理,代价是仅覆盖英语与七类基本情绪且对大角度头部转动验证不足。

 · 更新于 2026-09-24 · 约 23 分钟 · 11091 字 阅读 →
论文解读

三模态互相拆台时,HuMo 如何让文本、图像与音频协同

针对文本、参考图像与音频难以协同且三元完备数据稀缺的问题,HuMo 用非完备互补数据加两阶段渐进训练实现统一控制,在主体保持与音画同步子任务上报告了超越专用基线的分数,代价是仍需两阶段 40k 步训练与分段推理引导配置。

 · 更新于 2026-09-24 · 约 18 分钟 · 8698 字 阅读 →
论文解读

桥模型也是预测模型:用高斯概率路径统一流匹配与扩散桥

该文把配对干净与带噪语音之间的流匹配与扩散桥统一为均值方差不同的高斯概率路径,论证数据预测训练下每步采样等价于预测式增强,并用时频主干与改进损失在更少参数和更少步数下超过已有生成式基线,但提升上限仍受预测本质约束。

 · 更新于 2026-09-24 · 约 19 分钟 · 9177 字 阅读 →
论文解读

不预测离散口令而直写连续声学潜向量:子空间扩散如何重连唇动与声音

针对唇到语音中视觉到声学一对多映射难保留细节的问题,SLD-L2S 用层次子空间潜流匹配直写预训练音频编解码器连续潜向量并辅以语义与语音语言模型损失,在 LRS3 上以 10 步函数求值取得 UTMOS 4.2096 等质量领先,代价是可懂度仍受视觉信息瓶颈与辅助损失权衡约束。

 · 更新于 2026-09-24 · 约 21 分钟 · 10025 字 阅读 →
论文解读

AuK 用一条指令接口统一生成与编辑:语义条件与声学潜变量如何分工

AuK 用自然语言指令加可选音频统一五类语音任务,以多模态大语言模型语义条件、联合训练的音频变分自编码器声学潜变量和混合整流流 Transformer 为核心,在约 3.03 billion 指令音频实例与 1.95 million 小时监督上经生成预热、联合预训练、编辑偏好优化与生成强化学习取得零样本与指令合成及通用编辑的领先结果,并以 4 步无分类器自由 …

 · 更新于 2026-09-24 · 约 27 分钟 · 13283 字 阅读 →
论文解读

不对称不确定性分解:用确定性锚点保口型、用随机残差补倾听

在仅双路音频输入的整段对话生成任务中,ECHO 以确定性锚点建立语音主导的稳定基线、再以残差流匹配与语义组缩放补充一对多的倾听变化,在约 120 小时对话基准上同时改善说话保真与倾听真实感与多样性,代价是时序稳定性与单样本实时因子未全面领先且依赖弱条件窗口的提纯。

 · 更新于 2026-09-24 · 约 22 分钟 · 10846 字 阅读 →
论文解读

用可控的音素光栅把重叠说出来:KABURI-TTS 如何做双通道对话合成

针对双人对话中后通道、打断与重叠难以可控生成的问题,KABURI-TTS 以每说话人的音素光栅与由此导出的语音活动为条件在双通道上渲染对话语音,人在真实对话数据上的主观评测与语音活动统计显示其交互自然度与重叠频次优于强基线,但仍未达到真人对话上限且依赖外部光栅构造的质量。

 · 更新于 2026-09-24 · 约 25 分钟 · 12192 字 阅读 →
论文解读

不用时间刻度做修复:判别表示如何指示流匹配的剩余路程

论文针对修复任务中全局时间 t 无法刻画样本相关退化程度的问题,提出以冻结判别编码器表示替代时间条件来驱动流匹配速度场,在语音增强上报告了可复核的提升,并以额外编码器开销和自适应推理换取计算节省。

 · 更新于 2026-09-24 · 约 21 分钟 · 10282 字 阅读 →
论文解读

在连续隐空间里一次生成一小段:SCAPES 如何用语义嵌入控制环境声纹理

SCAPES 针对环境声纹理的语义可控合成问题,用连续归一化流在 EnCodec 连续隐空间上按原子段自回归建模,并以 CLAP 语义嵌入和历史原子为条件,在约 34 分钟数据、单张消费级 GPU 约 1 小时训练的条件下实现长时稳定生成,代价是难以处理语音与复调音乐所需的长程结构。

 · 更新于 2026-09-24 · 约 20 分钟 · 9749 字 阅读 →