英文题目:DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis

会议身份:conference:aaai:2026:conference-paper-id:40450

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #强化学习 #文本到语音 #语音克隆

评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yinghao Aaron Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Xilin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Fei Tao:机构信息未能从会议 PDF 纯文本可靠映射
  • Cheng Niu:机构信息未能从会议 PDF 纯文本可靠映射
  • Kaifeng Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Juntong Song:机构信息未能从会议 PDF 纯文本可靠映射
  • Nima Mesgarani:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

零样本语音合成需以文本与短提示音频为输入生成目标音色语音,难点在于基于扩散/流匹配的非并行系统须预先确定总时长,而时长与生成器之间缺乏可微通路。本文方法链分三步衔接:先以改进分布匹配蒸馏将流匹配教师压缩为 4 步学生生成器并做直接度量优化,再把总时长预测建模为随机策略并用组相对策略优化按奖励采样寻优,最后在推理时以教师前段去噪定韵律再交由学生完成后段细化。相对整机强化学习与分离训练时长器,本文只优化低维时长动作且复用高效学生采样,从而大幅降低训练开销并缓解对原始多样性的依赖。在 Seed-TTS 英文跨句任务上学生模型词错率降至 1.752且说话人相似度达 0.698,均优于 32 步教师基线的 1.947 和 0.662,中文字符错率同步从 1.695 降至 1.527。结论限于英汉 Emilia 有声书类数据与特定自动语音识别和说话人验证奖励,尚未验证主观偏好泛化与跨域鲁棒性。训练使用 8 卡 NVIDIA H100,推理实时率约为教师模型的五分之一。

🔗 开源与复现资源

  • 演示资源:https://dmospeech2.github.io — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么时长值得单独优化?

本文输入是两部分:一是待合成的文本,二是一段短的提示语音,用来指定要模仿的音色。输出是从噪声出发生成的梅尔频谱,再经声码器变成波形。目标是在跨句场景下让合成语音既像提示人,又把文本说对。初学者容易以为只要生成器够强就行,但扩散类零样本系统把任务拆成两步:先预测总时长 L,再以 L 为画布做修复生成。白话说,时长预测器决定说多快、多长,生成器决定具体怎么发声。

原文指出输入时长显著影响说话人相似度和词错误率,而此前系统要么单独训练时长预测器,要么按提示语速启发式估计。这意味着即使生成器被直接指标优化过,选错时长仍会拉低最终分数。学习依赖上,先要理解零样本语音合成的提示机制和扩散修复需要预知长度的设定,再看强化学习如何绕过不可微采样。本文的输出承诺是当前可用,已公开的演示页在资源状态为 available 的官方链接上可听,但正文解读仍以论文文字为准。

例子:同样一句话,用过短时长会语速过快含糊,用过长时长会拖沓走调,这就是时长影响两个指标的直观例子。

自回归与扩散两条路线在时长上有什么不同?

自回归路线像语言模型逐帧往外写,时长在生成中自然决定,好处是不用预先定长,难点是对长序列做感知指标的反向传播代价极高。扩散路线把合成看作修复,需要预先知道总时长,好处是可并行去噪,难点是时长预测器与生成器之间没有可微通路。相关工作里,语音对齐、人类反馈优化、情感偏好优化等都尝试把强化学习或偏好优化加到整个语音管线,但原文认为这有两重代价:一是每步都要生成完整语音,常需上 100 步采样。

二是改进上限受原模型多样性限制,即最佳多采样选择。扩散侧也有用强化学习调自然度的工作,但同样作用于全管线。本文的对照点很明确:同输入、同目标、同运行阶段下,不去优化整个生成器,而是只优化时长预测器这个低维决策,并借助已蒸馏到 4 步的学生模型来产生奖励样本,从而把计算量降下来。这不是类别差异的胜负之争,而是优化位置的选择。

原 DMOSpeech 留下了哪个断点?

原直接指标优化语音框架通过分布匹配蒸馏把采样从 128 步压到 4 步,并在生成器内部建立了对词错误率和说话人相似度的直接梯度路径。但时长预测器仍是自监督单独训练,与语音合成部分断开。具体动作是:时长预测器用交叉熵拟合剩余长度真值,取最大值作为 L,然后生成器以此 L 生成,感知好坏无法回传给时长。问题在于时长显著影响相似度和可懂度,断点就成了质量瓶颈。此外蒸馏带来模式收缩,学生倾向高概率区域,音质尚可但语调、节奏、停顿的多样性下降。于是本文要同时解决两个可核对的问题:如何让时长预测对准感知指标,又如何在不回到 32 步的前提下恢复韵律多样性。

两阶段总览:先蒸馏生成器,再强化时长怎么做?

全文方法可沿一个样本走一遍。给定文本 x 和提示语音 p,时长预测器先给出总时长分布,从中采样 L。用该 L 初始化高斯噪声,经学生生成器 4 步去噪得到梅尔谱,再经预训练声码器得到波形,最后由语音识别模型和说话人验证模型打分。第一阶段沿用原框架:学生匹配教师分布、多模态对抗提升感知质量、直接指标优化生成器。第二阶段是新增:把时长预测器看作策略,用组相对策略优化做强化学习,奖励来自相似度和识别对数概率。

推理时可选纯学生 4 步或教师引导 16 步。前导读:下图左为断开结构,右为闭环结构,重点看右上奖励如何回到右下时长模块。

看图路径: 1. 先看左右两栏标题:左为原 DMOSpeech,右为 DMOSpeech 2,确认新增的是右上 GRPO 回路;2. 再沿右下时长预测器到多份噪声再到 K 份梅尔谱的彩色箭头走一遍采样路径;3. 对比左下 argmax 单时长与右下 sample K times 多时长的分布示意差异;4. 确认 ASR 与 SV 模块在左右两图中分别输出损失还是奖励

原论文 Figure 1:Overview of the DMOSpeech 2 framework.

论文图 1。原论文 Figure 1:“Overview of the DMOSpeech 2 framework.”。

该图报告显示左侧原结构中时长预测器经交叉熵训练后取最大值决定噪声长度,生成器的输出加噪后与教师做分布匹配,另有语音识别与说话人验证的直接优化;右侧新结构中同一文本和提示被采样 K 次得到不同长度,生成 K 份梅尔谱和波形,再由识别与验证模型算出 K 个奖励送入分组相对策略优化模块更新时长策略,同时用参考策略做正则。图中火焰与雪花图标区分训练与冻结,箭头颜色对应不同采样分支,这与正文算法 1 的描述一致。

时长预测器如何表示剩余长度?

时长预测器采用编码器解码器变换器结构,白话是文本编码器加语音提示解码器。术语首次说明:剩余长度指从当前已给提示帧算起还需生成多少帧;交叉注意力指解码器用提示谱查询文本特征。架构细节是 4 层文本编码器加 4 层因果解码器,每层 8 头、隐维度 512,最大 30 秒切成 300 类、每类 100 毫秒。训练时真值是递减序列,对长度为 Li 的样本目标为 Li 减 1 直到 0,用交叉熵预训练。

推理前是取分布最大值,强化学习阶段改为按温度采样以探索不同长度。符号解释:x 为文本序列,pt 为到 t 帧的提示,Lt 为还需帧数,模型输出在各长度上的概率分布。

\[P(Lt = l|x, pt) = [Pφ(x, pt)]l\]

该式计算目标是给出在文本和当前提示下剩余帧数的分类分布,为后续采样 K 个总时长提供策略。原文明确实现是双向文本编码加因果梅尔解码加交叉注意力,末层用柔性最大值输出分布。

时长预测器 × 语音生成器: 时长预测器负责决定合成语音的总帧数 L,为扩散修复任务提供画布大小;语音生成器负责在给定 L 的噪声上做去噪生成内容。二者必须搭配是因为生成器不知道该生成多长就无法做非自回归修复,而本文的新增作用是用强化学习把感知奖励从生成器反向传给时长预测器,补上原来断开的一环。

沿样本继续走:文本经编码,提示梅尔谱经解码,交叉注意力融合后输出剩余长度分布,采样得到总时长 Lk,再按下式生成语音。

\[yk = G✓(z, x, p, Lk),\]

该式中 G 为学生生成器,z 为高斯噪声,x、p、Lk 分别为文本、提示和采样时长,输出为第 k 个梅尔谱样本。奖励按下式计算。

\[rk = log PCT C(x|C(yk)) + λSIM ·\]

该式中第一项是识别模型给出的文本条件对数概率,越高表示越说对;第二项是提示与合成说话人嵌入的余弦相似度乘以权重,原文取 3 以平衡两项贡献,细节在附录讨论。前导读:下图展示教师先定韵律、学生后修音质的时间划分,横轴是噪声水平,纵轴是生成状态。

看图路径: 1. 从左端噪声灰块沿教师圆圈 y1 到 yk* 数出前期步数,再看切换点标记;2. 观察下时间轴 t1=0 到 tk*=s1 再到 sM=1 的非均匀划分;3. 对比上排灰色教师圈与蓝色学生圈在标注上的分工文字

原论文 Figure 2:Illustration of teacher-guided sampling (Algorithm 2).

论文图 2。原论文 Figure 2:“Illustration of teacher-guided sampling (Algorithm 2).”。

该图可见过程从左侧噪声灰块开始,经多个灰色教师圆圈 y1 到 yk 星建立韵律结构,到切换点 tk 星等于 s1 后转为蓝色学生圆圈 xs1 到 xsM 做声学细化,最终在右侧得到清晰梅尔谱。下时间轴显示教师侧步点密集且偏向早期语义建立阶段,学生侧仅用少步完成,阴影标注 prosodic structure 与 acoustic refinement 的分工,这支持原文按噪声水平分工的假设。

奖励与优势如何只更新时长而不动生成器?

关键冻结安排是奖励阶段学生生成器、识别模型、验证模型均冻结,只有时长策略更新,另有一个冻结的参考策略做锚定。原文给出 3 个策略:当前策略是正在训练的时长预测器,旧策略是产生本批样本的若干步前版本,参考策略是强化学习开始时初始监督模型的冻结拷贝。组内优势通过均值方差归一化得到,组大小 K 为 16。质量控制是若组内最大减最小奖励小于 0.01 则跳过该批,只从能区分好坏时长的批次学习。

组相对策略优化 × 时长策略: 时长策略是把时长预测器看作概率分布 π,对同一文本和提示音采样 K 个不同时长;组相对策略优化负责在组内比较 K 个时长的奖励并计算优势,不需要可微路径。搭配理由是时长是离散采样、梯度无法穿过生成器,而组合意义是只优化低维的时长选择,大幅降低强化学习的采样开销。

这种设计把高维语音生成的探索压缩为 1 维时长选择,因此可用 4 步学生快速产生 K 个样本,而不必对整个生成器做昂贵强化学习。

三类训练各用什么数据、步数和优化器?

教师采用基于流匹配的 F5 语音合成模型,约 300,000,000 参数,在野外多语料 Emilia 上过滤后约 95,000 小时英文加中文数据训练 2,000,000 步,批大小 307200 音频帧约 0.91 小时,用 AdamW 优化器,峰值学习率 7.5e-5,预热 20,000 步后线性衰减。学生训练批大小为教师一半,学习率从教师末期约 6e-5 继续,在 Emilia 上再训 200,000 步。时长预测器先在 Emilia 上训 85,000 步,学习率 1e-4,批大小同教师,用 PyTorch 默认 AdamW;再用分组相对策略优化微调 1500 步,组大小 16。所有实验在 8 块英伟达 H100 上完成。

声码器直接用预训练 Vocos 把梅尔谱转波形,未重新训练。优势归一化与裁剪更新公式如下,符号先说明:rk 为第 k 个时长样本奖励,μ 与 σ 为组内均值标准差,Rk 为当前与旧策略概率比,ε 为裁剪幅度,β 为散度正则强度。

\[Ak = rk −µr\]

该式计算目标是把原始奖励转为组内相对优势,正值表示该时长好于组平均。

\[Lk = min (Ak · Rk, Ak · clip (Rk, 1 ± ")) −β · KL\]

该式是单样本损失,取优势加权与裁剪后加权的较小者,再减去与参考策略的散度惩罚,原文取 ε 为 0.2、β 为 0.04。完整损失是对组内平均后再对输入取期望。

分布匹配蒸馏 × 直接指标优化: 分布匹配蒸馏负责让 4 步学生生成器在分布上模仿 32 步教师,分工是提速;直接指标优化负责用预训练语音识别和说话人验证模型在梅尔谱上给出可微的词错误率和相似度损失,分工是提质。二者搭配是因为单纯蒸馏会收缩多样性并继承教师的时长敏感短板,而组合后学生既快又在感知指标上超过教师。

需指出缺项:原文未报告对抗判别器的具体结构超参数和直接指标优化的损失权重,复现时只能按引用的原 DMOSpeech 实现补齐,不能从模型名推定。

在什么数据、基线和指标下比较才算公平?

评估采用跨句任务,即用提示人的音色说新句子。数据集为 Seed-TTS 英文测试集 1088 条来自 CommonVoice,中文测试集 2020 条来自 DiDiSpeech。基线包括真实录音、32 步 F5 教师、无强化学习的学生 4 步、强化学习后学生 4 步,以及教师引导 16 步,其中教师处理 14 步、学生处理 2 步、切换点 0.25。另与 CosyVoice 2、Spark-TTS、LLaSA-8B、MaskGCT 等官方检查点比较,所有音频重采样到 24 千赫。客观指标方向要记牢:词错误率与字错误率越低越好,英文用 Whisper 大版本 3,中文用 Paraformer 中文。

说话人相似度越高越好,用 WavLM 大模型做余弦;实时因子越低越快,在单块 H100 测;基频变异系数越高表示韵律多样性越好,每对文本提示采 50 个样本、共 20 对。主观用比较平均意见分,以强化后 4 步学生为锚点,比较自然度和相似度,负值表示锚点更好,正值表示对比方更好,共 320 条双语样本。教师多样性比较时为公平对教师用了适配流匹配的去噪扩散概率采样,以匹配学生侧的额外噪声注入。

时长强化学习带来了多大可运行收益?

比较问题是:在相同学生生成器下,仅把时长从取最大值换成强化学习采样,能否同时提升可懂度和相似度?公平条件是同为 4 步学生、同声码器、同测试集。词错误率和字错误率越低越好,相似度越高越好,实时因子越低越好,原文表 1 中这些格均为裸值 reporting,没有百分号或毫秒等单位,正文保留裸值写法不逐格追加单位。前导读:下表整理英文与中文的可懂度、相似度和双语平均速度 3 类结果,重点对比强化后学生 4 步与教师 32 步及无强化学生 4 步的差距。

条件指标强化后学生 4 步教师 32 步无强化学生 4 步
英文 Seed 测试词错误率越低越好1.7521.9473.750
英文 Seed 测试相似度越高越好0.6980.6620.672
中文 Seed 测试字错误率越低越好1.5271.6952.000
中文 Seed 测试相似度越高越好0.7600.7500.750
双语平均速度实时因子越低越好0.03160.1671同上

表后解释:该表报告的裸值显示,英文词错误率为强化后学生 1.752,教师为 1.947,无强化学生为 3.750,英文相似度为强化后学生 0.698,教师为 0.662,无强化学生为 0.672;中文字错误率为强化后学生 1.527,教师为 1.695,无强化学生为 2.000,中文相似度为强化后学生 0.760,教师为 0.750,无强化学生为 0.750。以上可懂度和相似度数值均为无单位分数,实时因子同样为无单位比值,推理仍为 4 步,实时因子强化后学生为 0.0316,教师为 0.1671。未胜出项是真实录音在英文相似度上仍有 0.734,高于强化学生,说明音色还原仍有差距。

说话人相似度 × 词错误率: 说话人相似度负责衡量合成音色与提示音的余弦接近程度,分工是保音色;词错误率负责衡量语音识别转写与输入文本的一致性,分工是保可懂度。二者搭配为奖励是因为时长同时影响语速和停顿,既改变音色感知也改变可懂度,组合后时长强化学习用加权和同时约束两者,避免只拉长或只缩短的偏置。

前导读:下图左面板为基频值分布直方图与核密度曲线,右面板为去均值音质评分分布,用于判断多样性损失发生在韵律时间维度还是频谱音质维度。

看图路径: 1. 先看左图横轴 F0 Value,对比蓝色学生峰与黄色教师宽分布的宽度差异;2. 再看红色虚线提示音 F0 均值附近三条曲线的相对位置;3. 转到右图均值中心化 UTMOS 横轴,确认三者分布宽度是否接近

原论文 Figure 3:Comparison of diversity across sampling methods.

论文图 3。原论文 Figure 3:“Comparison of diversity across sampling methods.”。

该图可见左面板学生蓝色曲线又高又窄,峰值集中在横轴低段,教师黄色与教师引导浅黄色更宽并向高频方向拖尾,红色虚线为提示音基频均值;右面板三者在均值中心化音质分上宽度接近且高度重叠。这支持原文判断:蒸馏损失的主要是韵律时间维度的多样性,而非频谱音质,教师引导能把韵律宽度拉回接近教师。

与更大参数和更慢系统比,速度优势是否成立?

比较问题是:0.3B 学生能否在更快的同时不输给 0.5B 到 8B 的公开系统?公平条件是均用官方检查点、同重采样、同 Seed 测试集。主观部分报告显示强化后学生在英文自然度上以 0.12 显著优于教师,在中文相似度上以 0.11 显著优于教师;与无强化学生比,英文自然度和相似度分别领先 0.43 和 0.48,中文分别领先 0.26 和 0.31。教师引导变体在中文自然度上达正 0.45、相似度正 0.3,但注意此时锚点仍是强化学生 4 步,正值表示教师引导更好。

限制是主观显著性只报告了 p 小于 0.05 或 0.01,未给置信区间和评测者一致性。与最强基线的对照是 MaskGCT 相似度更高,英文达 0.713、中文达 0.772,但其可懂度更差且实时因子达 2.397,比强化学生慢约 75 倍。8B 的 LLaSA 在两项可懂度和相似度上均落后,说明单纯放大量级不能替代时长对准。

教师引导采样用多少步换多少多样性?

要回答的消融问题是:纯学生、纯教师、混合三者在多样性与质量间如何权衡?条件是同文本提示、同多样性采样协议。指标方向是基频变异系数越高越多变,词错误率越低越好。前导读:下表把多样性数字与质量数字放在同一速度条件下比较,重点看混合是否兼得。

采样策略多样性基频变异越高越好英文词错误率越低越好中文字符错误率越低越好实时因子越低越好
教师 32 步0.66591.9471.6950.1671
学生 4 步0.46401.7521.5270.0316
教师引导 16 步0.59321.7381.4680.0941

表后解释:该表显示学生多样性比教师下降 30.3 个百分点对应的相对幅度,从 0.6659 掉到 0.4640,而教师引导恢复到 0.5932,约为教师的 89.1 个百分点对应的比例,同时词错误率进一步降到 1.738、字符错误率降到 1.468。具体代价是总步数从 4 增到 16,实时因子从 0.0316 增到 0.0941,但仍比教师快约 1.8 倍;另一代价是需同时保存师生参数,论文称参数量从 0.3B 变为 0.6B。未评测边界是切换点只报告了 0.25 附近的配置,原文称 0.4 到 0.5 更重多样性、0.1 到 0.2 更重效率,但未给出完整曲线,不能推广到每档都成立。

教师引导采样 × 模式收缩: 模式收缩指蒸馏后学生只覆盖高概率韵律,基频分布变窄;教师引导采样负责让教师先做高噪声阶段的去噪以定下韵律结构,再交由学生做低噪声阶段的声学细化。搭配原因是扩散过程天然分层,前期定结构、后期修音质,组合意义是以约 16 步恢复近教师的多样性,同时保留学生的指标优势。

失败条件也应记住:若组内奖励几乎无差异则跳过该批,说明时长已难再区分好坏,继续训练可能无效。

哪些结论还只是有限解释或未验证?

论文直接报告的是时长强化提升相似度和可懂度、教师引导恢复基频多样性且保持音质分布,这些有数字支持。有限解释是把多样性损失归因于高噪声阶段韵律建立被压缩,这与分层观察一致,但未做逐噪声水平的因果干预,只能表述为支持而非证明。未验证的是奖励只用识别与验证模型,是否对齐真实人耳偏好仍待验证;社会影响部分提到的伪造与检测风险未测量误判率。成本上训练资源只给卡数与步数,未给总时长与能耗。

推理只给实时因子,未给首包延迟与内存占用,不能承诺实际延迟同比例改善。总体趋势不等于每组文本都成立,中文教师引导主观大涨不代表英文同等幅度。

要复现应先做什么,需要哪些可运行条件?

复现先做三件事。第一,按 F5 教师配置准备 Emilia 过滤后数据与 Vocos 声码器,训练或下载教师权重,确认 32 步基线可运行。第二,用半批大小蒸馏 4 步学生并跑通直接指标优化,固定识别与验证模型为冻结,只更新学生。第三,单独预训练时长预测器到交叉熵收敛,再切到强化微调:组大小 16、温度采样、奖励权重 3、裁剪 0.2、散度 0.04、跳过无差异批次,微调 1500 步。推理复现两种可部署策略:纯学生 4 步用摇摆采样时间点 0.0000、0.0761、0.2929、0.6173,教师引导用切换点 0.25、教师 14 步加学生 2 步。

信息条件上,论文称将公开代码与预训练模型,当前以演示页可用为准,权重下载与系统可运行需以实际发布为准。还需补的验证是换一组识别与验证模型测奖励泛化,以及报告不同切换点的完整速度多样性曲线。

何时值得尝试这种只优化时长的思路?

当你的管线已有一个高效生成器但时长仍是启发式或单独训练,且你观察到语速忽快忽慢并伴随相似度和可懂度波动时,值得尝试把时长单独做成策略并用组内比较来优化。前提是你能用少量步数快速产生多个时长样本,否则强化学习的采样开销会抵消收益。若应用重创意多样性,可选教师引导并把切换点调高;若重实时,则用纯学生 4 步并接受韵律变窄。

教学例子:先固定文本与提示,采样 3 个时长分别生成并打分,若长、中、短的奖励拉不开,则说明当前瓶颈不在时长,不必继续调该模块。最终判断是,本文把原来断开的时长环节闭环,并用混合采样缓解蒸馏收缩,在保持 5 倍左右速度优势的同时让指标超过教师,但多语言泛化、人类偏好对齐与部署成本仍需补验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总