英文题目:Dynamic Prosody Prediction in LLM-based TTS for Improving Speaker Similarity

会议身份:conference:interspeech:2026:conference-paper-id:mou26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#自回归模型 #大语言模型 #韵律 #语音克隆

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zhenwei Mou:机构信息未能从会议 PDF 纯文本可靠映射
  • Liping Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Yajun Hu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhen-Hua Ling:机构信息未能从会议 PDF 纯文本可靠映射
  • Xin Fang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jian-Qing Gao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

个性化语音合成需以参考语音及其转写与目标文本为输入,生成兼具目标音色与说话风格的波形,难点在于目标文本特有的韵律无法从参考语音静态复制。所提方法先将目标与参考文本按汉字即音节切分编码为音节嵌入序列并提取说话人嵌入与参考韵律词元,再在解码时交替执行两步:依据目标文本、参考信息与已生成历史预测当前音节韵律词元,随后以该韵律为条件自回归生成该音节语音词元并送入流匹配声码器。与整体预计算韵律的链式思考提示相比,关键差异是韵律决策能感知已合成的目标语音上下文从而实现动态风格延续。在ESD评测下,所提方法的字符错误率为5.66,低于CosyVoice(50k)的字符错误率6.38。该结论适用边界受限于中文普通话三套语料验证,跨语种、歌唱与强跨情感迁移等场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要解决哪一步?

本文的输入是三样东西,一段参考语音及其文本转写,一段目标文本,以及从参考语音提取的说话人身份向量,目标是合成出既像该说话人的音色、又像其说话风格的目标语音。输出是目标语音的离散语音标记序列,再经流匹配模块变成波形。必须保留的关键信息是实验全部在中文上进行,一个汉字对应一个音节,音节边界由蒙特利尔强制对齐器给出,训练数据约 50,000 小时,来自 10000 小时级中文语料与多语言语料的中文子集,评测覆盖情感丰富的录音、风格多样的内部录音和韵律中性的录音。

对于刚入门的读者,可以把个性化语音合成理解为模仿任务,音色是这个人是谁,风格是这个人此刻怎么说话,包括快慢、轻重、高低与起伏。过去的大语言模型方法把语言内容、音色和风格混在一起从参考语音里整体学,风格没有显式位置,容易学不充分。本文只动其中一步,就是韵律预测这一步,不改声学后端,不改分词器,只改变大语言模型在何时、以什么为条件预测韵律。

本文的写作顺序按学习依赖展开,先讲任务与已有路线为什么不够,再讲方法全景如何让已生成的目标语音参与预测,然后拆开组件与计算、训练与推理的真实流程,接着交代实验条件如何保证公平,最后看结果与反例,并说明复现时先做什么。本文所有事实只来自论文正文证据与本次收到的官方原图像素,教学用的比喻会明确标为例子,不添加无来源的数值。

已有路线在何处停下,静态韵律计划缺了什么?

已有路线可以分成 3 类。第一类是整体建模,如早期零样本合成与非自回归掩码模型,把内容、音色和风格一起隐式建模,不单独预测韵律。第二类是显式但静态的韵律建模,如基于思维链提示的方法,先根据目标文本与参考韵律 1 次性预测整句音素或音节级韵律标记,再自回归生成语音标记。第 3 类是把音色与韵律分别用嵌入表示,但韵律嵌入仍只从参考语音提取,不看目标文本的风格实现。

本文指出的问题是后两类虽然显式建模了韵律,但都是在合成开始前静态预计算整句韵律,没有把目标语音自身的风格信息用起来。白话说,就是只看了范文和题目就定了全篇语气,没有边写边听上文语气是否连贯。论文因此提出把已预测的目标语音历史作为条件,逐音节动态估计韵律。

下图对比了基线与思维链两种已有做法的输入输出组织,是理解本文改动起点最直接的材料,重点看韵律标记在序列中的位置与生成顺序。

看图路径: 1. 先看上面子图输入端黄色说话人嵌入与绿色文本嵌入、棕色参考语音标记的排列,确认基线只用身份向量加文本与参考语音生成目标语音;2. 再看下面子图蓝色韵律标记出现的位置,确认思维链是先集中生成全部韵律再生成黄色语音标记;3. 对比上下两图虚线回路的跨度,体会静态预计算与后续动态方法在条件来源上的差别

原论文 Figure 1:Illustration of the LLM in CosyVoice\\[7\\] and the CoT prompting\\[9\\].

论文图 1。原论文 Figure 1:“Illustration of the LLM in CosyVoice[7] and the CoT prompting[9].”。

上图上面子图显示基线做法中大语言模型下方输入说话人嵌入、目标与参考文本嵌入和参考语音标记,上方输出目标语音标记并送入流匹配合成语音,没有显式韵律分支。下面子图显示思维链做法下方多了参考韵律标记,上方先集中输出蓝色生成韵律标记,再输出黄色生成语音标记,形成两段式流程。两图共同说明已有方法在生成目标语音之前韵律已经定完,目标语音历史没有回过来影响韵律,这正是本文要改的依赖关系。

要回答的具体问题是什么,什么算变好?

本文要回答的问题是,在大语言模型语音合成框架内,如果让当前音节的韵律预测能够看到此前已生成的目标语音,是否能增强韵律学习能力,并进而提高合成语音与目标说话人的相似度。这里的相似度被明确拆成两个维度,音色是否一致,说话风格是否一致,在情感数据集上风格具体指情绪。

什么算变好在论文中有明确操作定义,主观上由母语听音人做平均意见分评价自然度,做偏好测试评价说话人相似度,偏好更高表示与参考更一致。客观上用字符错误率看可懂度是否变差,用情绪嵌入相似度与情绪识别准确率看情绪迁移,用基频与能量的相关系数与均方根误差看韵律曲线接近程度。相关系数越高越好,误差与错误率越低越好。

一个需要先建立的判断是,自然度持平不等于相似度提升,内容变清晰也不等于风格学对了。本文后续会分别报告这几组指标,避免把可懂度改善直接当作风格改善。

方法全景:沿一个音节走完输入到输出

先沿一个样本走完完整路径。假设目标文本有多个音节,模型输入包括起始符、说话人嵌入向量、全部音节的文本嵌入序列,以及在推理时还包括参考文本嵌入、参考韵律标记与参考语音标记。在生成第 1 个音节之前,模型先读入一个韵律查询嵌入,这个特殊嵌入的作用是触发 1 次韵律预测,输出当前音节的韵律标记。拿到该韵律标记后,模型再逐帧生成该音节的语音标记,直到输出音节结束符,然后进入下一个音节,重复先预测韵律再生成语音的过程,直到整句结束符。

这个全景与已有方法的差别只在条件集合上。思维链只用目标文本与参考韵律预测全部韵律,本文在预测第 i 个音节韵律时,还用到了此前音节的韵律标记序列与语音标记序列。白话说,每定一个字的语气,都先听一下前面已经用该说话人声音说出来的部分,再决定这个字该快还是慢、轻还是重。

思维链提示 × 动态韵律预测: 思维链提示的分工是先 1 次性算出整句所有音节的韵律标记,再开始自回归生成语音标记,把韵律当作前置的静态计划;动态韵律预测的分工是每生成完前面音节的语音标记后,再预测当前音节的韵律标记,然后用它约束当前音节的语音帧。搭配理由是目标文本的风格实现方式只有在听到前文如何说出来之后才能确定,组合意义是把目标语音自身历史引入条件,从静态预计算改为边说边定语气,使韵律更贴合已生成的上下文。

下图展示了这种交替生成的整体结构与推理时的序列组织,是把文字描述落到可执行顺序的关键。

看图路径: 1. 沿下方输入序列从左侧起始符、说话人嵌入、文本嵌入看到紫色韵律查询符,确认每个音节前都有一次韵律触发;2. 观察上方输出端蓝色韵律标记与黄色语音帧标记加粉色音节结束符的交替出现,确认一韵律多语音帧的节奏;3. 追踪虚线回路从已生成的语音帧指回大语言模型输入,确认历史语音参与下一个韵律预测

原论文 Figure 2:Illustration of the LLM architecture integrated with dynamic prosody prediction. 2. Background

论文图 2。原论文 Figure 2:“Illustration of the LLM architecture integrated with dynamic prosody prediction. 2. Background”。

上图可见下方输入从左到右依次是起始符、说话人嵌入、文本嵌入与韵律查询符,上方输出是韵律标记、多个语音帧标记与音节结束符交替出现。图中虚线回路表示输出的韵律与语音会作为下一步输入回送给模型,这正是动态的含义。推理时的序列还区分了参考段与生成段,参考韵律按同样规则从参考语音计算得到,目标段则按上述交替方式边预测边生成,最终语音标记送入流匹配模块合成波形。

组件与计算:韵律向量如何来,模型如何用?

韵律标记的构造过程是完全可复述的。对每个音节,先提取能量与基频,再计算 4 个特征,时长、平均能量、平均基频、基频范围,其中范围是该音节内基频最大值减最小值。4 个值拼成向量后,用在训练语料上学到的 K 均值聚类进行量化,取最近簇中心编号作为该音节的韵律标记。原文聚类数为 512,该聚类同时用于思维链对照与本文方法,保证比较公平。

说话人嵌入 × 韵律标记: 说话人嵌入负责携带参考语音中相对稳定的音色身份,是一个定长向量,在整个 utterance 生成中保持不变;韵律标记负责携带随音节变化的说话风格,如时长、能量、音高均值与音高范围的组合量化结果。两者搭配的理由是只用音色向量无法区分同一音色下的不同情绪与节奏,而只用韵律又会丢失身份,组合后大语言模型在预测每 1 帧语音标记时同时以身份为底、以当前音节韵律为形,从而让风格学习落在目标语音的具体位置上。

大语言模型本身采用解码器 Transformer,原文给出 14 层、16 头、1024 维嵌入、4096 维前馈维度。输入文本按音节切分,输出分两类,一类是韵律标记集合上的概率分布,一类是语音标记集合上的概率分布。语音标记中包含音节结束符与整句结束符,用于控制音节与句子边界。采样时采用核采样与截断采样,原文推理设置为概率阈值 0.8,语音标记候选 25,韵律标记候选 15。

音节级文本嵌入 × 语音标记: 音节级文本嵌入负责给出要说什么,一个汉字对应一个音节嵌入,保持语言内容对齐;语音标记负责给出怎么说,是经语音分词器离散化后的声学单元序列,最终送入流匹配模块合成波形。两者搭配的原因是中文里字与音节一一对应,便于在音节边界处插入韵律查询与韵律标记,组合后模型可以按音节轮流执行预测韵律、再按帧生成语音,形成清晰的输入到表示到输出的单样本走查路径。

需要强调的是,论文没有报告注意力掩码、位置编码或梯度是否截断等细节,解读时不应从模型名称推定这些实现。能确定的是训练时两类标记都有真值监督,推理时按采样得到索引,再交替送回模型,直到结束。

训练时监督从哪里来,权重如何设置?

训练阶段的监督来源是明确的。对训练语料中的每个 utterance,先用强制对齐得到音节边界,再按上述四特征加 K 均值得到每个音节的真值韵律标记,同时用语音分词器得到每帧真值语音标记。损失是两项交叉熵的加权和,一项算在韵律标记预测上,一项算在语音标记预测上,权重变量控制两者比例,原文对照实验中取 0.5。分母上语音损失按总帧数加结束符归一化,避免长句主导训练。

交叉熵损失 × 权重变量: 交叉熵损失负责同时监督两类离散预测,一路是音节级韵律标记的分类损失,一路是帧级语音标记的分类损失;权重变量负责平衡两路损失的相对重要性,原文取值为 0.5。搭配理由是如果只监督语音标记,模型会隐式地混在一起学风格,韵律学习不足,如果只监督韵律则语言内容与声学细节无约束,组合意义是用一个可调系数让模型在训练时既学会选对风格类别,又学会生成对的语音序列。

训练数据是约 50,000 小时中文语音,由强制对齐失败与语言误分类剔除后保留。所有对比中的 3 个模型都在该 50,000 小时数据上从头训练,包括基线、思维链与本文方法,语音分词器与配置保持一致,说话人嵌入由预训练说话人编码器提取。训练共 800,000 步,在 8 张加速卡上进行,学习率 0.0001,预热 10,000 步。论文未报告哪些参数冻结、梯度路径是否截断、优化器类型与批大小,复现时应将这些记为缺项,不应默认与开源实现完全相同。

推理时的构造同样重要。给定参考语音与转写,按同样公式算出参考韵律标记并提取参考语音标记,与说话人嵌入、参考与目标文本嵌入一起送入模型,交替生成目标韵律与语音标记。这里的例子是教学用例子,比如目标句有 5 个字就对应 5 个音节,模型会执行 5 次韵律预测与 5 段语音帧生成,每段以音节结束符收尾。

实验条件:数据、协议与基线是否可比?

评测用了 3 套数据,分别承担不同教学任务。情感语音数据集取 10 个说话人、5 种情绪共 350 句,情绪丰富,用于看风格迁移。内部数据集 230 句无标注但风格多样,由合作方提供,用于看通用风格。中文多说话人语料测试集含 214 个说话人,韵律中性,用于看中性条件下的稳定性。推理协议上,情感集要求参考与目标为同一说话人同一情绪的不同录音,中性集用同一说话人不同 utterance 的转写作为目标文本,内部集从不同 utterance 随机选目标文本。

对比基线在训练量上是对齐的。3 个主要对照都在同样的 50,000 小时数据上训练,分别是无显式韵律的基线、静态思维链、本文动态方法。与开源大模型的对比则训练量不对齐,开源基线用了 100,000 小时或 170,000 小时多语言数据,包含 50,000 小时中文与 50,000 小时英文或 130,000 小时中文,因此只能看趋势,不能当作同条件胜负。客观评价每套取 1000 句,主观评价每套随机抽 20 句由 11 名母语者打分,偏好测试把参考录音与合成语音拼接后判断整段内部一致性,显著性在 0.01 水平报告。

音频示例当前可用,官方演示页状态码 200 可达,地址为演示资源。第三方代码与模型仓库同样当前可用,包括语音合成、情绪表示与流匹配相关仓库,但这些只说明链接可达,不代表权重可直接运行本文配置。

主结果:相似度提升了,自然度与可懂度付出什么代价?

比较的问题是,在相同训练数据与相同主干下,动态方法是否在不损失自然度与可懂度的前提下提高说话人相似度。公平条件是三者同数据、同分词器、同主干结构,指标方向是平均意见分越高越好,偏好比例中选本文方法比例越高越好,字符错误率越低越好。

数据集评价维度录音参考基线思维链本文方法
情感集自然度平均意见分4.21 ± 0.094.01 ± 0.074.00 ± 0.094.07 ± 0.06
内部集自然度平均意见分4.16 ± 0.073.97 ± 0.073.98 ± 0.083.99 ± 0.07
中性集自然度平均意见分4.18 ± 0.084.06 ± 0.064.03 ± 0.104.06 ± 0.07
情感集对基线偏好无偏好选本文19.728.828.851.5
内部集对思维链偏好无偏好选本文21.430.930.947.7

表后解释需要同时说收益与代价。自然度上本文方法与两个对照基本持平,没有明显下降,这是代价侧的结论。偏好上在情感与内部集上本文方法获得约 50% 左右的选择,明显高于基线与思维链,支持相似度提升的判断。但在中性集上偏好优势收窄,对基线与思维链的选择差距变小,出现未胜出或接近持平的情况,说明中性韵律下动态建模的增益有限,这是必须保留的边界。字符错误率上本文方法在 3 套上均最低,报告显示没有损害语言内容,但论文未测量误判率与延迟,不能承诺这些量也改善。

情感相似度 × 韵律特征相关性: 情感相似度负责从整体风格感知上衡量合成语音与参考语音的情绪嵌入余弦接近程度,并辅以情绪识别准确率;韵律特征相关性负责从信号层面衡量基频与能量曲线与录音的相关系数与均方根误差。两者搭配的原因是主观偏好只能说更像,但说不清像在哪里,组合后可以用可计算的情绪与声学曲线证据支撑说话人相似度提升确实来自韵律学习改善,而非单纯音质或内容清晰度变化。

客观韵律侧的证据进一步支撑风格解释。在情感集上本文方法情绪相似度与识别准确率最高,基频与能量相关系数最高、误差最低,表明提升确实伴随韵律曲线更接近录音。相关性不等于因果,但多指标同向变化增加了说服力。

换一种度量看,增益是否还在?

这里按问题组织第二组证据,测的是可懂度、情绪与声学曲线是否同向。如果只看主观偏好,可能担心是音质或内容清晰度带来的错觉,因此用字符错误率、情绪相似度与基频能量相关性做交叉验证。比较对象仍是同数据训练的 3 个模型,条件一致,指标方向是错误率与误差越低越好,相似度、准确率与相关系数越高越好。

数据集模型字符错误率情绪相似度情绪准确率基频相关基频误差能量相关能量误差
情感集基线6.380.87584.3279.5283.6194.086.42
情感集思维链6.140.87684.5279.3182.8294.036.39
情感集本文方法5.660.88486.5680.3280.8194.915.93
内部集基线13.690.80252.31未评测未评测未评测未评测
内部集本文方法10.440.82151.63未评测未评测未评测未评测

表后解释要指出具体代价与反例。收益是本文方法在情感集上错误率最低、情绪与韵律指标全面占优,在内部集上错误率与情绪相似度占优,支持动态条件带来了更好的韵律学习。代价与反例是内部集情绪准确率第二而非第一,基线在该项上略高,说明并非所有情绪指标都胜出。此外内部集因缺少说话人标签未做韵律特征评估,中性集因韵律中性未做情绪评估,这些未评测边界必须说明,不能把某数据集的结论推广到另一个数据集。

论文特有的细节是中性集上本文方法基频与能量相关仍最高、误差仍最低,但主观偏好增益收窄,提示客观曲线接近不一定等比转化为可感知的相似度提升。

哪些结论还不能下,缺了哪项验证?

首先是训练与数据规模的限制。本文主要对照都在 50,000 小时上完成,与开源大模型的比较存在数据量与语种配比差异,论文用可能、潜在等措辞表达小数据弥补大数据差距的判断,应理解为待验证的趋势,而非已证明的等价。原文在中性集上与开源基线的偏好比较显著性未达到 0.01,分别约为 0.10 与 0.65,不能当作胜负。

其次是成本与部署的缺项。论文报告了训练步数、加速卡数量与学习率,但未报告总时长、显存占用、推理延迟、实时率与输出帧率,也未报告采样超参数的消融。动态方法按音节多 1 次韵律预测,理论上增加自回归步数,但实际延迟未测量,因此不能承诺推理开销不变。

最后是适用条件的边界。方法依赖音节边界,中文单字单音节使切分自然,但论文未验证在英文或多音节语言上的表现,也未验证对齐失败、噪声参考或跨情绪目标文本时的鲁棒性。缺失这些证据不是技术错误,但在尝试前应补做对应验证。

复现先做什么,需要哪些超参数与信息条件?

复现的第一步是重建数据管线。用强制对齐得到音节边界,剔除对齐失败与语言误分类,保留约 50,000 小时。对每句提取时长、平均能量、平均基频与基频范围,拼成 4 维向量后用 K 均值聚类,簇数 512,聚类在训练语料上学习,并同时用于思维链对照,保证韵律标记定义一致。

第二步是搭建模型与训练。采用开源实现的主干与语音分词器,说话人嵌入用预训练编码器提取,大语言模型按 14 层、16 头、1024 维、4096 维前馈搭建,损失权重取 0.5,训练 800,000 步,学习率 0.0001,预热 10,000 步,推理核采样 0.8,语音候选 25,韵律候选 15。需要保留的关键超参数都已列出,缺失的优化器、批大小与冻结策略需查开源默认配置并记录,不能默认与原文一致。

第三步是按协议评测。情感集保证参考与目标同说话人同情绪,字符错误率用大模型语音识别得到,情绪用情绪表示模型得到相似度与准确率,韵律算基频与能量的相关与误差,主观找母语者做自然度与拼接偏好。代码开源不等于权重可下载,系统可运行还需流匹配声码器与分词器权重,复现时应先跑通基线再加入动态分支。

何时值得尝试,一句话如何复述方法?

当任务是中文零样本语音克隆,且参考语音风格明显而基线听感像但不像该情绪时,值得尝试本文方法。它的可复述做法是,每个汉字的语音帧生成前,先用说话人向量、全部文本嵌入、此前音节的韵律与语音历史预测当前汉字的韵律类别,再以该类别为条件逐帧生成语音,直到音节结束符,整句结束即停。

常见误解需要澄清。第一,动态不等于用了未来信息,它只用过去已生成的目标语音,不看后文。第二,韵律标记不是连续基频曲线,而是四特征量化后的离散类别,相关性提升指的是用该类别引导后合成曲线的统计接近,而非直接复制参考曲线。第三,自然度持平不代表没有改进,相似度偏好与情绪韵律指标才是本文的主证据。

总体上,论文报告显示动态韵律预测在情感与多样风格数据上提高了说话人相似度与韵律学习指标,在中性数据上增益有限,且缩小大小数据差距的说法仍是潜在趋势,有待未来在更多语种与成本度量下验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总