英文题目:Refining Emphasis Control in Flow-Matching TTS via Preference Alignment and Reinforcement Learning

会议身份:conference:interspeech:2026:conference-paper-id:ye26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #偏好优化 #强化学习 #韵律 #文本到语音

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jiangnan Ye:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiawei Jin:机构信息未能从会议 PDF 纯文本可靠映射
  • Pengfei Tan:机构信息未能从会议 PDF 纯文本可靠映射
  • Chao Yan:机构信息未能从会议 PDF 纯文本可靠映射
  • Xuerui Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhiyong Wu:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

面向中文文本到语音中的重音控制,输入为带重音标记的文本,输出为在指定词上实现可感知凸显且保持自然度的语音,难点在于人工标注稀缺且韵律感知高度非线性。该工作以流匹配骨干F5-TTS为底座,先经监督微调学习标记到韵律的初始映射,再用直接偏好优化在自动构造的偏好对上强化凸显区分度,最后以保持系数的在线强化学习Flow-CPS探索更强且自然的流轨迹。与依赖规则调参或大语言模型标签的已有方案不同,该链条用同一客观韵律度量小波韵律工具串联偏好构造与奖励反馈,并为非自回归模型设计了群组相对优势更新。在200条中文评测集上,最终系统重音凸显度达到1.45,明显高于原生F5-TTS的0.86,且词错误率维持在1.63%附近。该结论目前仅在中文、低资源标注与短句重音场景验证,对英文、长篇章及多重音泛化尚未证明。训练需多阶段迭代与8卡大显存集群支持,推理时延与部署开销原文未量化。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么重音难做?

这篇论文研究的输入是一段带重音标记的中文文本,例如在根本原因 4 个字前后加上类似强标记,目标是合成出对应文字的语音,并且让被标记的词在听感上真正突出,同时整句仍然自然可懂。输出是连续语音波形对应的梅尔频谱轨迹,由流匹配模型逐步生成。必须保留的信息是标记位置、说话人身份和文字内容,不能为了突出而读错字或换嗓音。

难点首先在数据。高质量逐词重音标注需要人一句一句听并标出哪里用力,耗时且量少,论文只拿到 2.5 小时人工标注中文语音。其次在信号本身。重音不是单纯把音量调大,而是音高、能量和时长在上下文中的非线性组合,简单的按规则拉高音高或拉长时长听起来会发硬、像机器人。初学者容易误以为只要数据增强加规则扰动就能解决,但原文指出这类参数化做法与人耳感知的复杂韵律不一致。

重音控制 × 流匹配: 重音控制负责决定哪几个字要说得更突出,流匹配负责把带噪声的声学表示一步步推向目标语音,二者搭配的原因是流匹配本身只保证整体自然流畅,需要一个显式的重音条件信号告诉它在何处加大音高、能量和时长的变化,组合后模型能在保持可懂度的同时实现位置可指定的突出效果。

因此论文选择了一条省数据的路线。以非自回归的 F5-TTS 为底座,外加一个显式重音模块,再用 3 段训练逐步放大可控性。学习时要先理解任务与已有路线的分工,再看新增模块如何把离散标记变成连续韵律,最后看训练如何用自动打分弥补人工数据不足。

已有路线在同输入同目标下各解决了什么,还缺什么?

在相同输入输出下,已有工作大致分 3 类。第一类是规则合成标注数据,例如用语音合成模型调音高能量造重音语料,或用公开接口调时长能量造词级重音数据。这类方法输入可控但输出偏机械,因为线性规则难以复现人自然的非线性韵律起伏。第二类是语言学先验,例如用短语边界、语调单元和句法特征预测句子重音。这类方法在词级评估上有客观框架,但原文指出它们难以覆盖人耳感知的细腻韵律,自动标注精度不够,难以直接训练出鲁棒模型。

第 3 类是指令式大模型语音合成,例如在文本中插入特殊标签引导语言模型生成带重音的语音令牌。这类方法在数据充足时灵活,但训练本身很吃数据,而精准重音标注恰恰稀缺,现有音频大模型在细粒度重音标注上能力也有限。非自回归模型被报道在少量微调数据下仍表现稳健,这也是论文选用 F5-TTS 底座的理由。

同监督条件下的对照是小波韵律工具和重音检测模型。前者基于连续小波变换从音高能量时长估计显著度,提供相对客观的声学度量,后文被复用为偏好排序和奖励来源。后者主要在英文小数据上微调,受说话人和语料规模限制。论文没有把类别差异直接当胜负,而是把小波工具从评估尺子变成训练信号,这是与前人不同的运行阶段复用。

要解决的具体问题与成功标准是什么?

具体问题可以拆成三问。第一,给定带标记文本,模型能否把用力准确落在目标词上,而不是整句都变响或落错位置。第二,用力强度能否逐阶段增强,并且在名词这类训练中少见的词上也能泛化。第三,增强用力时能否保住可懂度和说话人一致性,不牺牲自然度。

成功标准在论文中是多维的。客观侧用显著度衡量目标词突出程度,用词错误率衡量可懂度,用基于语音模型的说话人相似度衡量音色保持。主观侧用重音平均意见分衡量指定位置的突出强度,用自然度平均意见分衡量整句语义焦点是否合适。举例来说,假如输入是根本原因是关键,被标记的根本原因应该比原因更突出,但整句不能听起来断裂,这就是例子,不是论文报告的数值。

论文明确把低资源作为约束。人工标注只有 2.5 小时,后续偏好对和强化学习文本都来自模型生成或自动标注加自动打分。因此评价时要同时看显著度是否上升,以及词错误率和相似度是否守住,这决定了方法是真可控还是以失真换突出。

三段训练全景:一个样本如何走完输入到输出?

先沿一个样本走一遍。假设输入文本是带标记的根本原因,模型先把每个字转成文本嵌入,重音编码器再对同一序列算出一组同维度的重音表示。对于被标记的字,把两组向量按元素相加形成融合条件,没有被标记的字则保持原文本嵌入。这个融合表示作为额外条件送入基于变换器的流匹配主干,主干预测从噪声到目标语音的流,采样后得到带目标韵律的波形。

训练全景分 3 段。第一段是有监督微调,用人工标注数据让重音编码器和主干初步建立标记到声学变化的映射。第二段是直接偏好优化,用微调后模型生成多个候选,再用小波韵律工具打分选出最高分和最低分组成正负对,教会模型偏向更突出的韵律。第 3 段是在线强化学习,用流保持采样保持噪声水平稳定,再用分组相对优势把同一句话的多个轨迹排出高低并更新策略,进一步放大强度同时保持自然。

下图是论文给出的总体结构,左侧是带重音分支的合成模型,右侧是在线优化闭环,读图时注意条件从哪里进入主干、奖励从哪里回传。

看图路径: 1. 先看左图主路径:底部训练数据、时间步和带掩码语音如何进入 DiT 模块再向上得到预测流;2. 再看右上红色虚线框内的重音建模分支:重音编码器输出与文本表示在何处相加后送入 DiT;3. 最后看右图在线优化闭环:扩展 F5-TTS 生成语音后经奖励函数得到分组奖励与优势再回传做策略优化

原论文 Figure 1:Overview of the framework.

论文图 1。原论文 Figure 1:“Overview of the framework. (a) F5-TTS where emphasis embeddings from the Emphasis Encoder are fused with text rep- resentations.”。

左图显示底部有训练数据、时间步、带噪语音和掩码语音进入白色大块,向上经过最终调制和线性层得到预测流,右侧红色虚线框内是重音建模分支,重音编码器输出与文本表示相加后送入主干。右图显示带标记文本进入扩展模型后生成语音,再经奖励函数得到每个词的分数,例如图中对两个词给出不同分值,随后按组算出奖励与优势并回传做策略优化。理解这张图后,再看各组件的具体计算就不会迷路。

重音编码器做了什么计算,为什么要相加融合?

重音编码器的输入是文本嵌入序列,输出是同维度的重音感知表示。内部先用旋转位置编码保留顺序,再用带残差的自注意力捕捉上下文依赖,最后用带层归一化的前馈网络做非线性变换。论文给出的底座是 F5-TTS 第一版基础规模,维度 1024、深度 22 层、16 头,重音编码器共享同样的隐层尺寸和注意力配置,由 4 层变换器组成。

重音编码器 × 文本嵌入: 文本嵌入负责给出每个字的语义身份,重音编码器负责把带标记文本转换成同维度的韵律偏置,二者搭配的原因是直接改文本会干扰发音内容,而相加融合可以在不改变字身份的前提下叠加突出指令,组合后 DiT 主干同时看到说什么和哪里用力,从而生成位置准确的重音。

融合方式是选择性相加。只对带标记的位置取出对应重音表示并加到原文本嵌入上,未标记位置不加。这种设计的教学意义在于建立显式条件通路。离散标记本身无法直接指挥连续的音高能量变化,重音编码器把它翻译成连续偏置,主干在生成每帧时都能看到哪里需要用力。原文报告微调后显著度从 0.86 升到 1.22,支持该通路确实让标记与声学变化对齐,但这仍是相关性证据,不是因果证明,后续偏好和强化阶段才进一步验证强度可调。

需要指出的缺项是论文没有报告重音编码器单独消融的数值,也没有说明推理时若标记缺失或标记位置错误会发生什么。因此不能断言拿掉该模块必然怎样,只能说在完整 3 段流程中它承担了条件翻译的职责。

三段优化各自用什么数据、更新哪些参数、监督从哪来?

第一段是有监督微调。数据是 2.5 小时人工标注中文语音,重音编码器和 F5-TTS 主干联合优化,优化器用学习率为 1 乘 10 的负 5 次方的 AdamW,在 8 卡 80 吉显存的加速器上训练 21500 步。监督来源是真实语音的流匹配目标,模型学习把标记映射到真实韵律变化。这是唯一使用人工精标的一段,后续都依赖自动信号。

第二段是直接偏好优化。模型从微调检查点初始化并继续优化全部可训练参数。数据构造是先用大语言模型给文本标重音,再用微调模型合成语音,用强制对齐得到词边界,再用小波韵律工具算显著度,取最高分和最低分组成 800 个中文偏好对。训练目标在流匹配框架内比较策略模型与参考模型在正负样本上的流预测误差差,超参数包括有监督损失权重 0.5、偏好损失权重 1.0、温度 0.5,学习率同样量级,训练 13000 步。

直接偏好优化 × 小波韵律工具: 小波韵律工具负责用音高、能量和时长算出客观显著度分数,直接偏好优化负责让模型更偏向高分样本而远离低分样本,二者搭配的原因是有监督微调只能模仿少量人工标注,需要自动打分来低成本构造正负样本对,组合后模型在不增加人工标注的情况下学会更强的重音对比。

第 3 段是基于流保持采样的在线强化学习。模型从偏好优化检查点继续优化,数据是 2000 条带重音标注的中文文本。每条文本生成 6 个采样轨迹,用小波显著度做奖励,再按组内均值和标准差归一化成优势值。采样时把常微分方程转成随机微分方程以支持探索,但用保持系数的采样保证每步隐变量噪声水平与调度器一致,避免过大噪声破坏音质。

优化目标中加入策略与参考模型均值距离作为散度惩罚,并去掉传统分母项以避免最后几步除以接近零的数值,同时把优化重心放在多样性更高的早期步。超参数包括散度系数 0.2、裁剪范围 0.1、噪声水平 0.1、对抗裁剪上限 5.0,用大学习率 1 乘 10 的负 4 次方训练 2000 步,奖励从 0.7887 稳步升到 0.9479。

组相对优势 × 流保持采样: 组相对优势负责把同一句话多个采样按奖励减均值除标准差排出高低,流保持采样负责在随机采样时保持每步噪声水平与调度器一致以免音质崩坏,二者搭配的原因是在线强化学习需要既能探索多种韵律又不引入过大噪声,组合后策略能稳定地向高显著度轨迹移动并保留自然韵律。

3 段的依赖关系是前一段给后一段提供更好的起点和采样空间。偏好阶段依赖微调模型的生成多样性,强化阶段依赖偏好模型的初始化。论文未明确报告每段是否冻结主干某些层,因此复现时应默认按全文可训练处理,并在缺项中记录该不确定性。

实验条件:数据、基线、指标方向与运行环境是什么?

数据与协议分四块。有监督用 2.5 小时人工标注中文语音,偏好用 800 对由微调模型生成的中文偏好数据,强化用 2000 条中文标注文本。客观评价中可懂度和说话人相似度在公开中文测试集上测,显著度在 200 条由大语言模型标注的专用测试集上用小波工具测。名词泛化另用 100 句人工标注名词重音的中文句子测试。

基线包括原始 F5-TTS 和语音合成基线。论文说明曾试过多个指令跟随模型和闭源系统,但它们重音调制较弱,未达到明显突出的强度标准,只有中文上效果更明显的基线被保留为主要对照。自身 3 阶段变体分别记为微调版、偏好版和强化版,用于展示逐步改进。硬件统一为 8 卡大显存加速器集群,3 段步数和学习率已在上一节交代。

指标方向要先讲清。显著度越高越好,词错误率越低越好,说话人相似度越高越好。主观重音分 3 分制越高越突出,自然度分越高越自然。名词测试另有控制准确率,越高表示重音落在目标名词上的比例越高。

下表把 3 段的数据规模、优化器设置和硬件预算放在一起,便于复现时 1 次核对,避免把不同阶段的条件混为一谈。

阶段数据规模优化器与学习率硬件与步数监督来源
有监督微调2.5 小时人工标注中文语音AdamW 学习率 1 乘 10 的负 5 次方8 卡加速器共 21500 步真实语音流目标
偏好优化800 对模型生成中文偏好数据AdamW 学习率 1 乘 10 的负 5 次方权重 0.5 比 1.08 卡加速器共 13000 步小波工具排序正负对
在线强化2000 条中文标注文本每提示 6 采样AdamW 学习率 1 乘 10 的负 4 次方散度系数 0.28 卡加速器共 2000 步小波工具分组奖励

该表说明低资源主要指人工标注少,后两段用自动打分放大了数据效率。复现时先准备小规模精标集,再搭建自动标注加对齐加打分的流水线,最后才进入在线采样,否则容易把条件不一致误读成方法无效。

主结果:显著度提升了多少,可懂度和音色守住了吗?

比较问题是 3 阶段方法相对原始模型和外部基线,是否在显著度上更高,同时在可懂度和音色上不明显变差。公平条件是同一客观测试逻辑下比较显著度,同一公开中文集上比较词错误率和相似度,指标方向为显著度和相似度越高越好、词错误率越低越好。

条件指标原始底座3 阶段终版外部基线
显著度越高越好目标词突出分数0.861.451.32
可懂度越低越好词错误率1.56%1.63%3.63%
音色越高越好说话人相似度0.740.710.72
中间阶段越高越好微调与偏好显著度1.22 微调1.42 偏好未报告
稳定性越稳越好3 阶段词错误率区间1.62%1.63%未适用

显著度 × 自然度平均意见分: 显著度负责用仪器测量目标词在声学上有多突出,自然度平均意见分负责用人耳判断整句听起来是否别扭,二者搭配的原因是只看仪器可能把生硬的大起伏当成好重音,只看听感又说不清突出是否到位,组合后可以同时检验用力强度和整体可接受性是否兼得。

表后解释要同时看收益与代价。收益是显著度从 0.86 经 1.22 到 1.42 再到 1.45 逐步爬升,终版超过外部基线的 1.32。代价很小但存在。词错误率从底座的 1.56% 微升到终版的 1.63%,3 阶段内部稳定在 1.62% 到 1.63% 之间,远低于外部基线的 3.63%。相似度从 0.74 微降到 0.71,说明用力增强没有换来明显失真,但音色保持也不是完全无损。

未胜出项是相似度终版略低于底座和外部基线,这提醒不能只看显著度单指标。论文还报告主观听感终版在重音和自然度上均高于基线,与客观趋势一致,但主观样本只有 15 位普通话母语者各听 10 句,推广时需谨慎。

哪一段起了作用,名词这类难词表现如何?

论文没有给出去掉重音编码器的消融,但 3 阶段变体本身构成渐进对照。微调把显著度带到 1.22,说明显式条件通路初步打通。偏好把显著度带到 1.42,说明在微调采样空间内选优能有效放大对比。强化把显著度带到 1.45 并把训练奖励从 0.7887 推到 0.9479,说明分组相对优势的在线探索在保持自然的前提下仍有增益。增量越往后越小,符合先搭通路再选优最后精修的预期。

名词测试是论文特有的泛化检验。名词在训练中占比低且语言多样性大,容易因覆盖不足而落错位置。测试用 100 句人工标注名词重音的句子,比较控制准确率和显著度。

条件指标外部基线偏好版强化终版
名词控制越高越好准确率22.00%37.00%63.00%
名词强度越高越好显著度0.830.961.28
训练奖励越高越好在线奖励起点终点0.7887 起点未单独报告0.9479 终点
采样条件固定每提示采样数与噪声未适用未适用6 采样噪声 0.1
优化约束固定散度系数与裁剪未适用未适用系数 0.2 裁剪 0.1

表后解释要指出反例与边界。偏好版在名词上只有 37.00% 准确率和 0.96 显著度,说明仅靠偏好选优难以覆盖少见词的多样性。强化终版把准确率提到 63.00%、显著度提到 1.28,支持在线探索对欠表示词有帮助。但 63.00% 仍意味着约三分之 1 名词样本控制不准,且该测试只覆盖名词,未评测动词、数词或长句多重音等更难情形。原文也未报告名词测试的词错误率和相似度,因此不能把名词收益推广为整体无代价。

还有哪些没测、不能承诺、容易误读的地方?

首先是奖励与评估同源的风险。偏好排序和强化奖励都用小波韵律工具,客观显著度评估也用同一工具。这能保证训练与测试一致,但可能放大工具本身的偏好,例如对音高能量敏感而对时长或语义合适性不敏感。论文用主观听感做了交叉验证,但主观样本量小且只对比终版与外部基线,没有逐阶段主观曲线。

其次是数据与语言边界。全文实验是中文,人工标注 2.5 小时,偏好 800 对,强化 2000 句。名词泛化只测 100 句。未报告英文或其他语言、跨说话人、跨风格或噪声环境下的表现,也未报告推理延迟、实时率和显存占用。因此不能承诺该方法在其他语言或部署成本上同样改善,训练资源与推理开销要分开讨论。

第三是缺项与冲突提示。论文未明确每段参数冻结细节,未给出重音编码器消融,未报告误判率统计显著性。资源状态方面,本次未发现来源绑定且完成验证的公开资源,不得声称代码模型或数据已公开,演示链接在本次解读中不作为可用性证据。读数时注意百分点与相对百分比不同,不同指标差值不能混放一列,自动显著度不能当成人评,这些口径在上表中已按原文分开。

要复现这条管线,先做什么、按什么顺序检查?

第一步复现数据管线。准备少量人工精标中文语音并统一标记格式,用大语言模型给无标注文本标重音,再用强制对齐得到词边界,最后用小波韵律工具算显著度。先检查对齐边界是否准确,因为边界错 1 位,显著度就会算到邻词上,后续偏好对全错。

第二步复现模型与微调。基于流匹配底座加入 4 层重音编码器,保证输出维度与文本嵌入一致,只对标记位置相加。用小学习率联合微调并监控显著度是否从基线附近上升,同时盯住词错误率不明显恶化。若显著度不动,先查标记是否真正进入融合,而不是先调大模型。

第三步复现偏好与强化。用微调模型每句多采样并按显著度取最高最低组成偏好对,复现偏好训练的损失权重和温度。在线阶段按每提示 6 采样、噪声 0.1、散度系数 0.2、裁剪 0.1、对抗裁剪上限 5.0 启动,观察奖励是否从 0.78 附近稳步上升。若奖励抖动大,优先查组内归一化与散度惩罚是否生效,而不是直接加大奖励系数。

关键超参数与信息条件要保留。微调与偏好学习率均为 1 乘 10 的负 5 次方,强化为 1 乘 10 的负 4 次方,硬件均为 8 卡大显存,步数分别为 21500、13000 和 2000。复现时区分代码开源、权重下载和系统可运行三件事,缺任何一件都不能称为可运行复现。

何时值得尝试这套方法,如何一句话记住它?

当任务是中文或类似低资源语言、只有几小时精标但需要位置可指定的重音,且已有流匹配底座时,这套方法值得尝试。它的核心记忆点是先用小数据搭通标记到韵律的桥,再用自动打分选出更好的用力,最后用分组比较在线精修用力强度。每一步都不增加人工标注,却让显著度逐步从 0.86 走到 1.45。

适用条件也很清晰。需要可靠的词边界对齐和相对可信的显著度工具,需要接受相似度从 0.74 到 0.71 的微降,需要在名词等多样本上另做验证。若目标是多语言通用、实时部署或极端自然度优先,还需补上对应评测、延迟成本和更大规模主观检验,才能判断收益是否成立。

回到初学者的复述。输入是带标记文本,输出是目标词更突出的自然语音。重音编码器把标记翻译成韵律偏置并加到文本上,3 段训练分别解决对齐、选优和精修。用显著度、词错误率、相似度和小规模听感共同验收,既看到强度提升,也看到边界与代价,这才是可核对的方法理解。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总