英文题目:Improving Flow Matching based Text-to-Speech with Dual-Model Preference Optimization and Classifier-Free Guidance

会议身份:conference:interspeech:2026:conference-paper-id:chen26y_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #偏好优化 #零样本 #文本到语音

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Minchuan Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Chenchen Wan:机构信息未能从会议 PDF 纯文本可靠映射
  • Junjie Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Peng Qi:机构信息未能从会议 PDF 纯文本可靠映射
  • Shaojun Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jing Xiao:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

零样本文本到语音的输入为目标文本与短参考音频,输出为保留音色并准确发音的语音,难点在于同一条件下采样质量波动大且训练目标与人类感知的不一致。本文先用预训练流匹配模型对同一提示多次采样并以词错误率与说话人相似度做帕累托排序构造偏好对,再以两个同初始化模型分别拟合偏好分布与非偏好分布并用联合目标协同优化,随后在采样端以三项引导组合偏好速度场与代理提示下的非偏好速度场,同时引入投影缩放与首步置零来稳定无分类器引导。与单模型直接偏好优化相比,解耦建模避免了正负信号在同一参数上的冲突,并把偏好信号显式带入推理引导。在Seed-TTS test-zh上偏好双模型将词错误率从基线4.24降至3.06且相似度同步提升,挑战文本训练的版本进一步降至2.87,证实了小规模代理偏好数据的有效性。该结论目前仅在中英双语朗读类评测与上述代理指标下成立,未验证真实人类偏好、情感韵律与低资源语言的外推能力。原文未披露训练、推理或部署成本,未来工作承认需用蒸馏与低秩适配降低双模型开销。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么难一次做好?

这篇论文研究的输入是两部分:一是待合成的文本,二是一段短的参考音频,参考音频来自合成时未见过的新说话人,不对其做针对性训练。输出是一段语音,要求读对文本内容,同时听起来像参考音频的说话人。评价围绕三件事:读得对不对、像不像目标人、自然不自然。

对刚入门的同学,先把白话和术语对齐。流匹配,英文是 Flow Matching,是一种生成模型训练思路,它学习一个速度场,也就是在每个中间时刻告诉样本该往哪个方向走一小步,从而把标准噪声逐步搬运到真实语音的分布上。零-shot 语音合成,英文是 zero-shot TTS,指只给几秒参考音频就能模仿新说话人,不需要为这个人重新训练。基座模型选的是 F5-TTS Small,一个基于流匹配加 Diffusion Transformer 的框架,训练任务是文本引导的语音补全,不需要单独的时长模型、文本编码器或音素对齐。

难点在于同一输入对应多种可能输出,质量波动大。有的采样文本依从好、音色像,有的会出现错读、漏读或音色漂移。传统训练目标是拟合数据分布的流,而最终评价是可懂度、说话人相似度和自然度,两者不一致。论文因此要解决训练与评价错位,以及采样阶段如何稳定地推向更好的输出。

流匹配 × 零-shot 语音合成: 流匹配负责学会从噪声到语音声学特征的速度场映射,提供生成机制,零-shot 语音合成负责只给一段未见说话人的参考音频和新文本就模仿其音色,分工是前者管怎么生成连续语音,后者管生成时要满足什么文本与音色条件,搭配原因是流匹配的文本引导语音补全任务天然适合做条件生成,组合意义是把速度场估计与文本加参考音频的条件输入绑定,让同一框架完成可泛化到新说话人的合成。

本解读的输入是论文正文证据与 3 张官方原图像素,目标是让研究生能复述方法、条件与结论。必须保留的信息包括数据来源与规模、基线配置、偏好对构造方式、训练与采样超参数、评价指标方向与关键数字。输出按学习依赖展开,先讲任务与路线,再讲全景与组件,最后讲实验与复现边界。

术语速查与符号阅读顺序

为方便复述,把关键术语的阅读顺序固定下来。先读条件,文本与参考音频共同决定应说什么、像谁说。再读速度场,每个时刻的向量告诉频谱特征往哪走。接着读胜者与败者,由代理指标排序得到,不是人工逐条打分。最后读引导强度、代理提示、优化尺度与零初始化,它们都作用在采样组合上。

符号阅读建议按输入到输出的顺序:条件为先,噪声为起点,偏好速度与非偏好速度为两路中间量,最终速度为汇合量,波形为终点。遇到缩写时先还原英文全称再回代中文白话,避免把说话人相似度误读成人评相似度,把比较平均意见分误读成绝对分。

本节不新增实验结论,只解决论文特有的误解:单模型偏好优化的冲突不是实现 bug,而是同一参数集同时优化相反目标的结构性折中;常规无分类器引导的不足不是引导本身无效,而是它没有接入偏好信号,因此需要双模型的负向来补足。

已有路线在同一任务上做到哪一步,还缺什么?

偏好对齐这条路线,先要理解直接偏好优化,英文是 Direct Preference Optimization,简称 DPO。它不单独训练奖励模型,而是直接用胜者相对败者的排序对去调整策略,让策略相对参考策略的胜者似然更高、败者似然更低。组相对策略优化,英文是 Group Relative Policy Optimization,简称 GRPO,则是用组内相对奖励做优化。论文在相关工作中列出语音领域的尝试,包括用转录准确率和说话人相似度驱动的编解码模型对齐、对时长预测器做偏好优化、用多奖励强化学习改进低资源多语种合成等。

另一条路线是无分类器引导,英文是 Classifier-Free Guidance,简称 CFG。它在训练时以一定概率丢掉条件,同时学会条件速度场与无条件速度场,采样时把两者线性组合,推向条件分布、远离无条件分布,从而在保真与多样性之间权衡。

直接偏好优化 × 代理指标: 直接偏好优化负责把胜者样本相对败者样本的排序信号变成策略相对参考策略的似然差,提供对齐机制,代理指标词错误率与说话人相似度负责把难规模化的人类听感转成可自动计算的胜负判定,提供监督来源,搭配原因是语音偏好涉及可懂度、音色、韵律等多维且人工标注贵,组合意义是用可扩展的自动排序构造胜负对,再交给偏好优化去拉开胜负分布的差距。

已有工作的缺口有两处。第一,多数偏好优化把偏好与非偏好信号放在同一个模型里平衡,论文认为这会造成参数冲突,只能得到折中解。第二,常规 CFG 只区分有条件与无条件输入,没有利用偏好训练得到的喜欢与不喜欢信号,因此采样时不能准确增强偏好属性或抑制不希望的行为。论文的定位就是把双模型偏好优化与改进的 CFG 在训练与采样中统一起来,并用词错误率和说话人相似度作为可扩展的代理偏好。

同输入同目标的对照应如何公平阅读?

公平对照要求同输入、同目标、同监督与同运行阶段。论文的同条件对照是基线、单模型偏好对齐与双模型偏好对齐,它们共享预训练数据、声码器与测试集,区别只在偏好建模是一套参数还是两套参数,以及采样是否用改进引导。这部分胜负可以直接读。

与外部工作的对照则属于不同条件。论文列出的情感可控、时长偏好、多语种多奖励等工作,输入、目标语言、数据规模与奖励设计均不同,不能把类别差异当成同条件胜负。正确读法是把它们当作路线参考:证明代理指标与偏好优化在语音中可行,但具体数值不可跨论文直接排名。

对初学者特别提醒:自动指标的提升不等于人评必然提升,本文用主观分同向变化来佐证,但若换场景仍需重做人听。相关性不等于因果,没有随机种子、显著性与消融之外的机制证据时,不做必然性断言。

论文把问题切成哪两步,每步要回答什么?

第一步是训练阶段如何更干净地利用胜负对。给定条件输入 c,包括文本条件与音频条件,模型输出分布包含多种质量的候选。构造明确标注的胜者与败者后,目标是让生成分布移向胜者、远离败者。单模型做法是用一个参数集同时记住两种相反要求,论文认为这会互相牵制。

第二步是采样阶段如何把偏好信号真正用起来。即使训练阶段学到了偏好,推理时若仍用传统 CFG,只会推向文本条件、远离空条件,偏好信息被浪费。论文要回答的是如何让采样同时利用偏好模型的正向与非偏好模型的负向,并控制引导强度与起始稳定性。

举一个教学例子帮助理解,但不代表论文数值:假设同一句话生成 5 个版本,按自动转录错误和音色相似度排出最好与最差,训练希望最好版本概率上升、最差版本概率下降,采样希望每一步都往最好版本的方向多走一点、往最差版本的方向少走一点。这个例子只是说明胜负对与引导的思想,实际排序规则与数据构造以论文实验设置为准。

双模型加引导的全景是什么,样本走完哪条路?

方法全景可以沿一个样本走一遍。训练时从同一个预训练流匹配模型复制出两个起点相同的模型,一个负责偏好,一个负责非偏好。给它们相同的条件格式,即文本加参考音频,但喂不同的监督目标:偏好模型多看胜者样本的特征,非偏好模型多看败者样本的特征。优化目标是让 2 个模型的奖励分数之和最大,同时各自不偏离参考模型太远,以稳定训练。

推理时 2 个模型协同工作。偏好模型接收真实条件,输出条件速度;非偏好模型接收一个代理提示,把真实条件与空提示线性组合而成,输出负向速度。最终速度是两者的加权组合,权重由引导强度控制,再加上优化尺度与零初始化两处改进。声码器采用预训练的 Vocos,把声学特征转成波形。

下面这张图是理解分叉与汇合的关键,左侧是训练分叉,右侧是推理汇合,请按导读顺序阅读全景结构。

看图路径: 1. 先看左侧灰色预训练流匹配模型如何分叉到上下两个同起点模型;2. 再看中间黄色区上下分别标注偏好优化与非偏好优化的输入差异;3. 最后看右侧蓝色推理区偏好模型接条件 c 与非偏好模型接代理提示的汇合公式

原论文 Figure 1:The training and inference processes of the proposed method.

论文图 1。原论文 Figure 1:“The training and inference processes of the proposed method.”。

从像素可见,图被中间虚线分成训练与推理两大区。左侧灰色块是预训练流匹配模型,向右分叉到橙色偏好分支与绿色非偏好分支,训练区每个分支下方都标注文本与一段波形输入,说明条件格式一致。右侧蓝色推理区上方橙色块是偏好对齐模型,接收条件 c 并输出速度,下方绿色块是非偏好对齐模型,接收代理提示并输出速度,两路速度在右侧灰色公式块汇合成最终速度。该图支持的判断是训练解耦、推理融合,限制是图本身不给出损失数值与超参数,需结合正文的训练与采样小节复述。

两个模型各自算什么,采样公式如何组合?

先讲训练侧的计算目标。原文给出统一目标的思想是最大化 2 个模型的奖励分数之和,偏好模型对胜者打分,非偏好模型对败者打分,再经过 Sigmoid 变成排序损失。论文指出朴素的单模型 DPO 损失在此不适用,因为现在有两个待优化的分布。对流匹配而言,整条从噪声到数据的去噪链都要计入该排序目标,且每个模型都要与参考模型保持接近,避免跑偏。原文未给出逐层梯度是否冻结、优化器类型与学习率等细节,这部分属于缺项,复现时只能按 F5-TTS Small 的常规继续训练理解,不能从模型名推定。

再讲采样侧的组合。论文给出三项引导的思想:偏好分布的正向、非偏好分布的条件部分与无条件部分的调节,通过超参数控制纳入或排除非偏好信息的程度。具体实现是构造代理提示,把真实条件与空提示线性组合后喂给非偏好模型,从而把 2 个条件统一成 1 次前向,减少推理前向次数。最终速度是偏好条件速度的放大减去非偏好代理速度的加权,权重含引导强度与投影尺度。

双模型偏好优化 × 无分类器引导: 双模型偏好优化负责让偏好模型拟合胜者分布、非偏好模型拟合败者分布,避免单模型同时拉高胜者又压低败者的参数冲突,无分类器引导负责在采样时把条件速度场与无条件或代理条件速度场线性组合以增强条件依从,分工是前者在训练阶段解耦两种分布,后者在推理阶段融合两种速度,搭配原因是两者结构上都是推向一种分布而远离另一种,组合意义是把偏好模型的条件输出作为正向,把非偏好模型的代理提示输出作为负向,实现偏好感知的引导采样。

改进的 CFG 有两项。第一是优化尺度,引入标量系数,计算方式是条件速度与非偏好速度的点积除以非偏好速度的平方范数,相当于把条件方向投影到非偏好方向上做校准。第二是零初始化,把常微分方程求解器最初几步置零,以稳定早期近噪声输入。论文称这两处改动额外计算很小,但能有效提升样本质量。

优化尺度 × 零初始化: 优化尺度负责把条件速度投影到非偏好速度方向上得到标量系数,修正引导强度以得到更准确的速度估计,零初始化负责把常微分方程求解器最初几步置零以避开近噪声输入的不稳定引导,分工是前者管每一步方向的幅度,后者管起始阶段的时间门控,搭配原因是早期噪声大时引导误差最容易放大,组合意义是在不明显增加计算的前提下同时稳定方向与起点,提升采样质量。

需要澄清的误解是双模型不等于 2 倍效果的简单叠加。它的作用是让各自拟合各自的目标分布,避免单模型折中,采样时才把有用信息组合起来。若只看参数量会误以为开销翻倍就一定更好,实际收益取决于胜负对质量与引导强度的配合,这一点要到实验部分用数据验证。

偏好对如何构造,训练与推理参数如何设置?

预训练数据是两部分:WenetSpeech4TTS Premium 的 945 小时中文多说话人语料,以及 LibriTTS 的约 585 小时英文多说话人语料。预训练训练 600K 步,在 4 张 NVIDIA A800 上进行,批大小按帧计为 153600 帧。基线是 F5-TTS Small,DiT 部分为 18 层、12 头、768 维嵌入,ConvNeXt V2 部分为 4 层、512 维嵌入,总计 158M 参数。

偏好数据构造了 3 种各 2000 对的方案。DT1 用真值作为胜者、预训练模型生成作为败者,来自内部多说话人数据集。DT2 用常规文本生成,每个提示文本生成 5 个音频,采样超参数主要是 CFG 强度多样化,再按词错误率与说话人相似度的帕累托排序选最好与最差作为胜负对。DT3 与 DT2 流程相同,但文本换成挑战文本,包括重复文本、绕口令等,由 DeepSeek 生成。DPO 阶段训练 10 个轮次,批大小按帧计为 6400 帧,硬件同样是 4 张 A800。单模型 DPO 对比记为 PA-Base,双模型记为 PA-Dual,预训练数据集保持相同。

推理设置沿用 F5-TTS Small 的配置:欧拉常微分方程求解器,Sway 采样系数为负 1.0,函数评估次数为 32,代理提示系数为 1.0,CFG 强度选 2.5。评价用 Seed-TTS-eval 的 test-en 与 test-zh,可懂度用 Whisper large-v3 测英文、用 Paraformer 测中文得到词错误率,说话人相似度用基于 WavLM-large 的说话人验证模型,自然度用 UTMOS,主观评价招募 24 人做比较平均意见分与相似度平均意见分,随机选 30 条未见文本。

原文明确报告超参数冻结与更新的只有模型初始化自同一参考模型、继续训练的轮次与批大小,未报告优化器、学习率、梯度裁剪与丢条件概率等,复现时应标记为缺项,不猜测。

测什么、和谁比、条件是否一致?

实验按 3 个问题组织。第一,偏好对齐是否在可懂度、相似度与自然度上超过基线,比较对象包括基线、单模型偏好对齐与双模型偏好对齐,条件是同一预训练数据与同一声码器,指标方向是词错误率越低越好,说话人相似度、UTMOS、比较平均意见分与相似度平均意见分越高越好。第二,偏好数据构造方式与规模如何影响效果,比较 DT1、DT2、DT3 以及不同对数。第三,CFG 强度与两项改进各自贡献多少,通过扫引导强度与消融零初始化和优化尺度回答。

数据与协议方面,训练用中英文混合预训练集,偏好训练用上述 3 种 2000 对,测试用 Seed-TTS 的中英文集。主观评价的比较平均意见分以合成与真值相对提示的自然度差异计分,范围为负 2 到 2,相似度平均意见分对合成与提示的相似度打 1 到 5 分。客观指标的聚合对象是测试集上的整句平均,但原文未报告置信区间与显著性检验方法,这限制了对小幅差异的因果断言。

关于资源状态需要明确说明:本次收到的证据中资源状态为未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开。原文末尾虽给出演示页链接,但本次未能确认可达,解读中不将其作为可运行依据。

主结果显示什么收益,代价与反例是什么?

比较的问题是:在相同预训练与声码器条件下,双模型是否比基线与单模型在中英文可懂度与音色相似度上更好。指标方向已在上一节交代,词错误率向下为好,其余向上为好。下表整理论文报告的主结果,包含基线、单模型与双模型在两种偏好数据下的表现,挑战文本的双模型单独列出以观察文本难度的作用。

条件test-zh 词错误率↓test-zh 说话人相似度↑test-en 词错误率↓test-en 说话人相似度↑自然度与主观↑
基线4.240.5533.460.591UTMOS 中文 2.575 英文 3.817
单模型加常规文本对3.450.5922.830.614UTMOS 中文 2.686 英文 3.881
双模型加常规文本对3.060.6282.450.608UTMOS 中文 2.733 英文 3.909
双模型加挑战文本对2.870.6342.380.625UTMOS 中文 2.728 英文 3.916

表后解释需要同时讲收益与代价。收益是双模型在常规文本对上已超过单模型,中文词错误率(%)从 3.45 降到 3.06,中文相似度从 0.592 升到 0.628,换用挑战文本后进一步降到 2.87 并把相似度推到 0.634,英文侧也有同向改进。自然度与主观分呈一致提升趋势,支持词错误率与说话人相似度作为代理偏好是有效的。代价是推理需要同时运行偏好与非偏好 2 个模型,存储与计算高于单模型,且真值对生成的 DT1 提升最小,说明区分真假样本过于简单,模型能力增益有限,这是一个未胜出项。未评测边界包括长文本、噪声参考与跨语种音色保持,原文未给出结论。

数据规模的趋势由下图承担,横轴是偏好对数,纵轴双轴分别显示词错误率与相似度,请先看拐点再谈数据效率。

看图路径: 1. 先确认横轴是偏好对数量从 0 到 2000,左轴是词错误率右轴是说话人相似度;2. 再对比蓝色词错误率在 0 到 250 对之间陡降、之后趋平的拐点;3. 最后观察橙色说话人相似度持续爬升但在 500 对后斜率放缓的形态

原论文 Figure 2:Results of WER and SSIM on different data scales for DPO training. Evaluated on Seed-TTS test-zh.

论文图 2。原论文 Figure 2:“Results of WER and SSIM on different data scales for DPO training. Evaluated on Seed-TTS test-zh.”。

从像素可见,蓝色词错误率(%)曲线从 0 对时的约 4.2 以上陡降到 250 对时的约 3.1,之后随对数增加缓慢下探到 2000 对时的约 2.9,橙色相似度曲线从约 0.55 爬升到 250 对时的约 0.59,再到 500 对时的约 0.60,之后在 0.60 到 0.63 之间缓升。正文据此报告词错误率(%)在约 250 对附近稳定,相似度在约 500 对附近进入平台,后续增加数据收益不大,支持小量偏好数据即有效,但总体趋势不等于每增加一批都单调变好,图中 1000 到 1250 对之间可见小幅波动。

引导强度与两项改进各自贡献多少?

消融要回答两个操作问题:引导强度扫多少最合适,去掉优化尺度或零初始化会掉多少。论文把引导强度从 1 到 3 以 0.25 为步长扫描,观察词错误率(%)下降与相似度上升的 trade-off,最终选 2.5。下表整理改进 CFG 的消融,条件是同一双模型,指标方向与主结果一致。

配置词错误率↓说话人相似度↑UTMOS↑比较平均意见分↑
双模型完整改进2.860.6342.728-0.28
去掉优化尺度2.960.6282.677-0.40
去掉零初始化3.090.6012.682-0.42
两项都去掉3.130.5782.616-0.61

表后解释是两项改进都有正向贡献,但零初始化的增益更明显,论文解释为避免了早期音色崩溃与发音不稳定。去掉任一项都会让词错误率回升、相似度与自然度回落,两项都去掉时中文词错误率回到 3.13,相似度回到 0.578,比较平均意见分回到负 0.61,仍优于基线但明显弱于完整改进。反例是该消融只在中文集上报告,未给出英文侧是否同向,属于未评测边界。

引导强度的细节由下图承担,左右面板分别显示词错误率与相似度随引导强度的变化,请注意 3 条数据曲线的相对位置。

看图路径: 1. 先确认左右两面板横轴都是引导强度从 1 到 3,左面板纵轴是词错误率右面板是说话人相似度;2. 再对比三条偏好数据曲线中挑战文本曲线在左面板下降最深;3. 最后看右面板在 2.5 附近多数曲线达到高点、之后波动或持平

原论文 Figure 3:Effect of CFG scale on WER (left) and SSIM (right). Evaluated on Seed-TTS test-zh.

论文图 3。原论文 Figure 3:“Effect of CFG scale on WER (left) and SSIM (right). Evaluated on Seed-TTS test-zh.”。

从像素可见,左面板 3 条曲线总体随引导强度增大而下降,其中橙色真值对生成曲线位置最高,蓝色常规文本与黄色挑战文本曲线位置更低,黄色在 2.0 之后降到最低。右面板 3 条曲线总体随引导强度增大而上升,黄色与蓝色在 2.5 附近达到约 0.62 的高点,橙色始终在约 0.54 到 0.58 之间波动。该图支持的判断是增大引导强度有助于文本与条件依从,但不能推广为越大越好,超过 2.5 后部分曲线持平或回落,且该扫描只在中文集上进行。

哪些结论有边界,哪些量没有被测量?

直接报告的是在 Seed-TTS 中英文集上,双模型加改进引导在词错误率、说话人相似度、UTMOS 与主观分上优于基线与单模型,且仅需数百对偏好数据即进入平台。有限解释是词错误率与说话人相似度可作为人类偏好的有效代理,这得到主观分同向提升的支持,但支持不等于证明所有听感维度都被覆盖,韵律、情感与口音等未单独评价。

未验证的推测需要用可能与待验证表达。挑战文本带来更低词错误率,可能与困难样本提供更难区分的排序信号有关,但论文未做样本难度与梯度贡献的因果分析,待验证。零初始化避免早期崩溃的机制解释来自经验观察,论文未给出每步误差的分解,同样待验证。

缺失证据不是技术错误,但要明确未测量项:推理延迟、实时率、显存占用、误判率与统计显著性均未报告,因此不能承诺延迟或成本得到改善。训练资源只给出卡数与步数,未给出总时长与能耗,部署开销需单独测量。总体趋势不等于每组都成立,例如英文相似度在常规文本对上双模型与单模型的差距小于中文,跨语言泛化需更多验证。

要复现先做什么,需要哪些超参数与检查点?

复现的第一步是准备与论文一致的基线。按 F5-TTS Small 的结构搭建 18 层 DiT 与 4 层 ConvNeXt V2,总参数 158M,用 945 小时中文加 585 小时英文做预训练,或直接从同一预训练 checkpoint 继续做偏好训练。声码器用预训练的 Vocos,求解器用欧拉法,Sway 系数设为负 1.0,函数评估次数设为 32。

第二步是构造偏好对。常规做法是对每条提示文本用不同 CFG 强度生成 5 个版本,再按自动词错误率与说话人相似度做帕累托排序,取最好与最差组成 1 对。挑战文本需包含重复与绕口令类型。若只想验证数据效率,可先从 250 对与 500 对两个规模起步,分别检查中文词错误率与相似度是否出现拐点,再决定是否扩到 2000 对。

第三步是训练与采样。复制同一参考模型为两个起点,分别拟合胜者与败者分布,DPO 阶段按 10 轮、帧级批大小 6400 在 4 卡上运行。采样时偏好模型接真实条件,非偏好模型接代理提示,代理系数设为 1.0,引导强度从 1 到 3 扫描并重点检查 2.5,同时对比去掉优化尺度与零初始化的变化。评价时英文用 Whisper large-v3、中文用 Paraformer 计算词错误率,用 WavLM-large 验证模型计算相似度,用 UTMOS 看自然度,主观评价需固定 30 条未见文本与 24 人规模才能可比。

必须保留的关键信息条件是条件输入包含文本与参考音频、胜负对来自模型输出分布而非仅真假区分、推理同时依赖双模型输出。缺项是优化器、学习率、丢条件概率与随机种子,复现报告应如实标注。

何时值得尝试这个方法,如何一句话记住它?

当你的流匹配语音系统已能合成可懂语音,但同一输入多次采样质量不稳,且人工标注预算只够做几百对时,这个方法值得尝试。它的核心是用 2 个模型把喜欢与不喜欢分开记住,再在采样时把正向推力与负向斥力一起用,并用投影尺度与起始置零稳住引导。

一句话记住它是训练分叉、推理汇合:训练让偏好模型专学好样本、非偏好模型专学差样本,推理把好模型的条件输出放大、把差模型的代理输出减掉。适用条件是已有可靠的自动排序指标,若词错误率与相似度在你的场景与人听感不一致,需要先校准代理指标再做偏好训练。

还需要补的验证包括英文与多语种消融、延迟与显存的部署测量、长文本与噪声参考的鲁棒性,以及与时长偏好、多奖励强化学习的同条件对照。区分清楚代码开源、权重下载与系统可运行三件事,本次证据不支持已公开的断言,复现应从数据与基线做起,不把小规模平台期的趋势误读为数据越多必然越好。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总