英文题目:Improving Stable Speech Synthesis Post-Training with ChatScorer and Margin-Based Preference Construction

会议身份:conference:interspeech:2026:conference-paper-id:niu26c_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#偏好优化 #主观评测 #后训练 #文本到语音

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Shihao Niu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jianguo Wei:机构信息未能从会议 PDF 纯文本可靠映射
  • Wenhuan Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xianghu Yue:机构信息未能从会议 PDF 纯文本可靠映射
  • Wei Li:机构信息未能从会议 PDF 纯文本可靠映射
  • Ming Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Ming Cai:机构信息未能从会议 PDF 纯文本可靠映射
  • Luo Si:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

面向编解码语言模型文本到语音后训练中多指标融合奖励区分度弱、机器感坏样本难以抑制的问题,本文以前训练偏好数据提纯而非改优化器为切入点开展方法研究。流程先由基座模型对同一聊天风格长文本采样多候选,再用内容一致性、说话人相似度与会话评分器融合排序,随后经间隔过滤只保留优劣差距清晰的候选组,最后将有序子集送入直接偏好优化或排序变体学习。与直接拿融合标量做在线奖励的方法差异在于,融合分只用于排序与筛选,不直接作为梯度目标,从而避免弱分离监督污染训练。在500条长聊天测试提示、每提示多候选的评测设置下,Rank3DPO的BadRate指标为2.44%,低于SFT基线的BadRate指标12.66%。结论仅适用于CosyVoice2-0.5B单基座与2000条训练提示、500条测试提示的短规模聊天语料下的稳定性提升,跨说话人、跨语言与大规模在线优化尚未验证。训练使用2张NVIDIA A800硬件,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 演示资源:https://hajararabiu869.github.io/demo/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决的稳定合成问题是什么?

这篇论文研究的是编解码语音合成的后训练问题。先用白话解释术语:编解码语音合成就是先把语音压缩成离散单元,再用类似大语言模型的自回归模型根据文本预测这些单元,最后还原波形的方法;后训练就是基座模型已经训练好之后,再用偏好数据或奖励信号做 1 次对齐微调的过程。

论文的输入是一个文本提示,输出是同一文本的多个候选语音,目标是从中选出更稳定、更少机器味的生成方式。需要保留的关键信息是:基座模型采用 CosyVoice2-0.5B,监督微调模型只用于候选生成,而偏好后训练是在原始基座模型上进行。

评估同时看可懂度、说话人相似度和稳定性。论文要解决的矛盾是,已有方法把字符错误率、说话人相似度等异构指标直接加权成一个标量奖励,候选之间的分数拉不开,导致监督信号模糊,机器味明显的坏样本压不下去。

编解码语音合成 × 后训练: 编解码语音合成负责把文本提示生成离散语音单元再还原为波形,承担基础生成能力;后训练负责在基础模型已能说话之后,用偏好或奖励信号调整其输出分布,承担对齐稳定性和风格偏好的任务。二者搭配的原因是前者容量大但采样随机性强,后者不重训整个声学解码器而主要修正自回归语言模型的选择,因此组合的意义是用较小的后训练代价减少坏样本而不重建合成系统。

对于刚入门的研究生,可以这样理解学习依赖:先要懂自回归采样会带来随机性,同一个文本用不同随机种子会生成质量不同的语音。再懂自动指标各管一摊,读错字和不像说话人是两回事,机械味又是第三回事。最后才懂偏好优化需要差距明显的正负例,如果正负例几乎一样,模型就不知道该往哪边改。

已有路线用了哪些监督,本文在哪个环节改动?

论文在引言中梳理了两条相关路线。第一条是直接偏好优化路线,包括 NaturalSpeech 3 引入人类反馈改善可控性,Emo-DPO 用于情感语音合成,细粒度偏好优化关注局部片段错误以提高鲁棒性。这些方法的特点是离线构造偏好对,用一个偏好和一个拒绝样本做对比学习。

第二条是分组相对策略优化路线,包括用自动语音识别奖励做基于大语言模型的语音合成,用词错误率和说话人相似度奖励做流匹配语音合成,以及多奖励分组相对策略优化改善单码本模型的韵律稳定性。这些方法的特点是在线采样并用融合标量奖励更新策略。

本文的改动不在提出全新的优化器,而在监督信号的可学习性。原文指出,已有方法主要依赖自动指标及其加权组合作为优化信号,这类信号不足以可靠抑制明显机械化的候选。当多个奖励合并为单一标量时,候选分数可能只是弱分离,导致偏好优化中的模糊监督。

因此本文同时改奖励和数据两个环节:一是增加专门识别不受欢迎会话风格输出的辅助奖励模型,二是只保留差距足够大的候选组。这样既兼容直接偏好优化,也兼容排序偏好优化和分组相对策略优化。不要把本文误读为提出新的语音合成器,也不要误读为提出通用平均意见分预测器。

为什么直接把多个指标加权成一个分数会学不好?

论文提出了一个实践性判断:直接聚合不同自动指标成单一标量奖励,可能产生区分度差的候选,进而引入模糊监督。这里用一个教学例子帮助理解:假设候选甲读得全对但声音机械,候选乙有个别口误但很自然,如果把可懂度和风格分简单相加,两者总分可能几乎相等。这个例子只是为了说明方向,不代表论文数值。

原文还强调,常规自动指标对过于机械的输出惩罚不足。也就是说,即使候选听起来明显不像真实闲聊,只要字读对了、说话人向量接近,它的字符错误率和说话人相似度仍然可能很好。于是融合分数会把它排在前面,偏好数据就会把坏样本当成好样本或把好坏混在一起。

这就解释了为什么本文要引入第 3 个信号专门盯住聊天风格,以及为什么排序之后还要再做 1 次间隔过滤,而不是直接取分数最高和最低的两个样本就训练。从学习依赖看,这个问题先于具体优化公式。如果数据构造阶段就没有拉开差距,后面的损失再精巧也难以弥补。因此论文把融合标量只用于排序和支撑数据构造,而不作为直接优化目标,这是一个需要记住的设计选择。

整体框架如何从一个文本走完采样打分到策略更新?

整体流程可以沿一个样本走一遍。给定文本提示,编解码语音合成模型用不同随机种子采样出多个候选语音,论文实验中每个提示生成 15 个候选。每个候选分别计算 3 个分数:衡量可懂度的字符错误率相关分、衡量说话人保持的相似度分,以及辅助的聊天风格分。

3 个归一化分数按非负权重加权成融合分数,只用于排序。排序后得到从高到低的排列,框架再用基于间隔的构造策略,只保留质量差距足够清楚的候选组,转成偏好训练数据。若一个提示的采样不满足过滤条件,则整个提示被丢弃。最后用保留下来的偏好数据做策略更新。

下面这张总览图把上述主路径画了出来,阅读时先看从左到右的粗箭头,再看右侧排序和下方构造的回路,这个导读有助于把文字描述和图中的模块对应起来。

看图路径: 1. 先从左侧文本提示沿蓝色粗箭头向右追踪到编解码语音合成模型和 K 个采样;2. 再看右侧多指标打分框内三个奖励如何汇成从好到坏的排序;3. 最后看下方基于间隔的偏好构造框如何选出有效正负样本并回送策略更新

原论文 Figure 1:Overall framework for stable speech synthesis post-training.

论文图 1。原论文 Figure 1:“Overall framework for stable speech synthesis post-training.”。

从像素可见,主路径是文本提示进入编解码模型,生成多个采样点,再进入多指标打分与排序框。该框内并列显示 3 个奖励分支,右侧用点赞和踩图标示意从好到坏的排序结果。下方虚线大框是基于间隔的偏好构造,框内标出最优、中间和最差候选组成的排序列表,并在相邻样本之间标出间隔符号,左右分别标注有效正样本和有效负样本。右侧一条长弧形箭头把排序结果送入构造框,构造框再向左输出到策略更新,策略更新又向上回指编解码模型,形成闭环。

图注还说明符号表示两个候选之间的分数差,且选出的最优和最差候选还需满足预定义的合法性条件。这正好对应正文说的融合分只排序、构造阶段再加阈值和间隔约束的设计。

ChatScorer 如何对机械味坏样本打分?

ChatScorer 是本文专门训练的辅助打分模型,目标不是通用语音质量预测,而是识别不太适合真实闲聊风格合成的候选,尤其是过于机械或其他不受欢迎的输出。它的输入是一段语音,输出是一个分数和不确定性。结构上先用冻结的语音编码器提取帧级表示,再接轻量变换器和掩码平均池化得到语句级向量,然后用多层感知机预测高斯分数参数,包括均值和对数方差。

训练用高斯负对数似然,让预测均值接近人工质量标注,同时用方差表达不确定性。为了减少说话人泄露,模型还接了一个带梯度反转层的辅助说话人分类器。具体做法是把语句向量经过梯度反转后送入说话人分类器,用交叉熵作为对抗损失,总目标是分数损失加权对抗损失之和。

直觉是让语句向量尽量不携带说话人身份信息,从而使分数更关注风格和质量本身,而不是记住某个说话人。论文说明该模型在会话录音和多样化合成语音上训练,并用人标注的语句进一步精调。

ChatScorer × 内容一致性与说话人相似度: 内容一致性与说话人相似度分别用字符错误率和说话人相似度衡量,分工是检查读得对不对和听起来像不像目标说话人;ChatScorer 分工是识别过于机械、不适合闲聊风格的坏输出。搭配的原因是前两类指标对机械味不敏感,单独加权也压不住这类样本,组合的意义是让融合分数在排序时同时看到可懂度、相似度和聊天风格 3 个维度。

下面这张结构图展示了上述两条分支,阅读时注意主干用实线表示编码过程,分支用虚线表示两个损失头,这个区分有助于理解共享编码器和并列目标的关系。

看图路径: 1. 自上而下确认语音输入经过冻结编码器、轻量变换和池化得到向量 h 的主路径;2. 对比下方左侧分数头与右侧梯度反转分支的虚线分叉结构;3. 确认底部两个损失汇成总损失的标注关系

原论文 Figure 2:Architecture of ChatScorer with a score head and a GRL-based speaker classification branch for…

论文图 2。原论文 Figure 2:“Architecture of ChatScorer with a score head and a GRL-based speaker classification branch for mitigating speaker leakage.”。

从像素可见,顶部是语音输入,自上而下依次经过语音编码器、变换器块和掩码平均池化,三者被左侧大括号标为编码器。池化后得到向量符号,向下分成两条虚线分支:左侧经多层感知机得到分数损失,右侧经梯度反转层得到对抗损失,底部两者汇成总损失。这种画法说明编码器是共享主干,两个损失是并列的训练目标,而不是串行关系。需要提醒的是,原论文没有报告该打分器训练的具体学习率、轮数和数据量细节,复现时只能按原文描述重建结构和损失形式,超参数属于缺项。

间隔构造如何选出差距足够大的正负例?

间隔偏好构造的核心思想是:不是所有采样都有用,质量差异太小的候选会带来弱监督甚至误导,因此只保留差距清楚的组。具体操作分 3 步。第一步是对同一提示的候选按融合分数排序,定义前三和后三区域。

第二步是从前三中选最优候选,它必须同时满足正向质量条件,包括字符错误率足够低、说话人相似度足够高、聊天分数足够高;从后三中选最差候选,它必须至少满足两条负向条件,包括字符错误率足够高、相似度足够低、聊天分数足够低。论文给出的正向阈值组合为字符错误率阈值 0、相似度阈值 0.8、聊天分数阈值 0.7,负向阈值组合为字符错误率阈值 0.15、相似度阈值 0.7、聊天分数阈值 0.67。

第 3 步是从剩余排序列表中再选中间候选,要求同一组内样本保持足够的融合分差距,差距用最优与最差之差除以排序列表大小来刻画。若没有任何候选组满足约束,则跳过整个提示。

融合分数 × 间隔偏好构造: 融合分数负责把多个归一化指标加权成一个标量只用于排序,分工是给出候选的相对顺序;间隔偏好构造负责按排序位置和阈值筛选并要求分数差距,分工是决定哪些提示和候选真正进入训练。搭配的原因是融合分数本身区分度弱,直接训练会引入模糊监督,组合的意义是把有噪声的排序转化为差距清晰、可学习的偏好子集。

在统一规则下,每个有效提示可以产生用于直接偏好优化的 1 对正负样本,也可以产生 3 个或 5 个有序样本的子集,分别称为三样本和五样本排序优化。论文报告这种过滤会丢弃较多提示,可用监督量大幅减少,但保留组的差距更清楚、更可学习。这是一个明确的取舍:用数据量换数据质量。理解这一点才能正确解释后面的结果,不能只看平均指标提升而忽略数据利用率下降。融合分数的权重在原文中没有给出具体数值,只说权重非负,复现时权重选择属于未报告项。

排序监督和在线强化分别如何更新模型?

论文实例化了 3 种后训练方法。第一种是直接偏好优化,用 1 对正负样本做对比。第二种是排序偏好优化,用同一提示下的多个有序候选构造多对偏好关系。它的相对策略分数定义为当前策略与冻结参考模型对数似然之差,损失是对有效偏好对集合求平均,每对按偏好极性和差距加权,并用逆温度系数控制陡峭程度。

这种设计让训练能利用排序子集中的全部偏好关系,而不是只依赖 1 对。第 3 种是分组相对策略优化,在相同训练提示上在线优化,用同样自动指标加权融合的标量奖励直接更新,不经过显式的间隔过滤。

直接偏好优化 × 排序偏好优化: 直接偏好优化每次只用一个最优和一个最差的二元对,分工是简单稳定地拉开 1 对样本的似然差距;排序偏好优化用同一提示下的 3 个或 5 个有序样本构造多对关系并按差距加权,分工是更充分利用保留下来的中间样本。搭配比较的原因是间隔过滤后同一提示内仍有多个信息量大的样本,只用 1 对会浪费,组合比较的意义是检验在小而干净的数据上多样本排序是否更有效。

优化细节按原文交代:优化器用 AdamW,学习率为 0.00001,采用动态批处理,每批包含 1000 个语音帧,具体帧数随序列长度变化,训练在两块英伟达 A800 上进行。论文说明监督微调模型用每个目标说话人 5 小时真实录音训练,仅用于候选生成,所有偏好后训练都在原始基座模型上进行。

这个安排很重要,保证了比较的是后训练策略本身,而不是不同的起点模型。需要明确的是,原文没有报告分组相对策略优化的采样步数、奖励归一化方式和 KL 约束细节,也没有给出排序损失中权重和逆温度的具体取值。这些属于缺项,复现时不能猜,只能按常规做法补齐并在报告中说明与原文的差异。

数据、基线和评估指标在什么条件下比较?

数据方面,论文构建了长形式闲聊风格文本集,覆盖多种日常场景,提示用 GPT-5 生成并经人工筛选过滤,语句相对较长、语言风格更接近真实人类闲聊。数据集包含 2000 条训练提示和 500 条测试提示,每个提示用不同随机种子生成 15 个候选语音用于偏好构造。

所有方法在相同 2000 个提示的数据预算下训练,探索两种奖励配置:只用字符错误率加说话人相似度,以及再加聊天分数。演示页当前可用,资源状态显示可用且状态码为 200,链接为官方演示地址,可试听各方法音频,但听感不能代替论文中的受控数字比较。

评估方面,论文用字符错误率测可懂度,用说话人相似度测说话人一致性,相似度定义为生成语音与目标说话人参考嵌入之间语音嵌入的余弦相似度。在此基础上引入面向稳定性的指标:组级失败率借鉴通过率思想,对每个提示的多次生成统计是否存在不达标样本,字符错误率阈值为 0.05,相似度阈值为 0.75。语句级坏样本率定义为聊天分数低于阈值的语句占比,表示不适合真实闲聊输出的比例。

主观平均意见分通过盲听获得,10 名听众对每个模型 50 条合成语音按 1 到 5 打分,并报告 95% 置信区间,评价维度包括自然度、感知说话人一致性和韵律恰当性。公平性上,论文保证了相同基座、相同提示预算和相同候选生成方式,区别只在奖励配置和数据构造与优化方式。但要注意,间隔过滤后实际可用提示数不同,直接偏好优化和排序优化用的有效数据量本身就不一样,因此结果反映的是方法加数据筛选的联合效果。

主结果显示稳定性改善了吗,代价是什么?

主比较要回答的问题是:在相同基座和提示预算下,不同后训练方法能否在保持可懂度和相似度的同时减少不稳定输出。指标方向要先明确:字符错误率越低越好,组级失败率越低越好,坏样本率越低越好,字符错误率为零的比例越高越好,说话人相似度越高越好。下表整理了论文主表中的 4 个可运行策略,均为加入聊天分数后的框架结果,公平条件是同一测试集和同一类自动评估,表头保留原文单位写法,数据格保留原文裸值精度。

模型字符错误率 (%)字符错误率为零比例组级失败率 CER<0.05说话人相似度相似度失败率 SIM>0.75坏样本率 (%)
监督微调基线1.530.540.380.810.4212.66
直接偏好优化1.280.590.220.810.143.35
分组相对策略优化1.460.440.270.800.2210.83
三样本排序优化1.170.620.170.820.102.44

表后解释需要同时说收益和代价。主要收益体现在稳定性上。监督微调基线的相似度组级失败率为 0.42,直接偏好优化的相似度组级失败率为 0.14,三样本排序优化的相似度组级失败率为 0.10。监督微调基线的坏样本率为 12.66%,直接偏好优化的坏样本率为 3.35%,三样本排序优化的坏样本率为 2.44%。监督微调基线的字符错误率为 1.53%,三样本排序优化的字符错误率为 1.17%。

说话人相似度基本不变,监督微调基线的说话人相似度为 0.81,三样本排序优化的说话人相似度为 0.82。论文解释这是因为后训练主要更新自回归语言模型而非流解码器,对说话人相似度影响有限。

未胜出项是分组相对策略优化,分组相对策略优化的字符错误率为 1.46%,分组相对策略优化的坏样本率为 10.83%,明显差于直接偏好优化和排序优化的对应指标。论文解释为它在线使用全部采样的融合标量奖励,没有显式间隔过滤保留差距清晰的监督。代价是排序方法依赖更严格的过滤,丢弃了更多提示,实际训练数据更少。

组级失败率 × 坏样本率: 组级失败率按提示统计,含义是一个提示的多次生成中是否出现过不达标样本,分工是衡量稳定性;坏样本率按全部生成语句统计,含义是聊天分数低于阈值的语句占比,分工是衡量机器味坏输出的总体比例。二者搭配的原因是平均字符错误率和平均说话人相似度看不出偶发失败,组合的意义是从提示可靠性和语句质量两个口径共同评估后训练是否减少了不稳定输出。

下面这张人工一致性条形图为聊天分数的有效性提供了独立证据,阅读时不要把它当成主表的替代,而应把它看作对奖励信号本身的校验,这个定位有助于区分相关性证据和因果结论。

看图路径: 1. 先确认横轴是一致率刻度、纵轴三个模型名称的排列顺序;2. 比较蓝色一致部分在三个横条中的长度差异;3. 重点读出聊天分数条标注的数值与另两条标注数值的差距

原论文 Figure 3:3

论文图 3。原论文 Figure 3:“3”。

从像素可见,该图标题为与人工偏好的一致性,横轴从 0 到 1,纵轴自上而下为两种平均意见分基线和聊天分数。每个横条分为蓝色一致部分和红色不一致部分,图例标明蓝色为偏好一致率。顶部两条的蓝色段很短,DNSMOS 的一致率为 0.174,UTMOSv2 的一致率为 0.232,底部聊天分数的蓝色段几乎占满全条,聊天分数的一致率为 0.958。论文说明评估来自 200 条合成语音、4 名标注者、约 1000 对同提示比较,一致指自动指标与人工选择了同一条更适合闲聊的语音。这支持了聊天分数比通用平均意见分更能检出不受欢迎会话候选的判断,但这只是相关性证据,不能直接证明加入它必然改善所有场景。

去掉间隔过滤或聊天分数后效果如何变化?

消融要回答两个独立问题:间隔构造是否优于直接按融合分选最优最差,加入聊天分数是否有额外好处。比较条件是同一优化器、同一奖励集合,只切换构造方式或是否加入聊天分支,指标方向同样是字符错误率越低越好、坏样本率越低越好、平均意见分越高越好。下表用论文消融中的关键数字整理,表头保留原文单位,数据格保留原文精度,最后一列为定性说明,不引入新数字。

设置字符错误率 (%)坏样本率 (%)平均意见分构造说明
直接偏好优化加直接选择1.316.28未报告融合分直接取两端
直接偏好优化加间隔构造1.213.354.28间隔过滤后训练
三样本排序加直接选择1.197.31未报告融合分直接取多样本
三样本排序加间隔构造1.172.444.42间隔过滤后训练
直接偏好优化不加聊天分1.2110.264.11仅内容加相似度
三样本排序不加聊天分1.0912.694.23仅内容加相似度

表后解释要分开说。第一,间隔构造一致优于直接融合分选择。直接偏好优化加直接选择的坏样本率为 6.28%,直接偏好优化加间隔构造的坏样本率为 3.35%。三样本排序加直接选择的坏样本率为 7.31%,三样本排序加间隔构造的坏样本率为 2.44%。直接偏好优化加直接选择的字符错误率为 1.31%,直接偏好优化加间隔构造的字符错误率为 1.21%。这支持了差距清晰的数据更可学习的假设。

第二,加入聊天分数对字符错误率只有微小变化,但一致改善感知质量并大幅降低坏样本率。直接偏好优化不加聊天分的坏样本率为 10.26%,直接偏好优化加间隔构造的坏样本率为 3.35%。三样本排序不加聊天分的坏样本率为 12.69%,三样本排序加间隔构造的坏样本率为 2.44%。一个值得注意的反例是三样本排序不加聊天分的字符错误率为 1.09%,但三样本排序不加聊天分的坏样本率为 12.69%,这说明只看可懂度会掩盖风格问题,也说明多指标评估的必要性。

论文还报告直接偏好优化加间隔的平均意见分为 4.28,三样本排序加间隔的平均意见分为 4.42,均高于不加聊天分的对应版本。这里的限制是,消融没有报告统计显著性检验,也没有报告不同随机种子下的方差,因此只能说在本次实验条件下观察到一致趋势。

哪些结论还不能下,边界在哪里?

论文在结论中明确承认一个局限:分组相对策略优化实验是在相对有限的数据规模下进行的,未来工作将扩展到更大规模在线多奖励优化和更多样化多语言设置。这意味着当前分组策略优化落后于离线偏好方法的判断只在 2000 提示的小预算下成立,不能推广为该优化器本身不行。

还有 3 个未评测边界需要指出。第一,融合权重没有公开,间隔阈值只给了一组取值,不同权重和阈值下的敏感性未知。第二,训练和推理开销没有报告,不知道间隔过滤和三指标打分增加了多少计算时间,也不知道后训练后推理延迟是否有变化,因此不能承诺效率改善。

第三,人工评估只覆盖每个模型 50 条和 10 名听众,样本量有限,且坏样本率依赖聊天分数自身的阈值,存在用同一模型既构造数据又评估的循环风险。论文用独立的人工偏好一致性实验部分缓解了这个担忧,但并未完全消除。表达上要区分层次:论文直接报告的是数字变化,论文的解释是差距清晰带来更可学习监督,这得到消融支持。但将其因果推广到所有编解码模型和所有闲聊场景,则属于待验证的推测,需要更大规模和跨语言验证。

要复现这套流程先做什么,需要补哪些验证?

复现时建议按学习依赖分步走。第一步准备基座和监督微调模型:用 CosyVoice2-0.5B 作为起点,为每个目标说话人用 5 小时真实录音训练监督微调模型,仅用于候选生成,偏好训练仍从原始基座出发。第二步准备文本:生成覆盖日常场景的长形式闲聊文本并人工过滤,划分 2000 训练和 500 测试,每个提示采样 15 个不同随机种子的候选。

第 3 步训练或获取 ChatScorer:冻结语音编码器,接轻量变换器和池化得到语句向量,用高斯负对数似然拟合人工标注,另加梯度反转说话人对抗分支,权重系数需要自己调参,因为原文未给。第四步实现打分与构造:对每个候选计算归一化后的内容、相似度和聊天分,加权排序后取前三和后三,按正向阈值和负向阈值筛选最优最差,再按间隔要求选中间样本,不满足则丢弃整个提示。

第五步训练:直接偏好优化用 1 对样本,排序优化用 3 个或 5 个样本构造多对加权损失,学习率设为 0.00001,动态批每批 1000 语音帧,在两块 A800 上训练。评估时同时计算字符错误率、相似度、组级失败率和坏样本率,并补做小规模盲听。还需补的验证包括:报告融合权重和间隔敏感性,报告丢弃率与有效数据量,报告多次随机种子的方差,以及在新说话人和新场景下检验聊天分数是否依然与人工偏好一致。演示页当前可用,可用于定性试听,但正式结论必须以自己复跑的受控数字为准。

何时值得尝试这套方法,记住什么?

当你的语音合成后训练出现两类症状时,这套方法值得尝试:一是平均可懂度尚可,但偶发坏样本多、不稳定;二是坏样本主要是机械味、与读错字无关,常规指标压不住。这时可以先引入一个专门的风格打分器,再对融合排序结果做间隔过滤,用更少但更干净的数据做偏好优化。

论文的证据表明,在闲聊长文本和中小数据预算下,三样本排序优化取得了最好的稳定性和最低坏样本率,同时保持了有竞争力的可懂度和相似度。需要记住 3 个要点。第一,融合分只排序、不直接作为优化目标,真正的监督来自过滤后的差距明显的样本。

第二,数据量下降是预期代价,丢弃较多提示换来的是更可学习的监督,不能用原始提示数来衡量训练充分性。第三,聊天分数不是通用质量分,它的价值在人工一致性实验中得到支持,但在新语言、新风格下仍需重新验证。把这三点想清楚,就能复述全文方法而不只是记住几个数字。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总