📄 Preference Optimization for Non-Verbal Vocalization Synthesis

标签:#语音合成 #后训练 #模型评估 #SFT

7.1/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5

7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #后训练 | #模型评估 #SFT | arxiv

👥 作者与机构

第一作者:Haoyang Li(Nanyang Technological University, Singapore) 通讯作者:Chenglin Xu 作者列表:Haoyang Li、Chenglin Xu、Junchuan Zhao、Yuang Cao、Liumeng Xue、Yiwen Guo、Eng Siong Chng(机构:Nanyang Technological University, Singapore;LIGHTSPEED, Singapore;National University of Singapore, Singapore;Nanjing University, China;Independent researcher)

📌 核心摘要

这篇论文的关键不是把 Direct Preference Optimization(DPO)接到 TTS 上,而是回答更棘手的对齐问题:当目标是笑声、咳嗽、叹息等非言语发声(non-verbal vocalizations,NV)时,训练信号既要让模型实现指定事件,也难以牺牲台词正确性或把自动评分误当成人听自然度。普通 ASR 会忽略 NV;把真实录音直接当正例又未必符合当前生成模型可学习的合成分布。

作者的选择是在后训练数据流中增加 NV-aware ASR 与加权 NV-CER,而不改 CosyVoice2 的声学主干:Base 在每个文本提示的候选集合内采样波形,NV-ASR 将波形转成拼音词汇与 NV 标签,最低和最高 NV-CER 的候选形成 DPO 偏好对。在 NV-Bench 单标签集的 Syn+/Syn- 条件下,DPO(NV-CER)的 NV-CER、PCER、CER 分别为 2.59、21.33、2.09,三项均为越低越好;同一条件下 Base 的对应值为 3.47、32.78、2.74;但最有价值的证据同样包含反例:GT 或 Hybrid 正例、过弱的 NoNV 负例和继续训练的纯 DPO 都会明显退化。

论文因此给出的不是“偏好优化提升自然度”的泛化结论,而是受条件约束的配方:同模型合成的难正负对、NV-aware 排序和早停是相互依赖的。DPO+SFT 能压住训练不稳,却放弃首轮最佳误差;多标签人听的非平局票偏向准确率模型,却没有显示 NV 或总体自然度的显著偏好。它适合被读作普通话 NV 后训练的数据设计研究,而非跨语言、跨主干或实时部署的定论。

🏗️ 方法概述和架构

输入由带 NV 标签的文本提示、说话人条件录音和参考转写;输出仍是 CosyVoice2-0.5B 生成的波形。论文把 NV 视为独立事件符号,而非强行写成汉字。为了避免同音字和字形差异支配排序,普通话词汇先转成拼音;笑声、呼吸、犹豫等标签保留为单独 token。

完整的离线数据流是:预训练 CosyVoice2-0.5B 先在 Emilia-NV 做监督微调,得到所有实验共同的 Base;Base 对每个后训练提示独立生成 8 条波形;NV-ASR 再把每条波形识别成混合的词汇 token 与 NV 标签序列。NV-ASR 不是推理时的附加模块,它只负责把“波形里是否真的发生了目标 NV”变成可排序的离散证据。

排序器计算 NV-aware character error rate(NV-CER)。参考序列和识别序列在同一加权编辑距离中比较:普通词汇 token 的代价为 1,NV 标签的代价为 \(w_{NV}\),替换取两端 token 代价的较大值,分母也使用参考 token 的总权重。\(w_{NV}=1\) 时词汇与 NV 内容等权;提高 \(w_{NV}\) 只会让 NV 错误在候选排序时更有影响,不会修改 DPO 公式,也不是用户在在线合成时可调的控制杆。

对每个提示,NV-CER 最低的合成候选作为 \(x^+\),最高者作为 \(x^-\)。标准 DPO 以冻结的参考策略为锚,提高可训练策略对 \(x^+\) 相对 \(x^-\) 的条件似然;DPO+SFT 只是在该目标旁加入权重 0.2 的监督项。这里的职责分工很重要:CosyVoice2 负责生成,NV-ASR 负责观测,NV-CER 负责排序,DPO 负责把排序偏好写回模型参数。

这一分层还避免把评价器的局部偏差误写成声学主干的能力:候选生成提供可比较的响应集,识别与编辑距离只负责确定相对好坏,优化器只吸收这一相对顺序。研究者排查失败时应先检查候选多样性与标签转写,再判断 DPO 目标本身,而难以把所有退化归因于解码器。

推理阶段只按 CosyVoice2 的采样策略输出波形,不运行 NV-ASR 或 NV-CER,因此不会新增推理模块。代价转移到离线后训练:采样数、NV-ASR 版本和加权编辑距离共同决定偏好对。若识别器系统性误判某个事件,DPO 学到的就是该识别偏差;这也是本文只能证明当前识别器和标签体系内收益的原因。

💡 核心创新点

  1. NV-aware 信号让偏好排序首次直接看见 NV。传统 ASR-CER 只对台词转写负责,无法为没有确定书写形式的笑声或咳嗽定义错误;NV-CER 则把拼音词汇与 NV 标签纳入统一编辑距离。它解决的是“候选排序时缺少目标事件监督”这一接口问题,而非提出新声学架构。单标签表中它相对普通 ASR-CER 同时降低 NV、词汇与综合错误;未知事件、标签边界模糊或 NV-ASR 漏检仍会直接污染偏好。

  2. NV 与词汇的取舍被放在偏好数据构造处。在 NV-Bench 单标签集上,当 \(w_{NV}=1、5、10\) 时,PCER(越低越好)依次为 21.33、18.22、18.11;CER(越低越好)依次为 2.09、2.60、2.52;这说明排序优先级确实被改变,而不是 DPO 神奇地同时优化所有目标。证据只覆盖 \(w_{NV}\) 为 1、5、10 的普通话实验,难以推出其他语言或连续控制会保持同样形状。

  3. 偏好正例不应只按“最干净”来定义,而应考虑模型能否学习。GT/Syn- 与 Hybrid/Syn- 在纯 DPO 下失效,NoNV 负例也比同模型最差候选更弱;Syn+/Syn- 反而最好。这一反常结果的实际含义是:偏好对的分布距离和区分难度,比正例表面上是否更真实更重要。它是当前 Base 与 NV-ASR 的直接消融结论,尚不是所有生成器上的一般规律。

  4. 自动错误率、感知代理、匿名 LLM 比较和 A/B/Tie 人听被放进同一证据链。其价值不在于让所有指标一致,而在于暴露不一致:准确率证据较强,NV 自然度却没有显著人听偏好。因而 UTMOS、DNSMOS 或 LLM 分数只能支持它们各自测到的属性,难以替代对细微 NV 自然度的主观验证。

📊 实验结果

实验先问最核心的问题:在 NV-Bench 单标签公开测试上,NV-aware 排序是否既改善事件与词汇准确率,又保持感知代理分和说话人相似度?NV-CER、PCER、CER 都是越低越好;UTMOS 与 Sim 是越高越好。

设置方法/偏好信号NV-CER ↓PCER ↓CER ↓UTMOS ↑Sim ↑
NV-Bench 单标签Base3.4732.782.742.010.890
NV-Bench 单标签DPO,普通 ASR-CER2.9525.782.362.030.891
NV-Bench 单标签DPO,NV-CER2.5921.332.092.010.891
NV-Bench 单标签DPO,NV-CER + UTMOS2.5822.442.092.110.891

在 NV-Bench 单标签、Syn+/Syn- 偏好对中,标准 DPO 的 NV-CER 为 2.59;同一合成对的 DPO+SFT 为 3.03,指标 NV-CER 越低越好。与 Base 和普通 ASR-CER 相比,NV-CER 排序把 NV-CER、PCER 与 CER 都压低,而 Sim 基本不变;在同一 NV-Bench 单标签集的 Syn+/Syn- 条件下,NV-CER + UTMOS 的 UTMOS(越高越好)为 2.11,DPO(NV-CER)的 UTMOS 为 2.01;前者的 PCER(越低越好)为 22.44,后者为 21.33。它支持的是当前单标签条件下的准确率—代理质量取舍,难以单独说明自然度获益。

这是偏好对类型与训练 epoch 选择的消融:它检验 GT、Hybrid、NoNV 和 Syn+/Syn- 这些对照,以及第 1/2 个 epoch 如何改变结果。下表保留关键消融与训练轮数对照,才能看清同模型候选为何重要。

消融设置训练目标偏好对类型或 epoch 对照NV-CER ↓PCER ↓CER ↓
NV-Bench 单标签DPOGT/Syn-93.42104.8993.20
NV-Bench 单标签DPOHybrid/Syn-65.1875.2264.99
NV-Bench 单标签DPO+SFTHybrid/Syn-7.6433.227.00
NV-Bench 单标签DPOSyn+/NoNV22.9552.8922.23
NV-Bench 单标签DPOSyn+/Syn-,epoch 12.5921.332.09
NV-Bench 单标签DPOSyn+/Syn-,epoch 231.3256.8930.83
NV-Bench 单标签DPO+SFTSyn+/Syn-,epoch 13.0323.002.52

在 NV-Bench 单标签、Hybrid/Syn- 条件中,标准 DPO 相对 Syn+/Syn- 的 NV-CER、PCER、CER 为 65.18、75.22、64.99,三项均越低越好。相同 Hybrid/Syn- 条件下,DPO+SFT 为 7.64、33.22、7.00,仍弱于其 Syn+/Syn- 对照,但说明监督项能缓和灾难性退化。在 NV-Bench 单标签集的 Syn+/Syn- 条件下,纯 DPO 的 epoch 1 NV-CER(越低越好)为 2.59,epoch 2 为 31.32;早停因此是配方的一部分。

公开 NV-Bench 单标签与多标签集上,单标签报告 DPO 与 DPO+SFT,多标签只报告 DPO;NV-CER 偏好信号相对 Base、SFT 与普通 ASR-CER 的 NV-CER ↓ 定性趋势、PCER ↓ 与 CER ↓均更优。这个跨表总结难以把 DPO+SFT 的单标签稳定性推广到多标签,因为 Table V 没有对应行。

最后看人听:多标签集将 NV-CER+UTMOS 偏好模型与 SFT 比较。非平局票中,NV-CER+UTMOS 偏好模型相对 SFT 基线的 NV 准确率偏好为 55.5% 对 44.5%,方向是偏好模型更高;词汇准确率为 57.2% 对 42.8%。NV 自然度与总体自然度没有显著偏好。这个结果与自动和 LLM 的准确率趋势相容,却拒绝了“自然度已经提高”的强说法。

🔬 细节详述

训练语料 Emilia-NV 有 573.4 小时带 18 类预定义 NV 标签的普通话表达性语音。作者从中取约 100 小时后训练子集,并优先保留稀有 NV 类别;最终每类样本数未报告。NV-Bench 的普通话单标签部分原有每类 50 条,多标签部分有 391 条;为了覆盖训练集比基准多出的 3 类,作者按原标注风格补充每类 50 个提示,共 150 条。

Base 来自 CosyVoice2-0.5B 在 Emilia-NV 上的 4 个 epoch SFT,学习率 \(1\times10^{-5}\)。偏好后训练默认学习率 \(1\times10^{-6}\),动态 batch 上限为 1000 帧,梯度累积为 40;DPO+SFT 的 SFT 权重为 0.2。论文没有给出 DPO \(\beta\)、优化器、调度、随机种子、梯度裁剪或训练硬件,因此这些数字足以复刻实验骨架,难以保证逐次训练重现。

每条后训练样本从 Base 独立采样 8 条候选。训练采用 CosyVoice2 的 RAS,top_p=0.9、top_k=30、win_size=10、\(\tau_r=0.1\);评测时 top_p=0.8、top_k=25。复现时必须把这些采样参数与 NV-ASR 版本一并固定,因为任一改变都会改写候选排序和偏好对,而不仅仅是输出表面的多样性。

评价侧,NV-ASR 以 SenseVoice-Small 为底座并覆盖 18 类 NV;CER 删除 NV 标签,PCER 删除词汇 token。感知质量用 UTMOS 与 DNSMOS P.835,说话人相似度用 Resemblyzer embedding 余弦相似度。LLM 对同一 utterance 的系统输出匿名、随机排序,3 个模拟评审按 rubrics 打分;该自动层与人听回答不同问题。

人听由 11 位母语志愿者进行,每个样本独立分配给 5 人,比较 NV 准确率、NV 自然度、词汇准确率和总体自然度,NV 不可比较时可选 N/A。论文没有报告置信区间、显著性检验细节、播放条件、生成音频或偏好对发布;因此最稳妥的复现目标是重建排序与相对趋势,而不是声称能逐项复现主观票数。

🚨 局限与问题

证据直接限定在普通话 CosyVoice2-0.5B、Emilia-NV 与扩展 NV-Bench 的 18 类预定义事件上;跨语言只给出替换词汇表示的构想,没有实验。DPO+SFT 只在单标签表和单标签训练轮数消融中出现,难以外推为多标签或总体结果;多标签表只评估 DPO 变体。标准 DPO 对 epoch 高度敏感,继续训练会大幅退化。UTMOS 不显式衡量 NV 自然度,11 位志愿者、每条样本 5 人的人听也没有发现 NV 自然度或总体自然度的显著偏好,因此自动与 LLM 评分的改善难以解释为听感自然度已提升。

进一步审视

论文直接证据只覆盖普通话、CosyVoice2-0.5B、Emilia-NV、扩展 NV-Bench 和单一 NV-ASR。把拼音替换成其他语言表示只是作者提出的框架可能性,不是跨语言实验;没有跨主干、跨识别器、未知 NV、标签边界错误或长文本上下文测试。

训练稳定性也难以被压缩成“DPO+SFT 更好”。DPO+SFT 的对照主要来自单标签 Table I、II、IV,多标签 Table V 只给出 DPO 变体;更稳的多轮错误率换来的正是低于纯 DPO 首轮的最佳表现。论文还没有系统改变 beta、学习率或正则化,因此不知道早停之外是否存在更稳的纯 DPO 解。

人听边界尤其重要:它支持非平局条件下的 NV 与词汇准确率偏好,却没有在 NV 自然度或总体自然度上发现显著偏好。UTMOS 不显式评估 NV 自然度,LLM 与人听出现差异正说明代理评分难以替代听者判断;11 位志愿者、每样本 5 人以及缺少区间统计也限制了结论强度。

工程上,推理接口没有变化不等于后训练没有成本。候选生成与 NV-ASR 排序会随候选数增加离线计算,论文没有报告延迟、吞吐、显存或训练成本;\(w_{NV}\) 只能改变训练数据的排序,难以在单次在线推理时动态调节 NV 强度。核心代码、模型、偏好对、扩展提示和音频样例也没有公开。

🔗 开源与复现资源

论文没有声明本文代码、后训练权重、Emilia-NV 偏好对、扩展 NV-Bench 提示或合成音频的公开地址。全文唯一可定位的 GitHub 是第三方 Resemblyzer,它只用于说话人 embedding 与余弦相似度计算,难以充当本文交付物。配方、表格和参数可帮助重建实验框架,但缺少候选波形、NV-ASR 精确版本和主观评测材料,无法逐样本审计偏好排序或人听结果。

💡 研究者判断

我会把它记为“偏好对比损失更重要”的论文:GT 看起来更好,却可能离生成器当前分布太远;完全删掉 NV 看起来更坏,却可能太容易,给不出有信息量的负例。Syn+/Syn-、NV-aware 排序和早停的组合因此是实质贡献。

但配方的脆弱性同样醒目:纯 DPO 继续训练即崩,DPO+SFT 用峰值换稳定,单一 NV-ASR 决定了整个学习信号,而人听没有把准确率优势变成自然度胜利。在跨语言、跨主干、识别器鲁棒性和真实后训练成本被补齐之前,它是值得复用并继续质疑的普通话基线,不是表达性 TTS 的通用对齐法则。

⚖️ 评分理由(展开查看)
  • 创新性 (1.3/2):NV-CER 将拼音词汇与 NV 标签置于同一加权编辑距离,并用 w_NV 直接控制偏好对中词汇错误和 NV 错误的权重;这是面向 NV 合成的明确设计洞察,但优化器仍是标准 DPO,贡献未达到架构或算法突破。

  • 技术严谨性 (1.3/1.5):NV-ASR 转写、加权距离、候选排序与 DPO 目标构成闭合链路,且正文说明了 NV 权重和训练轮数的作用;排序有效性仍依赖单一 NV-ASR,未以替代识别器或误差分析检验该代理信号的稳健性。

  • 实验充分性 (1.3/1.5):Table I–III 直接消融偏好对、损失、epoch 与 w_NV,Table IV–V 覆盖公开单标签和多标签集,并以人听交叉核验;但仅在普通话 CosyVoice2-0.5B 上验证,DPO+SFT 未延伸至多标签,且未报告置信区间或显著性检验。

  • 清晰度 (0.9/1):章节、公式与 6 张表的关系清楚,指标定义可追踪;部分表格与正文对显著性和单位说明较少,限制了快速复核。

  • 影响力 (1.1/1.5):工作直接服务于表达性 TTS,并给出 GT preferred、弱负样本和过训练风险的可执行后训练结论;但适用范围仍限于普通话、单一 0.5B 主干和 18 类预定义 NV,领域推动力属于扎实但非广泛范式级。

  • 开源 (0.0/1.5):正文没有声明本文代码、模型、偏好对或扩展 NV-Bench 提示的发布,只引用第三方 Resemblyzer,因此核心产物开源得分为 0。

  • 可复现性 (0.3/0.5):数据规模、数据子集、学习率、epoch、候选数、采样与批处理参数足以复刻总体链路;但 DPO beta、随机种子、硬件、清洗规则和实际偏好对均未给出,关键训练复现仍有缺口。

  • 工程/实践价值 (0.9/1.5):配方不增加推理模块,适合已有 NV-capable TTS 的后训练;但没有真实延迟、吞吐、显存、训练成本或线上压力测试,工程分受限。


← 返回 2026-08-26 语音/音乐/音频论文速递