📄 Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

#语音合成 #后训练 #自监督学习 #低资源 #多语言

8/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5

🔥 8/10 | 前25% | #语音合成 | #后训练 | #自监督学习 #低资源 | arxiv

👥 作者与机构

  • 第一作者:Yizhong Geng(北京邮电大学)
  • 通讯作者:Xiaoyu Shen(Eastern Institute of Technology, Ningbo)
  • 作者列表:Yizhong Geng(北京邮电大学)、Yanliang Li(Beijing Logic Intelligence Technology)、Jinghan Yang(北京邮电大学)、Tianhan Jiang(University of California, USA)、Boxun An(Northwestern University, USA)、Ya Li(北京邮电大学)、Xiaoyu Shen(Eastern Institute of Technology, Ningbo)

💡 毒舌点评

本文敏锐地抓住低资源SLM中合成数据泛滥引发的“越稳定越单调”的分布塌缩现象,并将Flow-Matching架构的内在解耦设计巧妙地转化为无需人工标注的自对齐信号,思路相当漂亮。然而,TDSC对目标语言ASR模块的硬依赖限制了其在最极端的语言上的用武之地,且整个pipeline的计算开销在资源受限场景下的性价比分析仍然缺席。

📌 核心摘要

本文研究低资源语言的口语语言模型(SLM)在合成数据驱动训练下凸显的“稳定性-表现力缺口”(Stability-Expressivity Gap):随着合成数据比例增加,词准确率(WER)持续降低,但韵律多样性和自然度在超过临界比例后急剧退化(作者称之为Synthetic Erosion)。作者利用定性混合分布熵理论解释了该非单调现象。为弥合缺口,作者提出两种自对齐框架:Disentanglement-Guided Self-Alignment (DGSA) 利用Flow-Matching SLM中韵律与音色的天然解耦特性,通过切换风格条件生成同一说话人的“表现力”和“稳定”输出,构建偏好对进行无需人工标注的DPO训练;Temperature-Driven Self-Critique (TDSC) 则面向完全缺乏真实录音的极端低资源场景,通过多温度采样探索、复合评判器过滤和迭代SFT+DPO优化,实现从稳定初始化到韵律恢复的闭环自举。在泰语上,DGSA将自然度MOS从3.6显著提升至4.4,同时保持WER不退化,性能超越ElevenLabs等商业系统;在老挝语纯合成数据训练下,TDSC取得WER 29.8%、NMOS 4.5的成绩,首次实现该语言的零样本声音克隆能力。方法为低资源语言合成提供了一条可行的数据与对齐策略,主要局限在于依赖目标语言ASR模块及仅在两种东南亚语言上进行了验证。

🔗 开源详情

🏗️ 方法概述和架构

本文的整体流程分为两个阶段:首先在低资源真实数据与大规模合成数据混合语料上对预训练Flow-Matching SLM进行监督微调(SFT),随后针对合成数据引发的韵律塌缩问题,实施两种独立的自监督偏好对齐策略。

基础模型采用CosyVoice 2架构,该架构由三个主要组件构成:(1)一个冻结的语音标记器(S3Tokenizer),以25Hz频率将音频离散化,有限码本大小为6,561;(2)一个基于Qwen2.5-0.5B的Text-Speech LM,以自回归方式生成离散语音标记,可选择性地通过风格标记(style token)注入韵律信息;(3)一个约300M参数的Flow-Matching Transformer,接收自回归标记和独立的音色嵌入(timbre embedding),通过条件流匹配生成梅尔频谱或波形。该架构的核心设计在于韵律与音色的显式解耦:自回归标记主要编码语言内容与韵律(音高轮廓、节奏、重音),而音色嵌入控制说话人身份,二者走独立通路,互不干扰。

[图像补充] 图1清晰展示了两种方法的总体流程。上图(DGSA)描绘了通过“Style On”和“Style Off”开关,利用同一输入文本和说话人ID,生成表现力强但可能出错的样本(y_expr)和稳定但平淡的样本(y_stab),再与同一文本对应的真实语音(y_real)构成两组偏好对,送入DPO训练的过程。下图(TDSC)描绘了输入文本经低、中、高三种温度采样生成多个候选,通过包含ASR-WER、重复率和长度合规性的复合评判器过滤,形成高质量接受集(G)和拒绝集(R),然后迭代进行SFT和DPO优化的闭环流程。

DGSA精确地利用上述解耦特性,从同一文本输入生成两种对比鲜明的输出:y_expr(启用风格标记,保留韵律表现力但易出现发音错误)和 y_stab(禁用风格标记,韵律平滑但发音稳定)。由于二者共享同一音色嵌入,确保了说话人身份完全一致。随后,构建两组偏好对 T_stab = {(x, y_real, y_expr)}T_expr = {(x, y_real, y_stab)},均以真实语音 y_real 作为正例,分别用以纠正因过度表现力导致的错误和因过度稳定导致的单调,通过两个DPO损失项的加权和进行联合优化。为应对合成数据比例过高时分布塌缩的倾向,DGSA设计了动态权重调度:当合成比例 α 超过经验临界值 α* = 0.5 时,表现力权重 λ_e 从0开始线性增加,稳定性权重 λ_s 相应减少,确保对韵律多样性的校正压力恰在分布最可能塌缩时精确介入。

TDSC则不依赖于任何真实语音,构造了一个闭环自精炼循环。对于每个输入文本 x,模型以 T_low, T_mid, T_high (默认 0.7, 1.0, 1.3)三种温度进行采样,生成覆盖从保守到探索的候选语音。一个复合评判器根据ASR-WER、重复率(连续4个相同标记的比例)和长度合规性(长度比在 [0.5|x|, 2.0|x|] 内)严格筛选每条候选,将通过筛选的样本归为接受集 G,将高WER的样本归为拒绝集 R。在每一个迭代轮次,模型首先在 G 上进行SFT微调以稳定模型,再使用由 G 中最低WER样本作为正例(y_w)、R 中长度合规但WER高的样本作为负例(y_l)构成的偏好对进行DPO训练,以抑制特定错误模式。同时,TDSC采用温度课程策略:探索温度上限 T_max 初始为1.3,并在后续每轮迭代中递增0.1,使得模型在发音稳定后能逐步恢复韵律多样性。

💡 核心创新点

  1. 提出并定量刻画 Stability-Expressivity Gap:首次系统性研究合成数据比例 α 对SLM输出的非单调影响,通过标记熵 \(H_p\)、重复率、NMOS等指标,揭示并定义了稳定性与表现力在 α > 50% 时明显解耦的“Synthetic Erosion”现象,并基于混合分布熵的严格凹性给出了定性理论解释。
  2. 基于架构解耦的自对齐框架 DGSA:巧妙地利用Flow-Matching SLM中韵律(由Text-Speech LM控制)与音色(由Flow-Matching Transformer控制)的天然分离,在不需任何人工标注的情况下,构造同一说话人身份、仅韵律表现力不同的“表现力-稳定”对比偏好对,使DPO能同时提升稳定性和表现力。
  3. 面向纯合成数据的自批判闭环 TDSC:针对完全无法获取真实录音的极端低资源语言,提出了温度驱动的多轨迹探索、复合评判器(ASR-WER、重复率、长度一致性)自动过滤与迭代偏好精炼(SFT+DPO)机制,配合温度课程,实现了纯合成数据下从稳定初始化到韵律恢复的闭环自举。
  4. 实现老挝语零样音克隆:首次在老挝语这一极低资源语言上完成并验证了零样本声音克隆,证明了在纯粹合成数据驱动下,仍能保持较高的音色相似度和自然度。

📊 实验结果

本文在泰语和老挝语两个语言上从标准TTS和零样本声音克隆两个维度进行评估。主要基线包括开源模型(PyThaiTTS, MMS-TTS, Typhoon2-Audio, Seamless-M4T-v2)和商业API(ElevenLabs v3, Microsoft Azure, Gemini 2.5 Pro/Flash)。评估采用客观指标(WER、标记熵 \(H_p\)、重复率、说话人相似度SIM)和主观MOS(自然度NMOS、说话人相似度SMOS),并提供95%置信区间。

  1. 合成数据比例缩放实验(泰语) 训练集固定300h真实语音,合成数据从10h至1500h(对应α从3%到100%)。结果表明,在 α ≈ 50% 时各项表现力指标最佳,α > 50% 后NMOS、\(H_p\) 明显下降,重复率急剧上升,清晰验证了Synthetic Erosion现象。关键数值如下表:
Syn. α (%)WER (%) ↓\(H_p\) (bits)Rep. (%) ↓NMOS ↑SMOS ↑
375.010.4192.963.82 ± 0.094.31 ± 0.08
968.510.4772.834.01 ± 0.084.52 ± 0.07
1558.210.4552.624.08 ± 0.084.54 ± 0.06
2552.010.4232.484.13 ± 0.074.55 ± 0.06
4049.210.4982.214.38 ± 0.074.60 ± 0.06
5047.010.5062.164.51 ± 0.064.63 ± 0.05
6044.810.4912.084.45 ± 0.064.35 ± 0.07
6743.510.4792.024.42 ± 0.074.12 ± 0.08
8038.910.3566.513.61 ± 0.093.54 ± 0.10
10036.210.2109.833.08 ± 0.103.01 ± 0.11
  1. DGSA 对齐效果(泰语 α=80%) 与SFT基线、标准DPO(无架构区分)和拒绝采样的比较如下:
方法WER (%) ↓\(H_p\) (bits)Rep. (%) ↓NMOS ↑SMOS ↑
SFT Baseline38.910.366.513.61 ± 0.093.54 ± 0.10
Standard DPO45.210.494.083.92 ± 0.083.81 ± 0.09
Rej. Sampling40.510.415.183.75 ± 0.083.66 ± 0.09
DGSA (Ours)38.910.522.824.42 ± 0.074.53 ± 0.06

消融实验证实,移除“表现力目标”(即T_expr损失项)会导致NMOS显著下降0.7分,是影响最大的组件;移除“身份一致性配对”或“稳定性目标”也均会造成WER和NMOS的不同程度退化。

  1. TDSC 在老挝语上的表现 在纯合成数据训练下,与自训练、拒绝采样的比较:
方法WER (%) ↓\(H_p\) (bits)Rep. (%) ↓NMOS ↑
SFT Baseline38.510.087.623.12 ± 0.09
Self-Training35.210.156.943.31 ± 0.08
Rej. Sampling36.810.117.283.24 ± 0.09
TDSC (Ours)29.810.424.153.94 ± 0.07

消融实验证明,移除DPO损失时NMOS下降0.5分,影响最大;多温度采样和温度课程对恢复 \(H_p\) 至关重要;长度过滤和重复率过滤则对维持稳定性和自然度均有贡献。

  1. 系统级对比
  • 标准TTS:在泰语上,DGSA获得最高的NMOS 4.51,超过ElevenLabs v3 (4.21) 和Azure (4.01);在老挝语上,TDSC取得WER 29.8%、NMOS 4.53,均优于最强的商业模型Gemini Flash (WER 34.2%, NMOS 4.12)。
  • 零样本语音克隆:在泰语上,DGSA的说话人相似度SIM为0.84,SMOS为4.51,均高于ElevenLabs v3 (SIM 0.78, SMOS 4.23)。在老挝语上,TDSC首次实现了该语言的零样本克隆,取得SIM 0.81,SMOS 4.32。
  1. Token Entropy 代理有效性验证 本文通过对照实验验证了标记熵 \(H_p\) 作为韵律多样性代理的有效性。实验控制文本内容和可懂度(WER)匹配,对比高\(H_p\)与低\(H_p\)组,发现高\(H_p\)组在F0标准差、F0动态范围、F0与真实录音的相关性以及能量变化等声学指标上均显著更优,且获得更高的人类表达力评分(4.2 vs. 3.7 MOS),证实 \(H_p\) 能够捕捉到感知上有意义的韵律差异,而非单纯的噪声。

🔬 细节详述

  • 训练数据:泰语包含300小时经 ASR (WER < 40%) 筛选的Common Voice真实语音和1,200小时由MMS-TTS, Seamless-M4T-v2, Typhoon2-Audio生成的合成语音;老挝语则完全依赖1,500小时由MMS-TTS合成的语音,经 ASR (WER < 50%) 筛选。所有训练文本均来自多语言C4且与评估集无交集。测试集采用TSynC-2(泰语)和Common Voice(老挝语)。
  • 模型基础:基于CosyVoice 2,S3Tokenizer 冻结,Text-Speech LM 为 Qwen2.5-0.5B(24层,896隐层维度,14注意力头),Flow-Matching Transformer 约300M参数,采用HiFi-GAN声码器,最终输出24kHz音频。
  • 损失函数:SFT阶段为标准最大似然估计;DGSA阶段采用双项DPO损失 \(L_{DGSA} = λ_s L_{DPO}(T_{stab}) + λ_e L_{DPO}(T_{expr})\) ,其中单DPO项计算为 \(L_{DPO} = -E[\log \sigma(\beta \Delta_\theta)]\),β=0.1;TDSC阶段先SFT再DPO,损失函数形式一致。
  • 训练策略与超参数:SFT阶段学习率1e-5,共38k步;DGSA学习率降至1e-6,训练10k步;TDSC迭代5轮,每轮先SFT后DPO,学习率均为1e-5。优化器统一为AdamW (β1=0.9, β2=0.999),动态批大小上限2000帧/GPU,bfloat16精度,在8块NVIDIA RTX 4090上训练。DGSA动态权重临界点 α*=0.5。TDSC温度集合 {0.7, 1.0, \(T_{max}^{(k)}\)},\(T_{max}^{(0)}\)=1.3并每轮增加0.1;WER阈值 τ_w < 40% (泰) / 50% (老),重复率阈值 τ_r < 10%,长度比阈值在 [0.5, 2.0] 倍文本长度之间。每输入文本生成12条候选(每个温度4条),使用核采样 (p=0.9) 解码。
  • 评估配置:泰语ASR模型采用Whisper-large-v3;老挝语采用专为东南亚语言优化的Dolphin-small。说话人相似度SIM由WavLM-Large第12层输出计算余弦相似度得到。主观评估采用双盲、随机化、被试内设计,每种语言招募20名母语者,每名评分者对200个样本进行5分制打分,共收集8,000个评分点(每种语言4,000个),并辅以配对t检验评估显著性 (p < 0.05)。

⚖️ 评分理由

  • 创新性 (1.4/2):论文明确发现并形式化了合成数据带来的稳定性-表现力非单调折衷,这一洞察本身有一定新颖性。利用Flow-Matching架构的音色-韵律解耦进行自监督偏好对齐,构思巧妙,将模型内在属性转化为无需标注的偏好信号。温度驱动的自批判机制为纯合成数据训练的极端情况提供了闭环解决方案。不过,DGSA方案强依赖于特定架构的解耦能力,TDSC的迭代自训练+过滤范式与现有工作有共同之处,整体创新程度属于高水平的改进与系统化,但非范式突破。 技术严谨性 (1.2/1.5):论文对Synthetic Erosion给出了基于混合分布熵严格凹性的定性解释,提供了清晰的数学推导。DPO应用与动态权重调度的逻辑严密,DGSA的双偏好对构造能对应不同失败模式。TDSC中的评判器标准、温度课程及SFT+DPO顺序更新均经过合理设计。消融实验详尽,验证了各组件的作用。但α取固定经验启发值0.5,虽声称跨语言鲁棒,但缺乏对不同语言、不同合成数据质量的敏感性分析和理论支撑;TDSC中ASR过滤基线能力的影响未做定量分析。
  • 实验充分性 (1.3/1.5):实验覆盖两种资源状况迥异的东南亚语言(泰语 - 有真实数据,老挝语 - 纯合成数据),对象选择有代表性。基线包含多个强开源模型和主流商业API,对比全面。对合成数据缩放效应做了从3%至100%的细粒度实验,清晰展示非单调趋势。主观评价采用双盲、随机化设计,提供95%置信区间和统计检验,流程规范。消融实验分别验证了各模块的贡献。但TDSC仅迭代5轮,未展示更长时间的收敛性;缺乏对更多种低资源语言(尤其是非声调语言)的泛化验证。
  • 清晰度 (0.9/1):论文组织结构逻辑通顺,从发现问题到提出解决方案再到实验验证,脉络清晰。关键概念如Synthetic Erosion、\(H_p\)代理等均有明确定义和解释。图1直观展示了两种方法的流程。附录提供了详细的数学推导和实现配置。少数细节如TDSC中偏好对的具体挖掘策略(“长度合规但WER高”)的准确定义可以更直接。
  • 影响力 (1.2/1.5):该工作直接解决低资源语音合成领域的迫切问题,提供了一套从发现到弥合稳定性-表现力缺口的方案。在泰语和老挝语上超越商业系统,并首次实现老挝语零样本声音克隆,具有较强的应用价值和示范效应。对后续低资源SLM的数据策略和对齐方法研究有启发意义。但方法对特定模型架构的解耦性能依赖较强,限制了部分通用性,且仅聚焦于两种语言,更广泛语言上的泛化性仍属未知。
  • 开源 (0.5/1.5):论文提供了在线Demo页面链接以试听合成效果,并引用了所使用的所有开源项目(CosyVoice, S3Tokenizer等)链接。但未在论文中提供自身代码仓库、模型权重或训练数据集的直接公开访问方式。读者目前无法复现或进行二次开发,开源程度较弱,仅停留在成果展示和引用层面。
  • 可复现性 (0.4/0.5):论文在正文及附录中详细列出了模型配置(CosyVoice 2 具体参数)、训练超参数(学习率、步数、DPO β、过滤阈值等)、硬件环境(8×RTX 4090)以及数据构建流程。尽管无代码公开,但凭借这些足够详尽的细节,有经验的研究者应当能够依此复现整个pipeline。
  • 工程/实践价值 (1.1/1.5):论文构建了一个较为完整的低资源语音合成管线,从合成数据生成过滤到SFT再到自对齐精炼,流程清晰。动态权重、温度课程和闭环过滤等设计具备工程参考价值。但整体仍偏向学术研究验证,尚未展示在工业级产品系统(如低延迟、高并发)中的表现,TDSC的额外计算开销也未做优化和成本评估。

🚨 局限与问题

论文明确承认的局限:

  1. TDSC假设存在可用的目标语言ASR系统以进行过滤;对于连基础ASR都不具备的语言,本方法将无法直接应用,需要探索无监督或跨语言的替代方案。
  2. 实验仅在泰语和老挝语两种东南亚声调语言上进行,尚未在类型学上更丰富多样的语言(例如非声调语言、黏着语等)中验证方法的泛化性。
  3. TDSC引入了额外的计算开销,虽然其声称与一次大规模SFT运行相当,远低于收集母语者标注的成本,但论文未给出定量化的成本分析。
  4. 动态权重调度中的临界比例 α* 是固定的经验启发值(0.5),其在其他语言、不同合成数据生成器或不同质量下的鲁棒性未进行深入讨论和验证。

审稿人发现的潜在问题:

  1. DGSA的架构依赖性:DGSA的效果完全建立在Flow-Matching SLM中韵律由自回归标记完全控制、音色由流匹配解码器独立控制这一强假设之上。若在实际中,韵律信号有部分泄露到音色路径,或流匹配解码器本身也参与部分韵律建模,则“开启/关闭风格标记”所构造的对比对纯净性会受损,可能引入次优的偏好信号。论文未对该假设进行直接的实证验证(如可视化解耦程度或交换实验)。
  2. \(H_p\) 代理指标的可靠性边界:虽然文章通过对照实验证明了 \(H_p\) 与韵律表达力的相关性,但该指标本质上衡量的是标记分布的均匀度。在极端情况下,模型为生成高熵分布而产生的随机性噪声或错误标记也可能抬高 \(H_p\)。其作为代理指标的可靠性在何种信噪比下开始失效,论文未探讨。这可能导致TDSC中的探索过程在某些退化情况下被 \(H_p\) 的虚高所误导。
  3. TDSC偏好对的构建逻辑:TDSC中DPO的负样本选择标准为“通过长度和重复率过滤但WER高”。这一标准引导模型降低WER,但其隐含的优化方向可能过度偏向清晰度,在模型本身WER已较低时,可能会再次压制韵律表现力,形成新的“稳定性-表现力”冲突。论文的迭代曲线显示 \(H_p\) 和WER在某些轮次可能呈现反向变化,但未对此进行深入讨论。
  4. 零样本克隆评估的深度:对零样本声音克隆的评估主要依赖自动指标SIM和主观SMOS。缺乏对不同音色属性维度的深入分析,例如基频轮廓(F0 range)、共振峰特征等是否得到了良好的保留。这使得对模型在音色复现上的优势和劣势的理解不够精细。
  5. 纯合成训练数据集偏差:老挝语的TDSC模型完全由MMS-TTS生成的1500小时语音训练而成。这可能导致模型学到的“老挝语”实际上是由MMS-TTS定义的声学及韵律分布,面对真实世界中多样化的口语变体、不同的录音环境和副语言现象时,其鲁棒性可能不足。文中未对纯合成数据带来的特定模型偏差进行深入分析。
  6. 对比基线不完整:尽管对比了多个强商业API,但论文缺乏与近期同类判别式自对齐方法(如其他利用架构特性的DPO方法)的直接对比,使得DGSA独特优势的论证说服力稍弱。

← 返回 ICML 2026 论文速递