📄 FreyaTTS Technical Report

标签:#语音合成 #扩散模型 #流匹配 #音频理解 #Transformer

7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5

7.7/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #语音合成 | #扩散模型 | #流匹配 #音频理解 | arxiv

👥 作者与机构

  • 第一作者:未说明(贡献者列表为 Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz,论文未明确标注第一作者或通讯作者)
  • 通讯作者:未说明
  • 作者列表:Ahmet Erdem Pamuk(未说明)、Ömer Yentür(未说明)、Ahmet Tunga Bayrak(未说明)、Yavuz Alp Sencer Öztürk(未说明)、Mustafa Yavuz(未说明)

💡 毒舌点评

这篇技术报告在土耳其语TTS的垂直领域里,将已有的非自回归流匹配架构与冻结的VAE潜空间结合,做出了一套完整、高效且经过“生产硬化”的系统,工程实现和部署考量比大多数学术论文都扎实。然而,其核心创新(非自回归DiT在冻结潜空间中生成)并非全新范式,且实验评估仅限于一个自建的495句基准,在通用性和与其他真正为土耳其语优化过的系统(而非通用英语系统的土耳其语分支)的严格对比上仍有说服力缺口。论文作者也坦诚地指出了其模型在干净对话文本上的错误率仍高于两个基于音素的紧凑VITS基线,这是一个重要的性能界限。

📌 核心摘要

本文介绍了FreyaTTS,这是一个专为高效可靠的土耳其语对话合成设计的紧凑、无tokenizer的语音合成系统。该模型的核心是一个183.2M参数的非自回归条件流匹配扩散Transformer(DiT),它在冻结的AudioVAE2连续潜空间中工作,从92个土耳其字符符号直接生成语音,完全省去了音素转换器或离散语音tokenizer。与现有方法相比,其新颖性体现在三个方面:规则无关的端到端建模、非自回归的并行去噪以避免自回归错误累积,以及一个将无说话人预训练模型转变为稳定生产模型的两阶段“生产硬化”后训练配方。在自建的Freya-TR-Eval基准上,FreyaTTS在带宽匹配的Whisper WER/CER指标上分别达到8.0%和3.0%,优于参数量更大的开源系统(如XTTS-v2和F5-TTS-Turkish),同时保持了极高的推理效率(RTF~0.14,可在笔记本CPU上实时运行)。该系统的实际意义在于为中等资源语言(如土耳其语)提供了一个高效、高质量、可部署的TTS方案。主要局限性在于其语音质量受限于训练数据的窄带特性,且对数字密集型输入仍需前端规则扩展。

系统参数WER ↓CER ↓MOS ↑
Piper (tr)16M4.41.13.47±0.22
Coqui GlowTTS (tr)28M12.13.32.53±0.19
MMS-TTS (tr)36M6.81.73.58±0.20
SpeechT5 (tr)144M83.445.51.59±0.14
FreyaTTS (ours)183.2M8.03.03.68±0.22
F5-TTS (tr)336M24.310.93.63±0.23
XTTS-v2 (multi)470M11.13.93.82±0.19

🔗 开源详情

  • 代码:论文中未提供具体代码链接。论文在摘要、贡献列表和结论中多次声明会“release the training and inference code”,但未给出具体的GitHub或代码仓库地址。
  • 模型权重:论文中未提供具体模型权重链接。论文在摘要、贡献列表和结论中明确声明会开源“the model weights”或“the single-voice production model’s weights”,但未给出HuggingFace或ModelScope等平台的直接URL。
  • 数据集:评估基准 Freya-TR-Eval 已开源。论文中明确提到其发布位置:“Released as freyavoice/freya-tr-eval on HuggingFace。” 对于训练数据,论文指出使用的是“内部语料库”(sections 3.4 and 3.5),未开源。
  • Demo:论文中未提及在线演示或Demo链接。
  • 复现材料:论文声明会开源评估基准(Freya-TR-Eval)的“种子构建脚本”和“完整的评估工具链”,并会在代码中发布推理和批处理工具,但未给出具体的获取链接(基准脚本和代码的链接预计与代码仓库一同发布)。
  • 论文中引用的开源项目:
    1. AudioVAE2:论文复用的核心组件,源自VoxCPM2,在Apache-2.0许可下复用。论文未提供其直接链接,但引用了Zhou et al., 2026的VoxCPM2论文。
    2. Whisper-large-v3:用于评估的自动语音识别模型。论文引用为Radford et al., 2023,模型可通过OpenAI或HuggingFace获取。
    3. MMS forced alignment:用于从语料中提取短语音片段的工具。论文提到使用“torchaudio MMS_FA with a Turkish-to-roman character map”,这是Meta的MMS项目的一部分。
    4. ECAPA-TDNN:用于说话人验证的嵌入模型。论文引用为Desplanques et al., 2020
    5. FLEURS-tr:用于评估校准的土耳其语测试集。论文引用为Conneau et al., 2023
    6. Common-Voice-tr:用于构建评估基准的土耳其语数据源之一。论文引用为Ardila et al., 2020
    7. CoVoST2-tr:用于构建评估基准的土耳其语数据源之一。论文引用为Wang et al., 2021
    8. F5-TTS:作为对比的基线系统之一,论文引用为Chen et al., 2025b
    9. XTTS-v2:作为对比的基线系统之一,论文引用为Casanova et al., 2024
    10. MMS-TTS-tr:作为对比的基线系统之一,论文引用为Pratap et al., 2024
    11. Piper:作为对比的基线系统之一。
    12. Spark-TTS:作为效率对比的基线系统之一,论文引用为Wang et al., 2025

🏗️ 方法概述和架构

FreyaTTS是一个完整的端到端文本到语音系统,其核心流程为:文本输入 → 字符嵌入与编码 → 潜在长度预测与非自回归扩散生成 → 冻结的VAE解码 → 48kHz音频输出。

  1. 整体流程:系统接收土耳其字符文本,通过一个文本编码器转换为特征序列,该序列同时驱动一个持续时间头来预测潜在序列长度,并为一个非自回归扩散Transformer(DiT)提供交叉注意力条件。DiT在预测的长度上并行地将高斯噪声去噪为干净的潜在序列,最后由一个完全冻结的AudioVAE2解码器将潜在序列解码为48kHz波形。整个生成过程是并行的,不依赖自回归循环。

下图展示了FreyaTTS的非自回归条件流匹配生成过程与DiT块内部设计。

Figure 1: Overall architecture of FreyaTTS. Character-level Turkish text (a 9292-symbol vocabulary; no byte-pair encoding, phonemizer, or grapheme-to-phoneme frontend) is embedded and refined by a ConvNeXt-1d encoder into a character-featur

左图呈现了从土耳其字符输入到48kHz波形输出的完整数据流,包括ConvNeXt-1d文本编码器、持续时间头预测以及在冻结AudioVAE2潜空间中的流匹配生成。右图详细说明了DiT块内部的adaLN-zero条件化机制,每个块通过自注意力、交叉注意力和前馈网络,并由时间步调制。

  1. 主要组件详解

    • 冻结的AudioVAE2:这是系统的声学基础。它是一个预训练的变分自编码器,其编码器将16kHz波形压缩为25Hz、64维的连续潜在序列,解码器则将潜在序列重建为48kHz波形。论文强调,这种16kHz编码/48kHz解码的不对称性固定了输出采样率,但可用的声学带宽仍受限于编码器的16kHz输入和训练音频的带宽。在FreyaTTS中,这个组件被完全冻结,不参与任何训练,其高保真解码能力被直接继承。这使得主生成模型可以专注于从文本到潜在空间的映射。
    • 文本编码器与持续时间头:文本编码器使用一个包含4层ConvNeXt-1d块的神经网络,将92个符号的字符级土耳其词汇表(包括29个字母、数字、标点等)转换为特征序列c。操作于原始字符意味着土耳其语的正字法现象(如元音和谐、带点和不带点的ı区别、首字母缩略词的读法)被直接学习,而非交给G2P前端处理。该序列c被共享用于两个目的:(1) 作为DiT交叉注意力的键/值;(2) 通过一个基于掩码平均池化的小型MLP回归出对数持续时间\(\log\hat{T}\),以预测整个潜在序列的长度。
    • 非自回归扩散Transformer(DiT):这是生成模型的核心,其配置为宽度d=640,深度16,头数10。每个DiT块通过三个残差子层更新帧隐状态\(h \in \mathbb{R}^{T \times d}\):(a) 带有旋转位置编码(RoPE)的自注意力,用于建模潜在帧间的依赖;(b) 文本交叉注意力,用于注入文本条件c;(c) SwiGLU前馈网络(隐藏层维度2048)。关键设计是每个子层都通过自适应层归一化(adaLN-zero)机制,由流匹配时间步t进行调制。具体地,每个块通过一个MLP从时间步嵌入生成9个调制向量\((\beta_1, \gamma_1, g_1, ... \beta_3, \gamma_3, g_3)\),这些向量用于对每个子层的输入进行缩放、偏移和门控。这些调制向量在初始化时为零(adaLN-zero),使得每个块在训练初期表现为恒等映射,从而稳定训练。
    • 流匹配目标:训练时,模型学习一个速度场\(v_\theta\),用于将高斯先验\(x_0\)沿着直线路径传输到数据\(x_1\)。损失函数是掩码后的速度预测均方误差,外加一个辅助的持续时间预测损失(权重\(\lambda_{dur}=0.1\))。公式表示为:\(\mathcal{L} = \mathbb{E}_{t, x_0, x_1} [\| m \odot (v_\theta(x_t, t, c) - (x_1 - x_0)) \|^2_2] + \lambda_{dur} (\log\hat{T} - \log T)^2\),其中\(m\)是掩码。这是一种线性路径、整流流实例的条件流匹配,没有对抗损失、自回归或离散词元交叉熵。推理时,从噪声开始,通过固定32步的欧拉ODE求解器,利用学习到的速度场积分得到干净的潜在序列。
  2. 组件间的数据流:文本y → 字符嵌入 → 文本编码器 → 特征序列cc分为两路:一路输入持续时间头得到预测长度\(\hat{T}\);另一路作为DiT的条件输入。在DiT内部,带有噪声的长度为\(\hat{T}\)的潜在序列\(x_t\)、时间步t和特征c共同作用,输出速度预测。解码后的潜在序列\(x_1\) → 冻结的AudioVAE2解码器 → 最终音频。

  3. 关键设计选择及动机

    • 冻结潜空间:将声学建模(AudioVAE2)与文本到声学映射(DiT)解耦,使轻量级模型能利用大型VAE的重建能力,专注于语义条件生成,这是其参数效率高的关键。
    • 非自回归生成:选择非自回归的DiT而非自回归解码器,动机是避免自回归模型固有的左到右误差累积,这对于需要精确生成数字、短语的土耳其语对话场景至关重要。同时,生成步骤数固定为32步,与语句长度解耦。
    • 字符级输入与无G2P:绕过复杂的音素转换器和图素到音素规则,直接让模型从音频中学习土耳其语复杂的形态(如元音和谐)和发音规则,简化了前端并提升了对非规则词(如数字、缩写)的适应性(尽管数字仍需前端扩展)。然而,数字串的正字法长度与语音长度差异过大,瓶颈在于持续时间预测器,因此仍需在文本前端将其扩展为口语形式。
    • 两阶段后训练:从无说话人的预训练模型开始,第一阶段“语音锁定”通过单说话人微调将稳定身份写入权重;第二阶段“短话语覆盖”通过强制对齐挖掘的短语音数据微调,修复短话语失败模式。这是一个务实的、面向生产部署的配方。
  4. 专业术语解释

    • 条件流匹配:一种生成模型范式,通过学习一个随时间变化的速度场,将简单分布(如高斯噪声)传输到复杂数据分布。其“条件”体现在速度场预测受文本条件c和时间步t的调制。
    • adaLN-zero:自适应层归一化的一种变体,根据时间步生成缩放、偏移和门控参数来调制每个Transformer块的特征图,且初始化为零以确保训练初期的稳定。

💡 核心创新点

  1. 土耳其语优先的无Tokenizer非自回归TTS:针对土耳其语等中等资源语言,提出了一个从头预训练的、字符级输入、无音素转换器或离散语音tokenizer的NAR系统。这解决了传统前端规则在处理土耳其语复杂形态和数字时脆弱的问题,并避免了自回归解码的错误累积。证据显示,其WER/CER低于更大规模的通用多语言系统。
  2. 在冻结的AudioVAE2潜空间中进行流匹配生成:创新地将VoxCPM2中用于重建的AudioVAE2组件冻结并复用,作为系统固定的声学“引擎”,而将一个紧凑的DiT作为“规划器”专注于文本到潜空间的映射。这种解耦使得183M参数的模型能够继承48kHz高保真解码,实现了质量与效率的平衡。
  3. 生产导向的两阶段后训练配方:提出了从无条件预训练模型到稳定单说话人生产模型的明确转换路径:(1) 语音锁定SFT,将F0标准差从74.9Hz降至5.0Hz,稳定说话人身份;(2) 短话语覆盖SFT,通过强制对齐数据修复孤立词元和短语的生成失败。这是一个面向实际部署的工程创新。
  4. 完整的效率与部署优化栈:报告不仅关注质量,还系统性地优化了推理效率(非自回归并行生成、固定32步ODE),并在多种硬件(H100 GPU、RTX 4090、笔记本CPU、Apple Neural Engine)上进行了测量和优化,提供了远超学术论文的部署指导细节。例如,报告了在笔记本CPU上接近实时的性能,以及专用批处理服务器能达到的高吞吐量。

📊 实验结果

在495句土耳其语日常对话基准上,采用带宽匹配(下采样至8kHz)的Whisper-large-v3进行转录评估。FreyaTTS在WER和CER上均优于参数量更大的开源系统。其自然度MOS仅次于最大的XTTS-v2。

系统参数WER ↓CER ↓MOS ↑
Piper (tr, dfki)16M4.41.13.47±0.22
Coqui GlowTTS (tr)28M12.13.32.53±0.19
MMS-TTS (tr)36M6.81.73.58±0.20
SpeechT5 (tr)144M83.445.51.59±0.14
FreyaTTS (ours)183.2M8.03.03.68±0.22
F5-TTS (tr)336M24.310.93.63±0.23
XTTS-v2 (multi)470M11.13.93.82±0.19

下图显示了模型在不同输入长度下的词错误率变化。

(c) WER vs. length.

预训练模型的WER随输入词数增加而急剧上升,表明长序列下存在严重的误差累积。经过语音锁定微调并加入推理子句分块后,WER的增长得到显著抑制,验证了两阶段后训练与推理优化对提升模型鲁棒性的有效性。

下图展示了预训练模型与经过“语音锁定”微调后模型在基频稳定性上的对比。

(b) Voice-lock (F0F_{0}).

图中可见,多说话人预训练模型生成语音的基频(F0)标准差高达74.9 Hz,而经过单说话人微调(SFT-v1)后,标准差降至5.0 Hz,表明说话人身份被稳定锁定。

说话人一致性

通过两阶段后训练,特别是单说话人语音锁定(SFT-v1),显著提升了语音的一致性和稳定性:

  • F0稳定性:将同一文本多次生成的中位基频(F0)标准差从74.9Hz大幅降低至5.0Hz。
  • 说话人验证:ECAPA-TDNN说话人验证余弦相似度达到0.873±0.029,与同一说话人不同真实录音的相似度(0.883±0.026)在统计上无差异,表明模型已稳定锁定目标说话人身份。

推理效率

在单张RTX 4090显卡上,FreyaTTS展现了优异的推理效率。其非自回归架构确保了生成速度与语音长度解耦。

系统参数VRAM (GB)TTFT_long (s)RTF_medRTF_long吞吐量 (音频秒/墙秒)
FreyaTTS (ours)183M1.50.520.110.109.4 (C=4)
F5-TTS (tr)~336M0.80.740.130.058.4 (C=2)
XTTS-v2 (multi)~470M2.20.300.330.333.4 (C=2)
Spark-TTS~0.5B5.414.01.081.041.4 (C=2)
VoxCPM2~2B5.54.20.370.371.7 (C=1)
VoxCPM2 (serving engine)†~2B11.40.140.150.1324.8 (C=16)
FreyaTTS (batched ODE)†183M3.80.5465.2 (B=8)

关键效率指标

  • 单句延迟(RTF):在中等长度句子上,实时率(RTF)为0.11,生成速度是实时的9倍以上。
  • 吞吐量:采用4个并发引擎时,吞吐量达到9.4音频秒/墙秒。通过专用批处理服务器,吞吐量可进一步提升至65.2音频秒/墙秒。
  • 边缘部署:在笔记本CPU(Apple M3)上能以接近实时的速度运行(RTF约0.7-1.0)。

统计稳健性

论文对主结果进行了10,000次句子级自举重采样检验:

  • 置信区间:得到的WER 95%置信区间为[6.8, 9.1],CER为[2.4, 3.4]。
  • 消融实验:移除推理层(归一化、分块、持续时间下限等)仅导致WER变化最多0.3个百分点,表明这些组件主要针对罕见的尾部失败模式,对主体性能影响很小。

关键结论总结

  1. 核心质量:在自建的土耳其语对话基准Freya-TR-Eval上,FreyaTTS(183.2M参数)以8.0%的WER和3.0%的CER,在错误率指标上显著优于参数量更大的通用或零样本克隆系统(如XTTS-v2、F5-TTS),证明了土耳其语专用模型的优势。
  2. 自然度:在主观自然度MOS评分(3.68)上,FreyaTTS同样优于同级别系统,仅次于参数量为其2.6倍的XTTS-v2,表明其生成的语音质量具有竞争力。
  3. 一致性与稳定性:通过两阶段后训练,模型成功从无说话人状态转变为具有稳定、一致身份的单声音产品,解决了多说话人预训练模型身份漂移的问题。
  4. 效率优势:非自回归架构赋予了FreyaTTS极高的推理效率,其RTF和吞吐量在同类可比系统中领先,并能在消费级GPU和笔记本CPU上高效部署,满足了实时和边缘计算的需求。
  5. 可靠性验证:统计检验表明主结果是稳健的,且性能对推理层的依赖很小,验证了模型设计的鲁棒性。

🔬 细节详述

  • 训练数据:预训练使用大规模、高质量的土耳其语内部多说话人语料,涵盖数字串、姓名列表、对话句子和通用语音。后训练SFT-v1使用单一同意的专业发音人录制的窄带语料。SFT-v2在此基础上,通过MMS强制对齐从同一说话人数据中挖掘了单词和双词短语。
  • 损失函数:主要损失是掩码后的流匹配均方误差 \(\mathcal{L}_{fm} = \mathbb{E}[\|m \odot (v_\theta - (x_1-x_0))\|^2]\),其中\(m\)是掩码。辅助损失是持续时间预测的均方误差 \(\mathcal{L}_{dur} = \lambda_{dur} * (\log \hat{T} - \log T)^2\),权重 \(\lambda_{dur} = 0.1\)
  • 训练策略:预训练:AdamW优化器,学习率 5e-4,权重衰减0.01,梯度裁剪1.0,2000步线性预热后接余弦衰减,共训练150k步,批大小64。SFT-v1:全参数微调,学习率1e-4,训练约1个epoch。SFT-v2:继续微调,学习率5e-5,\(\lambda_{dur}=0.2\)
  • 关键超参数:模型参数量183.2M;DiT维度d=640,深度16,头数10;文本编码器4层ConvNeXt-1d;潜在空间维度64,帧率25Hz;推理ODE步数32步。
  • 训练硬件:在H100和H200 GPU上进行预编码和训练。
  • 推理细节:确定性欧拉ODE求解器,32步,无分类器自由引导或倾斜采样。包含推理包装器:长输入分句、短输入持续时间下限、基于发声检查的重试。
  • 正则化:DiT块使用adaLN-zero初始化(各调制向量初始化为零)以稳定训练。

⚖️ 评分理由

  • 创新性 (1.2/2):创新体现在系统集成和工程优化层面:将非自回归流匹配、冻结的连续潜空间VAE、字符级输入及两阶段生产导向后训练配方组合成针对土耳其语的完整高效方案,其‘生产硬化’路径(如语音锁定、短话语覆盖)具有明确的实用洞察。

  • 技术严谨性 (1.2/1.5):技术描述清晰严谨,模型架构、损失函数和训练流程的数学表述准确,设计选择(如NAR而非AR、冻结VAE、两阶段SFT)的动机解释充分,对局限性的讨论诚实。

  • 实验充分性 (1.1/1.5):实验全面覆盖了端到端质量、一致性、效率和鲁棒性,与多个公开可比基线进行了公平对比。主要扣分点在于评估仅基于一个自建的495句基准,且缺乏对SFT-v2阶段效果的系统性消融。

  • 清晰度 (0.8/1):论文整体结构清晰,图文配合良好。扣分点在于:1. 摘要和引言中部分长句略显复杂,可能影响快速理解;2. 对部分关键细节(如文本编码器具体结构、推理包装器逻辑)的描述可更精炼。

  • 影响力 (1.2/1.5):对语音合成领域,特别是中等资源语言和边缘部署场景,具有明确的实用价值。它提供了一个从预训练到生产部署的完整范例,展示了如何利用大型冻结模型赋能小型专用系统,其高效推理和硬件适配性对工业应用有直接参考价值。

  • 开源 (0.5/1.5):论文在摘要和结论中多次明确承诺将开源模型权重、训练和推理代码以及评估基准(Freya-TR-Eval已发布),并声称采用Apache-2.0许可证。但正文中未提供代码和模型权重的具体链接,根据‘明确承诺未来开放但尚未发布’的锚点给予此分数。

  • 可复现性 (0.3/0.5):论文提供了大量关键的训练和实现细节(如学习率、优化器、批大小、模型配置等),但部分细节仍缺失(如文本编码器ConvNeXt块的具体配置、SFT阶段确切数据量和epoch数),且训练数据为内部数据,外部研究者无法获取,构成了复现的根本障碍。

  • 工程/实践价值 (1.4/1.5):作为一份系统技术报告,完整呈现了一个从零开始构建生产级TTS系统的工程蓝图,包括模型架构选择、多阶段训练策略、针对生产环境的后训练‘硬化’、全面的推理优化及效率测量,工程实践价值极高。

🚨 局限与问题

  1. 论文明确承认的局限

    • 数字密集型输入需要在文本前端进行口语化扩展,因为字符级持续时间预测器无法为紧凑数字串分配足够帧。
    • 由于训练数据是窄带语音,合成语音的频带上限为电话质量(尽管输出采样率为48kHz)。
    • 模型在长序列上仍存在误差累积,虽通过推理分块有所缓解,但未完全解决。
    • 与两个紧凑的基于音素的VITS基线(Piper, MMS-TTS)相比,在干净对话文本上的错误率仍稍高。
  2. 审稿人发现的潜在问题

    • 基准测试的局限性:评估仅基于一个495句的自建基准,其主题覆盖、句子复杂度分布和语音现象(如情感、噪声、背景音)可能不足以全面代表“对话式合成”的挑战。其通用性有待更多样、更复杂的评估验证。
    • 基线公平性的深层问题:与之对比的“更大开源系统”(如XTTS-v2, F5-TTS)是为零样本克隆设计的通用多语言模型。用它们的土耳其语分支与一个从头训练的土耳其语专用模型比较,公平性有待商榷。一个更有力的对比是与专门为土耳其语优化过的系统进行,但这类系统在开放领域可能较少。
    • “无Tokenizer”声明的边界:虽然模型本身不使用离散语音tokenizer,但它严重依赖于冻结的AudioVAE2。论文提到VoxCPM使用了FSQ瓶颈,但未明确说明复用的AudioVAE2是否包含向量量化。如果AudioVAE2内部有量化,那么“无Tokenizer”的说法需要更精确的限定。
    • 数据的不透明性:所有训练数据(预训练和SFT)均为内部数据,未公开。这不仅影响可复现性,也使得外界无法评估模型是否存在偏见、覆盖不足或领域不匹配等问题。

← 返回 2026-07-13 语音/音乐/音频论文速递