英文题目:Transcript-Free Flow-Matching Text-to-Speech via Speech Feature Conditioning

会议身份:conference:interspeech:2026:conference-paper-id:eom26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#Adapter #流匹配 #零样本 #语音 #文本到语音

评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • SooHwan Eom:机构信息未能从会议 PDF 纯文本可靠映射
  • Hee Suk Yoon:机构信息未能从会议 PDF 纯文本可靠映射
  • Eunseop Yoon:机构信息未能从会议 PDF 纯文本可靠映射
  • Mark Hasegawa-Johnson:机构信息未能从会议 PDF 纯文本可靠映射
  • Chang D. Yoo:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

零样本语音合成需以短参考音频和目标文本生成保留音色且内容正确的新语音,难点在于参考转录依赖外部识别,且病理或口音语音中文本期望与实际声学严重错位。本文提出参考转录无关的RTFree-F5,先以冻结的自监督编码器从参考波形抽取帧级连续表征,再经轻量投影器映射为类文本条件向量,最后与目标文本编码拼接送入流匹配骨干做掩蔽频谱重建。与复用字符填充的原版F5-TTS相比,该机制将参考条件从规范发音期望改为与声学对齐的实际发音描述,从而缓解冲突并省去推理期转录。在构音障碍集SAP发育集上系统词错率由原始语音的24.62%降至10.39%,优于oracle基线的20.71%,自然度由2.16升至2.85;在L2-ARCTIC上由10.75%降至1.44%,优于oracle基线的2.00%。在LibriSpeech-PC上词错率1.77%和自然度4.13保持竞争力。该结论目前仅在英语朗读与两类非典型语音上验证,重度病理、跨语言与对话式场景的外推尚未证明。原文未披露训练之外的推理延迟与部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

这篇解读的输入是论文原文给出的模型描述、训练流程、实验条件和结果数字,目标是让刚进入语音合成的研究生能不看原文复述出方法动作和验证逻辑。需要保留的信息包括参考条件如何构造、投影器输入输出维度与冻结关系、2 阶段训练的优化对象、推理时是否需要参考转写、以及在典型人和非典型人身上的可比数字。输出是一套按学习依赖展开的说明,先讲任务与路线,再讲结构与计算,再讲训练与推理,最后讲证据与边界。

零-shot 文本转语音要解决的问题是只给一段几秒钟的参考音频和一句目标文本,就为从未见过的说话人合成自然语音。白话说,参考音频提供像谁说话,目标文本提供说什么内容。英文对应 zero-shot text-to-speech。流匹配是生成模型的一类训练方式,白话说就是学习一条从噪声逐渐变成目标梅尔频谱的运动方向,推理时沿着这个方向解常微分方程得到频谱,英文是 flow-matching。梅尔频谱是语音的时频表示,后续经声码器变成波形。

传统非自回归合成常需要字音转换、时长预测和强制对齐,把文本拉长到与频谱等长。F5-TTS 一类方法简化了这条路,把输入按字符切分并用填充符号补齐到频谱长度,再用一个文本编码器得到条件特征。推理时采用补全思路,未遮蔽的参考频谱作为声音提示,被遮蔽的目标段需要重建。问题在于参考侧的条件也来自参考文本,推理时必须先对参考音频做语音识别得到转写。对于口齿不清、口音重或构音障碍的说话人,识别错误会直接污染条件,这正是论文要处理的脆弱环节。

术语小结:后文简称如何固定?

为保证复述一致,这里固定简称。零-shot 文本转语音指只给参考音频和目标文本就为新说话人合成,简称为零-shot 合成。流匹配指学习噪声到频谱向量场的生成方式,简称为流匹配。自监督语音特征指冻结语音编码器抽出的连续帧表示,简称为语音特征。文本条件空间指 F5-TTS 文本编码器输出的维度与分布,简称为条件空间。

投影器指两层感知机映射,简称为投影器。跨 utterance 配对指同一说话人不同句子的参考与目标组合,简称为跨句配对。词错率、相似度、预测平均意见分分别简称 WER、SIM、MOS,方向为 WER 越低越好,SIM 和 MOS 越高越好。

参考梅尔频谱 × 参考条件特征: 参考梅尔频谱分工是作为未遮蔽的声学提示保留音色,参考条件特征分工是告诉解码器这段声音对应什么语言学内容,RTFree-F5 只替换后者为语音投影特征而保留前者,从而在去掉转写的同时不丢失声音线索。

这些术语的组合关系是理解全文的关键。语音特征提供与实际发音一致的参考信息,条件空间保证主干能理解输入,投影器完成两者翻译,跨句配对与联合微调保证训练与推理一致。缺少任何一环,复用检查点的无转写方案都会退化,这一点已被第一阶段失败和典型集退化所显示。

已有路线在同一输入和同一目标下做了什么取舍?

自回归语音语言模型路线把语音离散成 token 后逐个预测,优点是隐式处理时长且采样灵活,代价是暴露偏差、推理延迟高、严重依赖语音分词器质量。非自回归扩散与流匹配路线并行生成,速度快、保真度高,但需要解决文本与语音的长度对齐难题。E2-TTS 用字符加填充符号绕开音素与时长模块,F5-TTS 再加一个文本编码器改进对齐,两者都保留了推理时需要参考转写的做法。

另一条相关路线是无文本的零-shot 声音转换,用离散自监督单元代替文本条件。由于输入空间从字符变成单元编号,原来按字符训练的 F5-TTS 检查点无法直接复用,必须从头训练。RTFree-F5 的位置是既去掉参考转写,又完整复用预训练的 F5-TTS 检查点。它不离散化语音,而是把连续自监督特征映射进已有的文本条件空间,目标文本仍走原来的文本编码器,因此内容控制仍然是文本驱动的。

这种对照要在相同输入和相同目标下理解。同输入指都给定参考音频和目标文本,同目标指合成目标文本且保留参考人音色,同运行阶段指推理时是否需要外部识别。论文的判断是参考转写不仅带来识别误差,即使转写完全正确,基于文本的参考条件仍可能把非典型发音模式带进合成,这一点靠换更强的识别器解决不了。

参考转写为什么在非典型语音上尤其不可靠?

论文指出两个层次的问题。第一层是识别可靠性,构音不清、重口音和构音障碍语音会让外部识别系统出错,错误的参考文本直接改变条件。第二层更根本,即使给出标准答案转写,文本条件编码的是规范的音素序列,而参考频谱里实际是 timing 不规则、发音模糊或韵律异常的声学实现。解码器同时看到规范文本条件和异常声学上下文,需要调和冲突,倾向于把参考中的非典型模式延续到生成段。

举一个教学用的例子帮助理解,但它不是论文实验。假设参考人把目标词读得含糊,标准转写仍写成规范拼写,文本条件就会要求一个规范发音,而声学提示却是含糊实现,模型要在两者之间折中。论文的实际证据是即使使用标准答案转写的基线,在构音障碍和非母语集上仍然落后于语音特征条件方法。这支持了问题不只来自识别错误,也来自条件与声学不一致。

因此任务被重新定义为参考转写无关的合成。推理输入只保留参考波形和目标文本,不再要求参考文本。训练也要相应改变,不再把同一句话切成前后两段做补全,而是用同一说话人的不同句子组成参考与目标,迫使模型学习与具体内容无关但与说话人有关的表示。

RTFree-F5 沿着一个样本走完哪条主路径?

先沿一个样本走完全程。输入是参考波形和目标文本两路。参考波形一路进入冻结的语音编码器得到帧级自监督表示,再经两层投影器映射到文本条件空间,得到参考条件特征。目标文本一路按字符切分并填充后进入原来的文本编码器,得到目标条件特征。两组特征在时间轴上拼接成最终条件。

同时,参考梅尔频谱作为未遮蔽的声学上下文,与被遮蔽的目标频谱位置一起送入流匹配主干。主干在该条件下解出目标频谱,再经声码器得到波形。推理全程不需要参考转写。

这段导读对应论文图 1,左侧是 F5-TTS,右侧是 RTFree-F5,比较的是条件通道从哪里来,声学补全结构保持一致。读图时注意底部输入、中间编码器、中间条件圆点和顶部声学条带的对应关系。

看图路径: 1. 先从底部输入往上看:左侧底部是参考文本加目标文本,右侧底部是参考波形加目标文本;2. 再看中间编码器:左侧只有共享文本编码器,右侧多了语音编码器加投影器两级;3. 接着看条件圆点序列:左侧全部来自文本,右侧前半来自语音投影、后半来自文本;4. 最后看顶部声学路径:两侧都保留参考频谱作未遮蔽提示,只重建被遮蔽的目标段

原论文 Figure 1:Comparison between F5-TTS (left) and RTFree-F5 (right).

论文图 1。原论文 Figure 1:“Comparison between F5-TTS (left) and RTFree-F5 (right).”。

图 1 左侧显示参考文本与目标文本拼接后经过共享文本编码器形成条件,底部字符条带包含参考文本字符和目标文本字符加填充符。右侧显示参考波形经过语音编码器和投影器得到参考条件,目标文本仍经过文本编码器得到目标条件,两者在时间轴拼接为语音加文本的混合条件。顶部两侧都是左侧频谱保留、右侧频谱遮蔽,输出只重建被遮蔽部分,中间橙色虚线表示复用并微调 F5-TTS 主干。这种画法把改动定位得很清楚,声学提示不变,变的是条件特征的来源。

语音编码器和投影器各自算什么,如何对齐到文本空间?

自监督语音编码器是内容与音色表示的来源,白话说就是一个在大规模语音上预训练过的网络,能从波形抽出每帧的连续向量,英文是 self-supervised learning speech encoder,缩写 SSL。论文采用 WavLM-Large,训练全程冻结。它的输出维度是 1024,帧率是 50 赫兹,而 F5-TTS 梅尔频谱对应 24 千赫音频、256 点 hop,大约 93.75 赫兹,因此投影后的特征需要线性插值上采样到梅尔帧率。这个上采样是帧率对齐动作,不改变特征语义。

流匹配 × 掩蔽补全: 流匹配负责学习从噪声到梅尔频谱的向量场,掩蔽补全负责给出学习任务:遮住一段频谱让模型在声学上下文和文本条件下重建它,二者搭配使 RTFree-F5 可以在不改主干结构的情况下只替换条件通道。

投影器是模态桥接模块,白话说就是把语音向量的坐标系翻译成文本条件向量的坐标系,记作 g。论文用两层多层感知机加层归一化,隐藏维度 512,输出维度 512,与 F5-TTS 条件维度 1 致,可训练参数约 0.8M。为保证训练稳定,最后一层投影权重按 0.1 缩放初始化。它对每 1 帧独立作用,把 1024 维映射为 512 维。

自监督语音特征 × 文本条件空间: 自监督语音特征分工是直接从参考波形提取与发音实际一致的内容和音色表示,文本条件空间分工是保持 F5-TTS 解码器能理解的输入维度与分布,搭配理由是把连续语音映射进已有文本空间即可复用预训练检查点而不必重建词表。

条件拼接是最后的组装动作。目标文本经文本编码器得到目标特征,参考语音经编码器加投影得到参考特征,两者在时间轴拼接后与遮蔽频谱一起送入 Diffusion Transformer 主干。关键细节是参考梅尔频谱仍然作为未遮蔽声学上下文保留,原 F5-TTS 的声学路径没有动,只有条件通道从参考文本特征换成投影语音特征。这种设计是复用检查点的前提,因为主干看到的条件维度不变。

两阶段训练各冻结谁、各更新谁、监督从哪里来?

训练数据来自 LibriTTS 训练集,按同一说话人的不同句子采样跨 utterance 对,时长过滤到 0.3 秒到 30 秒之间。这种构造刻意打破同一句话前后连续的声学连续性,使模型不能靠局部延续猜出目标,必须学到可迁移的说话人表示。分类器无关引导的丢弃按原文设置,音频丢弃概率 0.3,联合丢弃概率 0.2。

第一阶段是跨模态对齐,只训练投影器,冻结语音编码器和整个 F5-TTS 模型。训练元组包括参考音频、目标梅尔频谱和目标转写,条件按投影语音特征拼接目标文本特征构造,优化目标是流匹配目标,梯度只回传到投影器。直观说,先让翻译器学会把语音向量放到文本空间的合理位置,但不扰动生成主干。

跨 utterance 配对 × 联合微调: 跨 utterance 配对分工是让训练时的参考与目标来自同一说话人的不同句子以模拟推理,联合微调分工是让投影器和流匹配主干共同适应这种声学不连续的新条件,组合意义是先对齐模态再消除分布失配。

第二阶段是联合微调,同时更新投影器和流匹配主干,仍冻结文本编码器和语音编码器。论文给出的理由是只训练投影器可能不足以消除主干的分布失配,而且预训练主干原来是在同一句话内做补全,现在是跨句子条件,声学上不连续,需要适应新的条件机制。优化目标形式不变,梯度同时流经投影器和主干。学习率区分设置,主干用 1 乘 10 的负 5 次方,投影器用 5 乘 10 的负 5 次方,优化器是 AdamW 加线性 warmup 后线性衰减。第一阶段约 10 个 epoch,第二阶段约 20 个 epoch,在 4 块 A100 上分别约 1 到 2 天和 2 到 3 天。

推理时给定参考音频和目标文本构造条件,从标准正态噪声出发解常微分方程到 1,默认用 Euler 求解器 32 步,sway 采样系数负 1,无分类器引导强度 2.0,生成梅尔频谱后用 Vocos 声码器合成 24 千赫波形。

在哪些数据上测什么,基线条件是否一致?

评估分典型说话人和非典型说话人两类。典型集用 LibriSpeech-PC 的 test-clean 子集和 SeedTTS 的 test-en 子集。非典型集用 SAP 的 dev 子集,包含约 100 位构音障碍说话人的语音,以及 L2-ARCTIC,覆盖 6 种母语背景的非母语英语,每种语言选 2 位说话人评估。基线是预训练 F5-TTS,分别用标准答案转写和 Whisper large-v3 识别转写作为参考文本条件,与 RTFree-F5 的无参考转写条件对比。

指标有 3 个,方向要先记清。可懂度用 Whisper large-v3 转写合成语音后算词错率,英文 word error rate,缩写 WER,越低越好。说话人相似度用 ECAPA-TDNN 特征余弦相似度,英文 speaker similarity,缩写 SIM,越高越好。自然度用 UTMOS 预测平均意见分,英文 mean opinion score,缩写 MOS,越高越好。对于非典型集,还报告原始录音的这三项作为参照,其中相似度是与同一说话人其他 utterance 比较。

实现细节按原文交代。底座是 F5-TTS v1 Base 检查点,语音编码器是 WavLM-Large 且冻结。投影器输入 1024 维、隐藏 512 维、输出 512 维。训练与推理超参数见上一节。资源状态方面,论文给出两个链接但本次没有可验证的 HTTPS 可达证据,因此不能写代码或权重已公开,只能说原文在脚注中给出地址,本次未能确认可达。复现时应以原文超参数和检查点名称为准,先核对能否下载再谈运行。

典型人上保持了什么,非典型人上改进了什么?

先看典型说话人基准,比较问题是去掉参考转写后是否还能保持可懂度、音色和自然度。公平条件是同一底座、同一声码器和同一推理步数,差别只在参考条件来自文本还是来自投影语音。指标方向是 WER 越低越好,SIM 越高越好,MOS 越高越好。

条件指标基线 oracle基线 ASR本方法 Stage2
LibriSpeech-PCWER2.08%2.17%1.77%
LibriSpeech-PCMOS3.833.844.13
SeedTTSWER1.43%1.45%1.56%
SeedTTSMOS3.663.663.94

表后解释需要同时看到收益与代价。在 LibriSpeech-PC 上第二阶段模型 WER 为 1.77%,优于标准答案基线 2.08% 和识别基线 2.17%,MOS 从 3.83 提升到 4.13,自然度增益明显,说话人相似度原文报告为 0.66 对 0.67,基本相当。在 SeedTTS 上 MOS 达到 3.94 为最好,WER 为 1.56% 略高于基线,属于竞争水平而非全面领先。第一阶段只训练投影器的模型在 LibriSpeech-PC 上 WER 为 4.68%,明显退化,这反证了联合微调的必要性。未胜出项是 SeedTTS 的可懂度和两集的相似度都没有拉开差距,说明无转写方案在典型人上的主要收益是自然度而非音色。

再看非典型说话人,这是论文的主要动机。比较问题是在构音障碍和重口音下,无转写语音条件能否同时提升可懂度与自然度。基线仍是标准答案转写和识别转写,另有原始录音参照。

条件指标原始录音基线 oracle本方法 Stage2
SAP 构音障碍WER24.62%20.71%10.39%
SAP 构音障碍MOS2.162.272.85
L2-ARCTIC 非母语WER10.75%2.00%1.44%
L2-ARCTIC 非母语MOS3.823.924.08

表后解释要区分两组的不同含义。在 SAP 上 WER 从原始 24.62% 降到 10.39%,相对下降约 58%,且优于标准答案基线 20.71%,MOS 从 2.16 升到 2.85。代价是相似度从 0.60 降到 0.50,论文解释为可懂度提升需要部分纠正与身份耦合的发音模式,且 ECAPA-TDNN 可能把病理特征混入身份表示。在 L2-ARCTIC 上 WER 从原始 10.75% 降到 1.44%,相对下降约 87%,也优于标准答案基线 2.00% 和识别基线 1.99%,相似度保持 0.61 对 0.60,MOS 从 3.82 升到 4.08。限制是相似度只是维持而非提升,自然度是预测分而非人工听音,这一点在引用时不能写成真人 MOS 胜出。

只训练投影器会怎样,换识别转写能解决问题吗?

论文实际给出的对照不是删模块的消融,而是阶段对照和条件对照。第一阶段只训练投影器的模型在 SAP 上 WER 高达 90%,在 L2-ARCTIC 上为 7.53%,相似度也低。这显示跨模态对齐本身不足以让主干处理构音障碍语音,分布失配很严重,必须经过第二阶段联合微调才能把 WER 拉回可用区间。这个失败条件很重要,它说明复用检查点不等于零成本迁移。

第二个对照是标准答案转写与识别转写基线几乎相同。在 SAP 上两者分别为 20.71% 和 20.46%,在 L2-ARCTIC 上为 2.00% 和 1.99%。如果问题只是识别错误,换成标准答案应该大幅好转,但实际没有。这支持论文的机制解释,文本条件编码的是规范发音期望,与参考频谱中的实际异常实现冲突,解码器在冲突下会把非典型模式延续到输出。语音投影特征的优势在于它与同一段参考音频内在对齐,不强加规范发音期望,因此能保留音色同时按目标文本生成更规范的发音。

这里的措辞要分级。论文直接报告的是数字差距,有限解释是条件与声学一致性,未验证的推测是更细的音素级传播路径。解读中把前者写成报告或显示,把后者写成可能或待验证,不把相关性写成因果证明。

哪些边界没有测,哪些代价不能忽略?

第一个边界是说话人相似度的权衡。在构音障碍集上相似度下降是明确代价,论文认为在以沟通为首要目标的无障碍场景中这种取舍可以接受,但也指出改善音色保持仍是未来方向。不能把可懂度提升说成全面胜利,引用时要同时给出相似度数字。

第二个边界是评估方式。自然度用 UTMOS 预测分,可懂度用 Whisper 转写算 WER,相似度用 ECAPA-TDNN 余弦值,这些都是自动指标,不是人工听音或人工转写。自动指标与人评不一致时,不能把自动指标当成人评。论文没有报告误判率、延迟、实时率和详细推理开销,因此不能承诺延迟改善或部署成本下降。训练成本只给出 A100 天数,没有给出显存、吞吐和功耗细节。

第 3 个边界是数据与泛化。训练只用 LibriTTS 的健康语音跨 utterance 对,测试的非典型集是 SAP dev 和抽样的 L2-ARCTIC 说话人。能否推广到其他语种、更重度障碍、儿童或老年语音,原文没有证据。第一阶段在 SAP 上灾难性失败也提示,对与训练分布差异大的语音,主干适应是必需的,不能只靠冻结主干加小投影器。

要复现先做什么,先核对哪些超参数?

复现的第一步是准备底座与编码器。按原文应使用 F5-TTS v1 Base 检查点和 WavLM-Large,前者作为生成主干,后者冻结作特征提取。投影器是两层感知机,输入 1024 维、隐藏 512 维、输出 512 维,末层按 0.1 缩放初始化。由于本次没有验证到可达的下载资源,应先确认检查点与编码器权重能否获取,再谈训练,不要默认链接可用。

第二步是构造跨 utterance 数据。从 LibriTTS 训练集按同一说话人采样不同句子的参考与目标对,时长限制 0.3 秒到 30 秒。特征帧率要处理,WavLM 50 赫兹经投影后线性插值到约 93.75 赫兹的梅尔帧率。训练分 2 个阶段,第一阶段 10 个 epoch 只更新投影器,第二阶段 20 个 epoch 联合更新投影器与主干,文本与语音编码器始终冻结。学习率主干 1 乘 10 的负 5 次方、投影器 5 乘 10 的负 5 次方,AdamW 加线性 warmup 后线性衰减,引导丢弃按音频 0.3、联合 0.2。

第三步是推理与评估。推理用 Euler 求解器 32 步、sway 系数负 1、引导强度 2.0,经 Vocos 生成 24 千赫波形。评估用 Whisper large-v3 算 WER、ECAPA-TDNN 算余弦相似度、UTMOS 预测 MOS。还需补的验证包括人工可懂度与自然度听测、相似度的人评、以及在其他障碍程度和口音上的重复实验,这些是判断无障碍可用性的关键缺项。

何时值得尝试这种无参考转写方案?

当任务同时满足 3 个条件时值得尝试。第一,推理时拿不到可靠的参考转写,或者参考语音本身发音不规范,识别错误会污染条件。第二,希望复用已有的流匹配检查点而不重建词表或从头训练。第三,首要目标是可懂度和自然度,对音色相似度的轻微下降可以容忍。构音障碍重构和重口音保留音色的合成符合这种画像,典型人合成则更多是自然度收益。

不适合的情况也要明确。如果参考语音本身就是标准清晰语音且识别准确,文本基线已经很强,换成语音条件的增益有限。如果应用对音色一致性要求极高,或者需要严格保留病理语音的个人发音特点,那么为提升可懂度而做的规范化可能违背需求。论文特有的误解是把去掉转写理解成去掉参考音频,实际上参考梅尔频谱仍然作为声学提示保留,去掉的只是参考文本通道。另一个误解是把标准答案转写当成性能上界,论文证据显示在非典型语音上它不是上界,因为条件与声学不一致仍会拖累生成。

收束到可复述的方法一句话。参考波形走冻结语音编码器加可训练投影器得到参考条件,目标文本走原文本编码器得到目标条件,两者拼接后与未遮蔽参考频谱一起驱动流匹配主干补全目标频谱,训练先对齐投影器再联合微调主干,推理不需要参考转写。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总