英文题目:Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead

会议身份:conference:interspeech:2026:conference-paper-id:du26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#自回归模型 #知识蒸馏 #流式处理 #零样本 #文本到语音

评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Muyang Du:机构信息未能从会议 PDF 纯文本可靠映射
  • Jason Roche:机构信息未能从会议 PDF 纯文本可靠映射
  • Junjie Lai:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

级联式大语言模型加语音合成系统的瓶颈是文本到语音环节需等待完整句子才能启动,导致端到端响应延迟过高,逐词增量合成又容易丢失韵律与发音准确性。本文提出流式S5-TTS,以音素序列为编码器输入,以有限标量量化(Finite Scalar Quantization,FSQ)声码器码字为解码器输出,编码器按当前词加2个前视词构建上下文,解码器逐词自回归生成并用交叉注意力峰值检测词边界,词间波形经2帧重叠与汉宁窗交叉淡化拼接。辅助卷积注意力先预测解码步到编码步的单调对齐以构造解码器前视掩码,再与主干联合训练并通过交错多源蒸馏接受全上下文教师的软标签监督。与全上下文T5-TTS相比,蒸馏后S5-TTS在LibriTTS未见说话人集上词错率由3.49%降至2.65%,主观平均意见分差距缩小到0.04。该结论仅在英语朗读与对话文本、单教师蒸馏及2词前视设置下验证,未覆盖多语种、噪声参考与长篇章外推。原文未披露训练时长与部署成本。

🔗 开源与复现资源

  • 演示资源:https://s5-tts.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么要流式?

这篇论文研究的输入是文本大语言模型已经逐词吐出的词序列,以及一段用于决定音色的参考音频及其文字记录,目标输出是与参考音色一致的语音波形。传统做法是等大语言模型把一整句话写完,再把整句送给语音合成模型,这样端到端语音响应延迟包含大语言模型写完整句的时间加语音模型编码整句再解码的时间。在对话式交互里,用户希望大语言模型刚吐出前几个词就能听到声音,而不是等句号出现。

论文把这种需求定义为增量语音合成,也就是词到词的流式生成。研究生首先要建立的条件意识是,延迟不仅取决于声学模型本身的实时率,还取决于它需要多少未来文本才能开口。论文选择的前视词数 k 就是这个信息条件,k 等于 2 意味着合成当前词时只能看到当前词、历史词和未来两个词。后续所有可懂度、相似度和自然度的比较都必须在这个信息条件下理解,否则会把全上下文模型的优势误读为结构优势。

演示页当前可用,地址见资源状态,本文事实仍以论文正文为准。

同任务的前人路线给了什么约束?

在增量合成这条线上,前人已经证明前视是关键。早期把自回归声学模型与声码器改造为增量版本的工作指出,回看声学上下文对韵律自然很重要。受同声传译中前缀到前缀框架启发,后续工作把前视策略引入自回归声学模型,报告即使一个未来词也能明显提升自然度,有分析量化为一词前视恢复约八成多的全上下文表示,两词前视进一步提升。还有基于传感器的统一识别合成架构同样证实有限前视足以接近非流式质量。

近期并行结构加知识蒸馏的工作进一步把延迟压低,并用蒸馏缓解有限前视的退化。这些工作共同说明,前视不是可有可无的技巧,而是决定韵律和对齐精度的信息瓶颈。但论文明确指出,已有增量合成大多局限于单说话人或少说话人,零样本克隆能力和自然度仍受限。这就引出本文的定位,不再做单人系统的延迟优化,而是把基于编码器解码器的大语言模型语音合成改造为支持零样本的流式版本,并在有限前视下保持可懂度和说话人相似度。

全上下文模型为什么不能直接切成流式?

论文以 T5 语音合成为起点,它用并行变换器编码器处理由字素到音素转换得到的音素序列,用自回归变换器解码器预测有限标量量化音频编码器的多码本离散令牌。解码每一步消费上一时刻 K 个码本令牌嵌入之和,并为每个码本用独立线性头预测新的 K 个令牌。训练时还在解码器交叉注意力权重上加连接时序分类损失,鼓励单调对齐以减少幻觉。如果直接把这种全上下文模型拿来做增量推理,会出现训练推理不一致。

训练时编码器自注意力能看到整句,解码器交叉注意力也能利用整句,模型会学会依赖右侧未来上下文做发音和韵律决策。推理时未来词还没生成,这种依赖被打断,就会出现插入、删除和替换错误。论文的消融 later 也显示,只去掉编码器掩码反而比两个掩码都去掉更差,正是因为编码器按全序列训练而推理缺右侧信息。

因此问题不是简单把句子切块,而是要在训练阶段就限制可见未来,并在推理阶段用同样的限制生成,同时解决如何在不知道对齐时构造限制、以及信息受限后如何恢复自然度。

S5-TTS 沿一个样本走完输入到输出

拿图左例子走一遍,目标文本是英文短句,参考文本是另一句英文,参考音频提供音色提示。编码器输入是参考文本转写的音素加上目标文本的音素拼接,解码器输入是参考音频对应的编码帧作为提示,随后自回归生成目标语音的编码帧。具体到流式,假设正在合成第二个词,编码器能看到第一个词、第二个词和后面 k 个前视词,解码器只为第二个词生成一段声码块,生成完经声码解码器变成波形块,再与前后块做重叠交叉淡化。

判断何时结束当前词的方法是监测所有头平均交叉注意力权重,每解码一步看最关注的编码位置是否已经滑入前视区,若进入则认为当前词完成。当目标文本最后一个词进入前视窗后,不再监测完成标志,一直解码到出现终止令牌为止。为保证一致,字素到音素转换在生成时也采用同样的前视设置。整个流程的输出仍是逐词的波形块序列,拼接后即为完整语音。

编码器解码器语言建模 × 单调对齐学习: 编码器解码器语言建模负责把音素序列编码为上下文表示并自回归预测有限标量量化语音编码器令牌,单调对齐学习负责约束文本到语音的对应按时间单向前进,二者搭配是因为语音相对文本几乎单调,前者提供生成能力,后者用交叉注意力上的连接时序分类损失抑制幻觉和跳词,组合后模型能在逐词流式时知道当前解码到哪个词。

以下导读针对本次实际收到像素的图 1 左侧与右侧整体结构,先看主路径再看掩码分支,有助于把文字描述对应到模块。

看图路径: 1. 先从左下文本序列沿绿色横条看增量输入如何逐词扩展并区分红色待合成词与下划线前视词;2. 再看左侧流式编码器与流式解码器之间自注意力与交叉注意力的连接方向;3. 最后对照右侧编码器前视因果掩码与解码器前视因果掩码的黄色可见区形状差异

原论文 Figure 1:(Left) The overall architecture of S5-TTS.

论文图 1。原论文 Figure 1:“(Left) The overall architecture of S5-TTS. (Right) Lookahead-Causal Masks and Conv-based Auxiliary Attention.”。

图 1 左侧展示流式编码器在下、流式解码器在上,中间用自注意力和交叉注意力连接,下方绿色横条表示随着输入扩展每次多看到一到两个词,红色标出当前待合成词,下划线标出前视词。右侧上方是带前视因果掩码的解码器交叉注意力对齐热图与基于卷积的辅助注意力流程,右侧下方是编码器前视因果掩码、解码器前视因果掩码和二值化单调对齐 3 个矩阵示意。编码器与解码器掩码都呈现左下黄色可见、右上深色遮挡的阶梯状,说明每个词只能看到有限未来,而二值化对齐呈现对角线,说明文本语音对应保持单调。该图不支持读出具体数值,只能确认信息流动与遮挡逻辑。

两个掩码如何构造,辅助注意力算什么?

编码器掩码作用于所有层自注意力头。设文本有 N 个词,第 n 个词对应编码步集合,用映射函数把每个编码步 t 映射到词序号。带 k 个前视词的编码器掩码规定,第 t 步只能注意属于当前词、所有历史词和未来 k 个词的编码步 t 撇,其余位置遮挡。词到编码步的映射直接从字素到音素转换得到,因为音素切分天然知道每个词占几个音素位置。解码器掩码作用于所有层交叉注意力头。

设解码步 s 对应词序号为 A,掩码规定第 s 步只能交叉关注属于当前词、历史词和未来 k 个词的编码步。这里的难点是 A 需要知道解码步与编码步的对应,而主交叉注意力本身又被掩码约束,不能用来构造掩码。

论文为此训练一个辅助注意力模块,先把解码器嵌入的声码帧序列与编码器嵌入的音素序列分别经 3 乘 3 卷积加激活再经 1 乘 1 卷积投影到公共维度,用缩放负平方欧氏距离算相似度,再在编码步维度做归一化得到注意力权重,取对数后经单调对齐搜索得到二值对齐,进而得到每解码步对应的编码步映射。训练时辅助注意力与主干联合优化,用连接时序分类损失监督。

推理时辅助注意力只用 1 次求参考音频的对齐,生成阶段的对应关系靠记录每个词的完成标志得到,避免每步重算。

前视因果掩码 × 基于卷积的辅助注意力: 前视因果掩码负责在编码器自注意力和解码器交叉注意力中只允许看到当前词、历史词和 k 个未来词,基于卷积的辅助注意力负责在训练前算出解码步到编码步的映射以构造解码器掩码,二者搭配是因为解码器掩码需要事先知道对齐而主交叉注意力本身被掩码约束,辅助分支用卷积投影加欧氏距离独立估计对齐,组合后训练与增量推理的可见上下文保持一致。

完成标志 × 交叉淡化拼接: 完成标志负责在解码过程中判断当前词的声学块是否生成完毕,交叉淡化拼接负责把相邻词的波形块平滑连接,二者搭配是因为逐词生成会产生边界不连续,完成标志通过监测平均交叉注意力权重最大值是否进入前视区来切分,得到声码块后用 2 帧重叠加汉宁窗系数做交叉淡化,组合后实现词级增量输出而不断裂。

初学者容易误以为前视越大越好,论文机制恰好相反。掩码把未来信息截断后,模型被迫把注意力集中在当前词,过多未来反而分散对齐,这解释了后续 k 等于 3 时可懂度下降的现象。辅助分支的卷积不是为了提特征精度,而是提供局部平滑的相似度,使单调搜索更稳定,这是与主变换器点积注意力的分工差异。

分哪两阶段训练,蒸馏的监督从哪来?

训练分预训练与蒸馏 2 个阶段。预训练时 S5-TTS 与全上下文教师都在图书语音与高保真多说话人英文数据集的全量训练集上训练,共约 845 小时、2319 个说话人。模型规模为 4 层编码器加 8 层解码器,每层 8 头,嵌入维度 768,前馈 4096,丢弃率 0.1,总量约 160,000,000 参数。声码器采用预训练的有限标量量化梅尔编码器,8 个码本,22.05 千赫音频每秒约 86.1 个令牌。字素到音素用开源音素器并采用国际音标集,辅助注意力缩放因子设为很小的经验值。

优化用批量 128、250,000 步、预热加余弦衰减的常规语言建模方式,不带参考音频做纯语言建模训练,推理采样用多项式 top-k。蒸馏阶段教师为全上下文模型,学生为预训练好的流式模型。监督来自两类数据,一类是配对语音文本,教师在解码侧做强制下产生软标签,一类是纯文本,教师经自回归采样解码产生软标签,再经语音识别模型过滤只保留词错率为零的样本。纯文本取自对话文本库,合成约 1,300,000 条、约 3827 小时。

训练时在每个梯度累积周期内交错来自两类数据的批量,联合聚合梯度后再更新,称为交错多源蒸馏。蒸馏损失包含解码器隐状态均方误差、解码器词表分布散度与标准交叉熵三项,配对数据用真实声码帧,纯文本数据用教师解码帧。论文未报告梯度是否截断教师侧,但按蒸馏惯例教师冻结,只更新学生,该点原文未明确写出冻结语句,复现时应按冻结教师处理并记录为待核对缺项。

交错多源蒸馏 × 有限前视: 有限前视负责限定推理时每个词只能利用 k 个未来词以降低等待,有限信息会损失韵律自然度,交错多源蒸馏负责让全上下文教师把隐状态和词表分布知识传给流式学生,二者搭配是因为学生结构已受限只能靠监督信号补偿,在每个梯度累积周期内交错来自配对语音文本和纯文本合成数据的批量,组合后学生在不改变延迟的条件下恢复自然度和可懂度。

在什么数据、指标和基线上比较?

评测围绕 3 个问题展开,前视取多大,掩码与蒸馏是否必要,与外部模型比如何。数据集分三块,图书语音未见说话人测试集选 200 条,另一多说话人语料库同样选 200 条未见说话人,以及 200 条未见对话文本用高质量专有女声做参考。指标方向需先明确,可懂度用识别模型的字错率与字符错率,越低越好,说话人相似度用自监督语音嵌入余弦相似度,越高越好,自然度用自动预测分与人工平均意见分,越高越好,效率用实时率、首块延迟和端到端延迟,越低越好。

基线主要是同架构全上下文模型,保证零样本能力可比,外部比较才引入非自回归与自回归代表模型,但外部模型训练数据超 100,000 小时,而蒸馏后学生总计仅约 4670 小时,数据量不在同一量级,只能做参考性对照。人工评测在众包平台找 20 名英语母语者,每模型 50 条按 5 分制打分。效率测试在同一显卡用原生框架运行,为公平让全上下文模型按固定 30 步分块流式解码,接近流式模型在对话集上平均 30.2 步的块长。

端到端延迟把语音模型与 70B 大语言模型经量化部署集成,流式模型收到第 3 个词即开工,全上下文需等整句,这是延迟差异的主要来源。

有限前视能否接近全上下文质量?

先提出比较问题,在相同未见说话人条件下,一到两词前视的流式模型能否在可懂度和相似度上追平全上下文,同时自然度损失多少。公平条件是同一测试条数、同一识别模型算错率、同一嵌入算相似度。下表整理图书语音未见集上的核心数字,指标方向为错率越低越好、预测分越高越好。

条件指标全上下文基线流式两词前视蒸馏后流式两词前视
图书语音未见说话人词错率3.20%3.49%2.65%
图书语音未见说话人自动自然度分3.773.663.72
图书语音未见说话人字符错率2.05%2.12%1.47%
对话文本未见集词错率1.06%0.97%0.83%

表后解释是,一词前视在该集上甚至词错率略优于全上下文,论文解释为有限前视迫使模型聚焦当前词。两词前视自动分高于一词,人工偏好测试也显示两词在约 65.9% 比较中被偏好,因此后续选 k 等于 2。三词前视反而可懂度明显退化,说明过多未来干扰对齐。蒸馏把词错率从 3.49% 降到 2.65%,自动分从 3.66 升到 3.72,支持蒸馏恢复自然度的判断。相似度在蒸馏前后无明显变化,保持在 0.93 以上。

未胜出项是朴素流式模型的人工分明显低于全上下文,说明自动指标接近不等于人耳无差,必须靠蒸馏缩小差距。与外部模型比较时,蒸馏后模型在可懂度和部分自然度上占优,但外部模型数据量大一个量级,且说话人相似度并非全部领先,不能解读为全面超越。

拿掉掩码或换掉蒸馏会发生什么?

消融要回答掩码两部分是否都必要。论文在同一图书语音测试条上报告,只去掉解码器掩码词错率小幅上升,去掉两个掩码词错率大幅升至 14% 以上,只去掉编码器掩码反而升至 40% 以上。机制解释是,只去编码器掩码时编码器按全序列训练而推理缺未来,依赖被打断最严重。两个都去掉时训练推理都把带前视的片段当完整序列,反而一致性稍好,但总体仍差。这支持两个掩码共同维持训练推理一致的结论。

蒸馏消融已在上节数字中体现,交错多源策略同时利用配对与纯文本合成数据,纯文本经识别过滤保证监督可靠。论文未单独报告只用单源的对照,因此不能断言交错相对单源的增量,只能说完整蒸馏相对无蒸馏有效。另一个隐含反证是三词前视的退化,它说明信息条件与对齐精度存在折中,不是单调越多越好。

哪些边界没有测,不能承诺什么?

首先是语言与采样边界,训练评测均为英文朗读与对话文本,未验证中文等多语言、噪声、儿童或老年人语音下的完成标志稳定性,跨语言复述时不应承诺同样延迟与质量。其次是参考音频条件,零样本依赖参考文本与声码提示的质量,若参考转写错误或时长过短,对齐映射可能漂移,论文未量化这种敏感度。

第三是延迟口径,实时率与首块延迟在特定显卡与原生框架下测得,端到端延迟依赖特定大语言模型量化部署与网络环境,换硬件或换解码步长结论会变,不能把 0.3 秒量级的端到端数字当作通用保证。第四是人工评测规模,每模型 50 条、20 人,只能支持方向性判断,0.04 到 0.09 的人工分差距在置信区间内接近,不能解读为无差。最后是蒸馏成本,合成 1,300,000 条需大量教师推理与识别过滤算力,论文未报告具体耗时与误滤率,复现预算时需单独估计。

要复现先做什么,需要哪些配置?

复现应先跑通全上下文教师与声码器,再切流式。第一步准备数据与工具,按原文用图书语音加高保真集做预训练,用对话文本库采样做蒸馏文本,用指定识别模型做过滤,用指定音素器做字素到音素转换,保持国际音标集一致。第二步按 4 层编码器、8 层解码器、768 维、8 头、前馈 4096、丢弃 0.1 搭建 160,000,000 参数模型,声码器用 8 码本预训练模型,采样保持 top-k 为 80、温度 0.85。

第三步训练先做 250,000 步预训练,批量 128、预热 10,000 步至 2 乘 10 的负 4 次方再余弦衰减,蒸馏微调 100,000 步、固定学习率 1 乘 10 的负 4 次方,蒸馏权重按隐状态 10.0、分布 1.0 设置。第四步推理实现词级循环,编码器每次拼接历史加 k 个前视,解码器按完成标志切块,块间留 2 帧重叠做汉宁窗交叉淡化。验证时先检查完成标志是否在最后一个词进入前视窗后停止监测并解码到终止符,再对比一词、两词、三词的错率曲线是否复现两词最优。

若无多卡算力,可直接用公开检查点对比外部模型,但需注明数据量差异。代码与权重是否公开以原文仓库为准,本文不推定可下载。

何时值得尝试这种流式改造?

当系统已是级联大语言模型加语音合成,且瓶颈是大语言模型写完整句的等待时,值得尝试这种两词前视的逐词合成,因为它把开工点从句末提前到第 3 个词,端到端延迟显著下降,而可懂度与相似度可用掩码保持。当追求极致自然度且能容忍整句延迟时,全上下文仍更稳妥,因为朴素流式的人工分有可闻差距,需额外蒸馏成本弥补。当文本语言 highly 依赖长距离 future 决定当前词发音时,有限前视的假设可能不成立,需先补验证再部署。

下表整理人工听感与效率的对照,指标方向为人工分越高越好、延迟越低越好。

评测集指标全上下文蒸馏后流式差距与代价
图书语音未见集人工平均分3.753.71差距 0.04
对话文本未见集人工平均分4.214.12差距 0.09
对话集成端到端延迟等整句更高收三词即合成更低需两词前视条件
独立模型首块延迟与实时率更高更低蒸馏后首块更低

表后解读是,两集人工分差距分别仅 0.04 和 0.09,偏好测试中 k = 2 以 65.9% 被偏好,这为后表把差距与偏好证据并列提供了依据,也说明两词前视是后续效率讨论的前提条件。

证据主题前视取值图书集差距对话集差距偏好占比
偏好测试k = 2——65.9%
蒸馏后人工分差距k = 20.040.09—

表后总结是,蒸馏后流式在两集人工分上仅落后 0.04 和 0.09,报告为接近全上下文,但这不等于超越,且外部大模型数据量远超本方法,不能做同条件胜负断言。代价是需要教师合成与过滤的大量离线算力,以及对完成标志阈值的仔细调参。后续若补实验,应优先补不同硬件下的首块与端到端分布、参考质量敏感度,以及长句中完成标志误切率的统计。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总