英文题目:CTC-TTS: LLM-Based Dual-Streaming Text-to-Speech with CTC Alignment

会议身份:conference:interspeech:2026:conference-paper-id:liu26e_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#自回归模型 #CTC #流式处理 #零样本 #文本到语音

评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Hanwen Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Saierdaer Yusuyin:机构信息未能从会议 PDF 纯文本可靠映射
  • Hao Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhijian Ou:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

双流文本到语音要求在文本逐词到达时同步输出语音,其难点是文本与语音的细粒度对应未知且前视过长会抬高首包延迟。CTC-TTS先用基于联结主义时间分类(Connectionist Temporal Classification,CTC)的语音识别模型求式1最大后验路径,再把空白符归并到后继音素并按帧率比例映射到神经音频编解码器(Neural Audio Codec,NAC)离散语音令牌。随后系统按词切分出当前词加分隔符加下个词的双词音素组,并拼接当前词语音与块结束符构成训练序列,解码器仅对语音部分计算自回归损失。相比固定比例交织,该结构化分块让模型只需学习局部音素群到语音的映射;相比蒙特利尔强制对齐器(Montreal Forced Aligner,MFA),神经对齐免去了多阶段流水线。在960小时LibriSpeech延续任务上长度拼接变体取得词错率4.82%并优于双词与对齐消融基线,在单说话人流式任务上特征堆叠变体取得词错率1.80%并优于LLMVox的2.40%。结论限于英语单码本编解码器与短提示零样本评测,未验证多语、噪声和长上下文外推。原文未披露训练、推理或部署成本,代码已在正文脚注开源。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么要双流?

这篇论文研究的输入是逐步到达的文本,输出是逐步生成的语音。目标是在文本还没有完全给全时就开始发声,同时保持可懂度和自然度。初学者容易把文字转语音理解为等全文到齐再 1 次合成,但在语音助手或同传式场景里,等待全文会带来明显停顿。双流式合成就是为这种场景设计的:文本流进入,语音流输出,两者在时间上重叠。 必须保留的关键信息是文本与语音的对应关系。

英文中一个词对应多个音素,一个音素又对应一段时间的波形。如果模型不知道当前该发哪个词的哪段声音,就会出现漏词、重复或含糊。论文把这种对应称为文本语音对齐,把文本标记和语音标记如何排成训练序列称为序列组织。两个因素共同决定质量与延迟。

双流式合成 × 首包延迟: 双流式合成指文本一边输入、语音一边输出的合成方式,它的分工是让自回归解码器不等全文到齐就开始产生语音;首包延迟的分工是度量从拿到文本到发出第一段可播放语音的时间。两者搭配的原因是交织序列决定了模型最早何时有足够文本上下文,组合意义在于用不同的前视文本量在合成质量与延迟之间做权衡。

举个教学用的例子:假设文本逐词到达,今天天气不错。理想的双流系统在读到今天时就能开始发今天的语音,而不是等到不错才开口。要做到这一点,模型需要知道今天的发音需要哪些音素,以及这些音素对应多长的语音。例子只是帮助理解任务,不代表论文用了这句中文或测过它的延迟。

已有路线如何组织文本与语音序列?

按是否使用对齐信息,可以把相关工作分成两类。第一类是非对齐交织,代表做法是按固定比例把文本标记和语音标记交叉排列。例如每读入若干文本标记就生成若干语音标记,或者把音素嵌入与语音嵌入直接堆叠。这类方法实现简单,不需要外部对齐工具,但固定比例难以反映真实的发音长短变化。论文提到的 IST-LM、CosyVoice2、StreamMel 属于固定比例交织,LLMVox 属于特征维度堆叠。

第二类是对齐交织,即先用强制对齐得到词、子词或音素与语音的对应,再按对应关系组块。SpeakStream 用词级对齐配文本窗口,SyncSpeech 对语音与子词做对齐并按子词生成,ELLA-V 用 MFA 做音素语音对齐并重排序列。论文指出,这类方法虽然学到了更可靠的时序依赖,但多依赖蒙特利尔强制对齐器这类基于高斯混合模型与隐马尔可夫模型的工具链,流程重且不够灵活。 交织设计本身还涉及前视量的权衡。前视多有助于发音自然,但会增加等待。

前视少延迟低,但可能因缺少上下文而含糊。SpeakStream 用文本窗口与语音步长调节,SyncSpeech 引入时长建模,ELLA-V 用全局前置加局部前移。论文选择双词块作为折中:只看当前词加下个词,既给出发音所需的紧凑上下文,又不至于等待过久。

论文要解决的两个具体困难是什么?

第一个困难是重型对齐流水线。MFA 需要发音词典、声学模型训练与多步处理,对新数据或新语言不够灵活。论文希望用神经网络的 CTC 声学模型直接给出后验,再经维特比算法得到路径,避免训练完整的强制对齐工具链。这里的关键判断是双流建模不需要帧精确的音素边界,只需要稳定的结构对应,足以把局部音素组映射到语音标记。 第二个困难是固定比例交织学不到对齐规律。

不同音素的实际时长差异很大,固定切分会把不相关的文本与语音硬拼在一起,增加自回归模型的学习负担。论文希望按词的真实对应组块,让每个训练块内部的文本与语音在内容上相关。这样模型每一步要解决的是给定当前词与下个词的音素,生成当前词语音的问题,而不是在无规律的混合序列中猜测位置。

CTC-TTS 全景:一个样本如何走完输入到输出?

先沿一个训练样本走一遍。假设有一段英文语音及其转写文本。文本经字音转换变为国际音标音素序列,语音经神经音频编解码器编码器变为离散语音标记序列,同时经 CTC 声学模型变为帧级音素后验。对齐与交织模块把音素序列与语音标记序列按词对齐并切成双词块,解码器语言模型在交织序列上做自回归预测,最后编解码器解码器把预测的语音标记还原为波形。零样本合成时还会加入提示语音及其文本作为条件,单说话人设置则不需要提示。 下面这张总览图把上述路径画了出来,重点看底部 3 个冻结模块如何汇入中间可训练的解码器,以及顶部解码器如何流式输出。

看图路径: 1. 沿底部三个冻结模块向上看提示语音、提示文本如何变为对齐交织后的提示标记;2. 跟踪中间黄色解码器条带上方逐个生成的语音标记与块结束符虚线回路;3. 确认顶部神经音频编解码器解码器如何接住生成的标记并做分块流式输出;4. 区分图中可训练参数与冻结参数的图例标注位置

原论文 Figure 2:Overview of CTC-TTS-L. Components include: (1) a G2P model that converts text to phonemes; (2) a…

论文图 2。原论文 Figure 2:“Overview of CTC-TTS-L. Components include: (1) a G2P model that converts text to phonemes; (2) a CTC-based ASR model for speech–phoneme alignment; (3) a decoder-only LM that…”。

从像素可见,底部从左到右是 CTC 模型、字音转换、编解码器编码器,分别吃提示语音、提示文本、提示语音,向上汇入对齐与交织方框,再形成提示标记与目标标记。中间黄色长条是解码器,向上逐个输出语音标记与块结束符,向下有虚线回路表示已生成标记作为下一步输入。顶部是编解码器解码器,箭头指向分块感知流式输出与个性化语音波形。图例区分了块结束符、单字音素组、语音标记、词分隔符以及可训练与冻结参数。论文明确 CTC-TTS-F 共用同样组件,只是交织方式不同,图中未重复画出。

对齐与交织如何计算?两个变体差在哪里?

对齐部分从 CTC 后验出发。CTC 声学模型在每帧输出音素加空白符号上的概率分布,维特比算法选出概率最大的帧级路径。路径中同一音素可能连续重复,空白可能出现在音素之间或对应静音。论文不直接用该路径的边界,而是做一步修正:每个空白标号归给其后第一个音素,若路径尾部全是空白则归给最后一个音素,得到修正路径。实验中 CTC 模型每秒输出 25 帧,编解码器每秒输出 75 个语音标记,因此长度比为 1 比 3,每个修正路径上的音素对应 3 个语音标记。论文强调这不是帧精确边界,而是足够组词级块的结构对齐。

CTC 对齐 × MFA 强制对齐: CTC 对齐的分工是用 CTC 声学模型的帧级后验经维特比算法得到音素路径,再把空白标号归给后继音素,形成稳定的结构对应;MFA 强制对齐的分工是用 GMM-HMM 工具链给出更精细的音素边界。搭配理由是双词块只需要词级音素到语音的对应,不需要帧精确边界,组合意义在于省去重型流水线,同时保留足够模型学习局部音素组到语音标记映射的结构信息。

组块时先按词切分。每个双词块包含当前词的音素、词间分隔符、下个词的音素,再跟当前词对应的语音标记,最后以块结束符收尾。分隔符包括空格、逗号、句号、问号和感叹号。最后一个词没有下个词,用句子结束符占位。把所有块串起来就是一条完整训练序列。

损失只在语音标记与块结束符位置计算交叉熵,文本音素位置不计损失。 两个变体的差别在如何放文本与语音。长度拼接变体把文本标记与语音标记沿序列长度方向串接,生成质量更好,但必须读完前两个词的音素才开始生成当前词语音,首包延迟较高。特征堆叠变体把音素序列补齐到与语音序列等长,再沿特征维度把两者嵌入叠加,第一个音素与全零张量叠加即可开始生成,因此延迟更低。

初始化时首块第一个音素与块结束符都与全零张量叠加,推理时每生成一个语音标记就与下一个音素或补齐符叠加送回模型。

双词块 × 长度拼接: 双词块的分工是把当前词音素加分隔符加下个词音素作为前视文本,再跟当前词对应的语音标记并以块结束符收尾;长度拼接的分工是把文本标记和语音标记沿序列长度方向直接串接。搭配原因是当前词发音依赖上下文,下个词提供紧凑前视,组合意义是让模型在每个块内看到局部对齐规律,更容易学到时序依赖。

特征堆叠 × 神经音频编解码器: 特征堆叠的分工是把音素嵌入与语音嵌入沿特征维度叠加,使每个时间步同时携带文本与语音信息;神经音频编解码器的分工是把连续波形变为离散语音标记序列并能解码回波形。搭配原因是单码本编解码器使每步只需预测一个语音标记,组合意义是模型读到第一个音素即可开始产生语音,从而降低首包延迟。

下图把一个双词块的两种摆法并排给出,是理解延迟差异最直接的材料。

看图路径: 1. 先看上面一行长度拼接块中当前词音素、分隔符、下个词音素、当前词语音与块结束符的左右顺序;2. 再看下面一行特征堆叠块中每列上下两个嵌入如何配对,注意首列零张量与尾列块结束符的配对;3. 对照右侧图例确认实线框表示标记、虚线框表示嵌入以及各颜色的含义;4. 比较两种方案在开始产生语音前需要先读入多少个音素

原论文 Figure 1:One bi-word block in the two text–speech interleaving schemes: (a) CTC-TTS-L and (b) CTC-TTS-F.

论文图 1。原论文 Figure 1:“One bi-word block in the two text–speech interleaving schemes: (a) CTC-TTS-L and (b) CTC-TTS-F.”。

从像素可见,上半部分长度拼接按从左到右依次是当前词音素、分隔符、下个词音素、当前词语音、块结束符。下半部分特征堆叠是上下两排配对,下排为音素、分隔符与补齐符,上排为语音与零张量,首列音素配零张量,尾列块结束符配零张量。右侧图例说明了标记与嵌入的框线区别以及各颜色含义。解释是:长度拼接保留了完整的文本前缀,模型能看到两个词的全部音素,质量占优;特征堆叠把文本信息压缩到每步输入的特征维度,序列更短、启动更快,但每步文本视野受限。

训练如何组织,哪些参数更新?

论文训练的是单个自回归变换器,因为采用单码本编解码器,每步只需预测一个语音标记加块结束符。多说话人实验用 12 层解码器、16 个注意力头、1024 维嵌入、4096 维前馈、0.3 丢弃率;特征堆叠变体的文本与语音嵌入维度分别为 256 和 768。单说话人实验改为 4 层解码器、12 个注意力头、768 维嵌入、3072 维前馈、0 丢弃率,文本嵌入 256 维、语音嵌入 512 维。所有模型在 4 张 RTX 3090 上训练,总批量 32,用 AdamW 优化器,余弦学习率调度预热到万分之三,多说话人训练 320,000 步,单说话人训练 1,000,000 步,权重衰减 0.1,并用闪速注意力加速、推理用键值缓存。

关于冻结与更新,论文在总览图中标明字音转换、CTC 模型、编解码器编码器与解码器参数冻结,只有解码器变换器参与训练。监督来源是交织序列中的语音标记与块结束符,文本位置不产生损失。论文未报告梯度是否流向对齐模块或编解码器,也未给出重置时机的细节,因此只能说训练目标是最小化上述位置的交叉熵,不能推定对齐边界会随 TTS 训练而更新。 推理时长度拼接变体读入当前词与下个词音素后开始生成,直到发出块结束符结束当前块。

特征堆叠变体从第一个音素开始逐个生成,每步把新语音标记与下一个音素叠加送回,块结束符与零叠加后进入下一词。零样本时提示的语音与文本先做同样的对齐交织作为条件,且通常可复用。

实验在什么数据、模型与指标下比较?

预训练组件按原文交代:CTC 模型是用 LibriSpeech 训练的单语 Whistle,115M 参数,基于卷积增强变换器的弱音素监督声学模型;字音转换用基于加权有限状态机的 Phonetisaurus,把英文转为国际音标;编解码器用单码本 WavTokenizer;对齐用 Torchaudio 中的强制对齐函数,输入 CTC 后验并实现维特比算法。资源状态方面,论文正文脚注给出代码链接,但本次未收到可验证的 HTTPS 可达证据,因此不能写代码已公开或当前可用,只能说论文声明了仓库地址。

单说话人流式实验用 VoiceAssistant400K 单说话人数据集,1750 小时训练、50 小时验证、5 小时测试,并过滤掉字音转换无法转写的句子,对手是复现的 LLMVox,采用同样的分块感知流式输出。解码用贪心搜索。多说话人零样本实验在 960 小时 LibriSpeech 上训练,延续任务用 test-clean 中 4 到 10 秒的句子,跨说话人任务用 Seed-TTS 的 test-en,对手包括复现的 ELLA-V 局部前移设置,以及为消融构造的 CTC 加 ELLA-V、MFA 加 ELLA-V、MFA 加双词序列,多说话人生成用核采样以更稳定。 指标方面,可懂度用词错误率与字错误率,方向越低越好,单说话人与多说话人分别用 whisper-large-v3 与 Conformer-Transducer 作为识别模型。

自然度用 UTMOS,方向越高越好;单说话人还报告首包延迟,假设全文可得,方向越低越好;说话人相似度用 WavLM-Base-Plus-SV 嵌入计算,方向越高越好。主观评测用自然度平均意见分与相似度平均意见分,30 条样本、20 名听众、1 到 5 分,给出均值与 95% 置信区间。

单说话人流式合成:质量与延迟各付出什么?

要回答的问题是,在相同单说话人数据与流式输出范式下,CTC 对齐加双词序列是否比固定比例交织更好,以及两个变体如何在质量与延迟之间取舍。比较条件是同一数据集、同一编解码器家族与贪心解码,指标方向为词错误率与字错误率越低越好,首包延迟越低越好,自然度越高越好。

条件指标LLMVoxCTC-TTS-FCTC-TTS-L
单说话人流式参数量31.5M33.6M34.7M
单说话人流式词错误率%2.401.801.50
单说话人流式字错误率%1.361.040.79
单说话人流式首包延迟167159210
单说话人流式UTMOS4.154.154.15

论文报告显示,特征堆叠变体在词错误率与字错误率上低于 LLMVox 且首包延迟更短,支持 CTC 对齐与双词序列带来了收益。长度拼接变体进一步降低两项错误率,但首包延迟升至最高,说明更高质量是以等待前两个词为代价。三者 UTMOS 同为 4.15,论文解释该指标更侧重自然度而非内容正确性,因此不能用它证明内容层面无差异。

未胜出项是长度拼接变体的延迟,它是三者中最差的,复现时若目标是低延迟应优先考虑特征堆叠变体。

零样本延续任务:在域内条件下谁更可懂?

延续任务给 3 秒前缀语音与对应文本,要求合成剩余文本,考查域内条件下的可懂度、相似度与主客观质量。比较对象包括两个本方法变体与 3 种消融组合,训练数据与主干相同,区别只在对齐来源与序列组织,指标方向与上一节一致。

条件指标CTC-TTS-FCTC-TTS-LCTC+ELLA-VMFA+ELLA-VMFA+ 双词
延续词错误率%5.204.8212.0110.985.14
延续字错误率%2.682.477.376.992.63
延续相似度0.9300.9290.9280.9280.930
延续UTMOS4.0134.0504.0214.0214.010
延续自然度主观分4.31 ± 0.0574.33 ± 0.0614.00 ± 0.0623.94 ± 0.0664.25 ± 0.061

论文报告显示,使用双词序列的方法明显优于使用 ELLA-V 序列的方法,长度拼接变体在除相似度外的多数指标上优于 MFA 加双词,支持 CTC 对齐的优势。

特征堆叠变体与 MFA 加双词接近,但两者一个是特征堆叠、一个是长度拼接,不可直接对比对齐方式。未胜出项是相似度,MFA 加双词与特征堆叠变体同为 0.930,略高于长度拼接变体的 0.929,说明可懂度最优不等于说话人相似度最优。论文还指出 ELLA-V 局部前移提供的上下文有限,可能是其表现较差的原因之一,这属于有限解释而非因果证明。

跨说话人与消融:换对齐或换序列会发生什么?

跨说话人任务用约 3 秒异域语音与文本做提示,合成另一句话,属于域外测试,整体分数比延续任务差,但趋势可用于检验泛化。比较条件与上一节相同,区别是测试集换为 Seed-TTS 英文集。

条件指标CTC-TTS-FCTC-TTS-LCTC+ELLA-VMFA+ELLA-VMFA+ 双词
跨说话人词错误率%8.026.3320.8634.897.53
跨说话人字错误率%4.203.2111.7319.583.99
跨说话人相似度0.8800.8780.8690.8720.874
跨说话人UTMOS3.9033.9713.8483.8733.840
跨说话人自然度主观分4.16 ± 0.0644.23 ± 0.0603.88 ± 0.0733.75 ± 0.0714.14 ± 0.068

论文报告显示,长度拼接变体在可懂度与主客观自然度上保持最优,支持 CTC 对齐加双词序列在域外仍有效。

关键反证是 ELLA-V 序列的两行在跨说话人下词错误率超过 20%,说明序列组织不当会严重损害泛化。另一个细节是 CTC 加 ELLA-V 优于 MFA 加 ELLA-V,而在域内延续任务中顺序相反,论文据此推测 MFA 在域内延续上拟合较好、CTC 泛化更好,这属于可能成立的解释,待更多域外验证。未胜出项是特征堆叠变体在跨说话人下略逊于 MFA 加双词,但如前所述两者堆叠维度不同,不能单独归因于对齐方式。

哪些结论还不能下,边界在哪里?

首先是对齐精度的边界。论文明确 CTC 对齐不追求帧精确边界,只提供足够组块的结构对应,因此不能把它当作通用强制对齐工具来评价边界误差。未来工作提到用神经字音转换与神经强制对齐获得更精确边界,说明当前精度仍有提升空间。 其次是延迟与成本的测量边界。论文只在单说话人实验报告了假设全文可得的首包延迟,未报告流式增量延迟、实时率、显存占用或长句稳定性,也未测量误判率随文本到达节奏的变化。

因此不能承诺在任意网络或设备上都能达到相同延迟,只能说在给定实验条件下特征堆叠变体启动更快。 最后是主观与客观指标的适用边界。UTMOS 在三者间持平但词错误率差异明显,说明自然度指标不能替代可懂度。相似度最优与词错误率最优分属不同方法,选型时需按任务目标取舍。论文未做统计显著性检验,主观分置信区间部分重叠,解读微小差距时应谨慎。

要复现应先准备什么,按什么顺序检查?

先准备数据与预训练模型。单说话人用 VoiceAssistant400K 并过滤不可转写句,多说话人用 960 小时 LibriSpeech。需要单语 Whistle 声学模型、Phonetisaurus 字音转换、单码本 WavTokenizer 编解码器,以及 Torchaudio 的强制对齐函数。关键超参数包括解码器层数与维度、丢弃率、批量 32、AdamW 参数、余弦调度预热步数与总步数,单说话人与多说话人配置不同,照抄时不要混用。 再检查对齐映射。

确认 CTC 每秒 25 帧、编解码器每秒 75 帧的 1 比 3 关系,空白归后继音素、尾部空白归末音素的逻辑,以及分隔符集合与末词句子结束符占位。若映射写错,双词块内的语音长度会对不上。 然后检查交织与损失。长度拼接变体按当前词音素加分隔符加下个词音素加当前词语音加块结束符组块,损失只算语音与块结束符位置。特征堆叠变体需把音素补齐到等长再沿特征维叠加,首音素与块结束符与全零张量配对。

推理时长度拼接变体需等待两个词,特征堆叠变体从首音素即生成,解码到块结束符切换下一块。评估时单说话人用贪心搜索与 whisper-large-v3,多说话人用核采样与 Conformer-Transducer,主观评测需固定样本数与听众数。

何时值得尝试这种做法?

当已有双流需求且不想引入 MFA 重型流水线时,值得尝试 CTC 后验加简单空白归并的轻量对齐。它的前提是有可用的 CTC 音素声学模型与可靠的字音转换,且能接受词级而非帧级的对应精度。如果任务要求精确到帧的韵律控制,还需补充验证。 当固定比例交织出现漏词或含糊,且怀疑是文本语音错位导致时,值得尝试双词块。它的代价是需要先算好对齐再组块,训练序列变长,长度拼接变体还会增加首包延迟。

若延迟预算极紧,可先试特征堆叠变体;若质量优先且能等待两个词,可试长度拼接变体。 复述方法的最小闭环是:文本变音素,语音变后验与离散标记,维特比加空白归并得对应,按 1 比 3 映射到语音标记,按双词组块并选长度或特征方式交织,只在语音与块结束符上训练自回归模型,推理按块生成并用编解码器分块解码。记住论文直接报告的是错误率与主观分上的优势,有限解释是上下文与泛化差异,CTC 泛化更好的说法仍是待验证的推测。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总