英文题目:Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input

会议身份:conference:interspeech:2026:conference-paper-id:liu26i_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#弱监督学习 #高效推理 #韵律 #流式处理 #文本到语音

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Changsong Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Tianrui Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Ye Ni:机构信息未能从会议 PDF 纯文本可靠映射
  • Yizhou Peng:机构信息未能从会议 PDF 纯文本可靠映射
  • Eng Siong Chng:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

增量文本输入的流式文本到语音需在文本未到齐时即时发声,输出为连续语音流,难点是缺失未来文本导致韵律不自然与无界历史引发语义漂移和崩溃。先进行弱对齐边界训练,输入为完整文本语音对与WhisperX词级时间戳,职责是在随机词边界后插入markerboundary并按对齐音频位置截断语音目标,输出为学会见标记即停的语言模型。再进行带前视的块内规划,输入为当前块文本、2词未来前视与边界标记拼接序列,职责是利用有限未来上下文规划韵律并生成当前块文本语音词元,其输出的文本与语音直接作为下一步提示素材。最后进行滑动窗口延续与合成,输入为以上一块生成文本语音尾部替换提示后的新块序列,职责是以有界O(k+f)键值缓存延续生成并经流式声码器增量合成,输出为无缝拼接的波形。相对交织基线与朴素滑动窗口基线,该机制以显式边界标记加有限前视替代无界交织或仅依赖历史,在有界上下文中兼顾韵律与稳定。在Seed-TTS-Eval标准集评测下,Boundary-Aware方法的WER为4.03%,低于Sliding-Window基线的WER 6.03%。适用边界为英文朗读型短句与扩写独白,未验证真实对话增量到达、多语言、多基座与自适应边界,原文未披露训练与部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,输出是什么,哪些信息不能丢?

这篇论文研究的输入是不断到达的流式文本,输出是实时播放的语音。目标场景是对话系统和语音到语音翻译这类需要边听边说的交互系统。输入不是 1 次性给整篇文章,而是以词为单位逐渐累积;输出也不是等全部合成完再放,而是每凑够一小块文本就要尽快发出第一段可听音频。

必须保留的信息有 3 类。第一是历史文本与已生成语音,用来保持连贯和音色一致;第二是有限未来文本,用来预测重音、停顿和语调,也就是论文说的韵律特征;第三是说话人提示,用来做零样本声音克隆。论文强调,推理延迟可以靠模型优化或因果结构降低,但要做到超低延迟就必须把文本累积窗口压得很小,这时感受野受限会直接导致韵律不自然,这是第一个核心挑战。

第二个核心挑战是长文性能崩溃。现代大语言模型语音合成越来越多采用文本和语音词元交叉建模,例如固定数量交织或并行排列。在长期连续输入下,一个文本词元对应的语音长度变化很大,文本与其对应语音词元之间的距离逐渐拉大,最终导致生成失败,难以支持长期流式交互。

流式文本输入 × 大语言模型语音合成: 流式文本输入负责文本一边到达一边要求出声,决定了系统不能等整句到齐;大语言模型语音合成负责把文本词元和语音词元放在同一个自回归序列里建模,决定了历史越长键值缓存越大。二者搭配的原因是交互式对话需要低延迟连续出声,组合意义是必须在文本还没到齐时就让语言模型开始声学规划,同时防止跨模态历史无限增长。

举个教学例子:假设用户一句话一句话往外说,系统每收到 5 个词就要出声。如果等整段到齐再合成,延迟太高;如果每个词一到就硬读,就会把本该上扬的疑问语调读平成陈述,还会把长段落读到后面走音。论文的方法就是要在只多看 2 个未来词的前提下,既读准停顿,又不让历史无限堆积。

同输入同目标的已有路线卡在哪里?

按同输入、同目标、同运行阶段对照,已有路线可分三支。第一支是局部上下文建模的增量语音合成,试图用局部上下文解决缺少前视的问题,但通常需要对注意力机制做复杂因果改造,并依赖精确的文本语音强制对齐。第二支是固定比例交织的流式大模型语音合成,以 CosyVoice 系列和 Qwen3-TTS 流式版为代表,它们把固定数量文本和语音词元交织或并行排列,在短句上质量很好,但在长时连续输入下距离拉大导致失败。第三支是 SpeakStream,用字符级对齐加历史截断缓解该问题,但重度依赖精确对齐标注。

论文的对照策略是:不改架构,只做后训练适配,且只用弱时间对齐的开源数据。也就是说,输入仍是流式文本,目标仍是实时流式语音,监督只是用现成工具估计的词级时间戳,运行阶段仍是自回归语言模型加流匹配加声码器。这种定位把工作量集中在如何让预训练模型学会提前停下和利用有限前视,而不是重新设计注意力或重新标注精确边界。

论文把问题拆成哪两个可验证的问法?

论文把困难拆成两个可测问题。第一,缺少前视时韵律是否还能自然。验证方法是固定每块只给当前块加有限未来词,看词错误率、说话人相似度和情感相似度是否稳定,以及听感上块与块之间是否有断裂。第二,无界上下文是否必然导致长文崩溃。验证方法是构造 280 到 320 词的连贯长段落,看交织基线的键值缓存随生成增长时是否出现语义漂移、幻觉、乱码语音和提前终止伴随大量删除错误。

论文明确提出的研究问题是:能否仅用弱时间对齐数据、不做架构修改,就在流式文本输入的大语言模型语音合成中实现鲁棒的长文流式。这是一个可复述的判断标准:如果只改训练数据构造和推理提示方式,长文词错误率和说话人一致性能否同时稳住,同时首包音频延迟不恶化。

方法全景:一个样本如何走完输入到输出?

先沿一个样本走完全程。假设当前块是 5 个词,另有 2 个未来词。推理输入被构造成当前段、边界标记、未来段 3 段拼接。第一块还额外带一条参考音频和对应文本做零样本声音克隆;从第二块起,提示被替换为上一块刚生成的文本和语音尾部。

语言模型只生成当前块对应的语音词元,然后交给流式声码器增量转波形,块与块直接拼接。键值缓存因此被限制在当前块加前视的量级,不随总长度增长。

训练阶段做对应的适配。给定一条完整 utterance 的文本词元、语音词元和词级边界,训练以 0.15 概率保留完整 utterance 以维持全局连贯,否则随机选一个词位置插入边界标记,并把目标语音截断到该词音频结束时间对应的帧数。模型被微调去预测截断后的语音流,从而把标记理解为分段线索和韵律锚点。

下面这张图是全流程的总装图,左上是带截断的微调,右上是无限文本如何切窗,下方是两块推理如何用上一块尾部做提示并分块出波形。读图时注意区分圆圈文本词元、方块语音词元、紫色边界标记和绿色前视文本。

看图路径: 1. 先看左上微调面板:下方输入含边界标记,上方输出在标记后被截断删除,确认只学标记前语音;2. 再看右上滑动文本窗:无限输入如何被切成等长且重叠的蓝线窗口;3. 最后沿下方两块推理箭头走:第一块的蓝色语音尾如何作为第二块提示,并经橙色箭头分块转波形

原论文 Figure 1:The proposed fine-tuning and inference pipeline for prosodic boundary-aware streaming LLM-based…

论文图 1。原论文 Figure 1:“The proposed fine-tuning and inference pipeline for prosodic boundary-aware streaming LLM-based TTS generation.”。

从像素看,左上紫色长条是文本语音语言模型,下方输入行里有一个紫色圆点即边界标记,上方输出行在标记之后有一条红色斜线划掉的方块,表示被删除的语音词元,只保留标记前。右上两行圆圈分别是无限文本输入和切出的文本窗,蓝色横线表示窗口重叠滑动。

下方左右两个紫色模型块分别标注第一窗推理和第二窗推理,输入行下方的蓝色横线是文本窗,输出行上方虚线框是对应语音,黑色虚线箭头把第一块的文本窗和语音尾指向第二块的提示位置,橙色上箭头表示分块词元到波形。右侧图例明确了圆圈颜色代表不同词的文本,方块颜色代表对应语音,绿色圆圈是前视文本,黄色上下三角是序列起止。

边界标记和前视窗口各自做什么?

韵律边界感知标记是全文的关键组件。白话说,它是一个插在文本序列里的软边界符号。声学上,它告诉模型只合成标记之前的部分;韵律上,它允许模型看到标记之后有限个词,用来规划停顿和语调,但不为未来词发声。推理时每隔固定词数插入 1 次,既获得有限未来上下文,又防止生成上下文无界。

前视窗口是配合标记的第二个组件。白话说,就是多看后面几个词,但只看不读。论文默认每块当前 5 词、前视 2 词。当前段决定发什么音,前视段决定用什么韵律发。前视太小则语义接地不足,太大且相对当前块占优则会干扰当前段,消融中在块 10 词、前视从 2 加到 6 时长文词错误率从 3.03% 升到 12.98%,支持了适度前视的判断。

韵律边界标记 × 前视文本: 韵律边界标记负责把输入切成声学生成段和更宽的韵律规划段,告诉模型只合成标记之前的声音;前视文本负责提供标记之后有限个未来词的重音、停顿和语调线索。二者搭配的原因是自然韵律既需要分段又需要看后文,组合意义是模型学会在标记处提前停下,同时利用有限未来上下文做韵律规划而不被未来牵着无限生成。

滑动窗口提示如何保证拼接不断?

滑动窗口提示解决块间连续性。白话说,下一块不再回看全部历史和最初参考,而是只看上一块刚生成的文本和语音。这样做有两个好处:一是提示音频尾部带有上一块的音色、语速和尾韵,模型可以接着往下说;二是历史长度被截断,计算量和缓存不再累积。论文把有效上下文长度记为与块大小加前视同阶,与总序列长度无关。

需要区分的是,朴素滑动窗口基线也用上一块做提示,但不用边界标记和前视,只靠过去历史生成。论文报告它在长文上说话人相似度从 0.57 掉到 0.22,情感相似度掉到 0.857,听感上块间韵律不连续,说明光有历史不够,还需要标记来明确句子边界和前视来预测边界。这正是边界感知滑动与朴素滑动的差别。

滑动窗口提示 × 有界上下文: 滑动窗口提示负责把上一块已生成的文本和语音尾部作为下一块的提示,维持音色和衔接;有界上下文负责把每步键值缓存限制在当前块加前视的量级,不随总长度增长。二者搭配的原因是长时连续输入下固定交织比例会让文本与对应语音距离越拉越远,组合意义是每块只背有限历史,既保证拼接连贯又避免延迟增长和长文幻觉。

训练数据、截断计算和冻结了什么?

训练数据是 CommonVoice 13.0 中抽样的英文子集,约 930,000 条、约 1000 小时。为保证零样本评测完整性,移除了与 Seed-TTS-Eval 测试集重叠的训练 utterance。训练前预先抽取语音词元、梅尔频谱图、文本词元和说话人嵌入,词级时间戳用 WhisperX 获得,用来近似候选韵律边界,无需人工标注。语音分词器帧率为每秒 25 帧,最小截断长度为 5 帧,完整 utterance 保留概率为 0.15。

构造过程可复述为 3 步。第一,对每条 utterance 拿到文本词元序列、语音词元序列和每个词映射到的文本区间与音频结束时间。第二,以 0.15 概率保留完整样本,否则随机采样一个词序号,在其文本结束位置后插入边界标记。第三,按该词音频结束时间乘以帧率再与最小长度取大,得到截断目标长度,只让语言模型预测截断后的语音流。符号上,输入是截断点前文本加标记加剩余文本,目标是截断后语音,监督来源是弱对齐时间戳而非人工韵律标注。

参数更新范围按原文交代:只微调基于 Qwen 的大语言模型部分,流匹配模块和预训练 HiFi-GAN 声码器保持冻结。原文未报告优化器类型、学习率、步数和梯度路径细节,这些是复现时的缺项,不能从模型名称推定。推理时声码策略区分清楚:交织基线和所提方法用流式声码增量出波形,滑动窗口基线用离线批量声码合成每块,这直接影响实时率的可比性。

弱时间对齐监督 × 动态边界插入: 弱时间对齐监督负责用现成对齐器 WhisperX 给出词级音频结束时间,近似候选韵律边界而不需人工标注;动态边界插入负责训练时随机选一个词位置插入标记并把目标语音截断到该词对应的帧数。二者搭配的原因是只有粗对齐可用,组合意义是让模型在大量随机截断样本上学会把标记理解为分段线索和韵律锚点,只对齐标记前的内容。

评测条件:数据、基线、指标和硬件是什么?

评测分两档。标准档用 Seed-TTS-Eval 短读句加参考提示,测句子级流式合成。长文档用 DeepSeek-V3 把每条 Seed-TTS-Eval 句子扩展成 280 到 320 词的连贯段落,并保留原句作为开头,测长时独白的韵律一致性和稳定性。所有系统固定块大小为 5 词,所提方法前视为 2 词。

基线有两条可运行策略。交织基线用 CosyVoice2 原生流式实现,文本与语音按 5 比 15 交织在同一序列,键值缓存随生成增长,用流式声码,用原始预训练权重而不做边界感知适配。滑动窗口基线是简化实现,每块以前一块生成词元为条件,不用边界标记和前视,用离线批量声码。所提边界感知方法结合滑动延续、边界标记和 2 词前视,用流式声码。

指标分效率和质量。效率用首音频延迟和实时率,实时率小于 1 表示可实时。延迟在单张 48 显存的 A40 上测,每条在 2 次热身后平均 50 次,以避开硬件热身效应。质量沿用 Seed-TTS-Eval 协议:语言准确性用 Parakeet-TDT-0.6B-v2 转录测词错误率,该模型支持超 30 秒长文转录;声学保真用 WavLM-Large 余弦相似度测说话人相似度,用 emotion2vec 加测情感相似度;主观由 20 名评测者在 5 分制上打可懂度、说话人相似度和情感相似度,相似度需对照参考提示,给出均值和用 t 检验算的 95% 置信区间。

本次未能确认该转录模型链接当前可达。资源状态为暂时不可达,依据要求必须写本次未能确认可达,不能写已公开可用。论文引用地址为公开的模型仓库,但本解读不将其作为可用性断言。

延迟和客观质量:谁快,谁准,谁稳?

先看效率问题:在相同流式出声条件下,谁的首音频更快,实时率是否小于 1。公平条件是块 5 词、所提方法前视 2 词,延迟都在同一 A40 上热身后平均。指标方向是首音频延迟越低越好,实时率越低表示单位音频耗时越少且小于 1 为实时。

条件指标交织基线滑动窗口基线所提方法
块 5 词,前视 2 词实时率0.8430.7180.782

所提方法首音频延迟最低,为 1296 毫秒,优于交织基线和滑动窗口基线,论文将其归因于边界感知提示能更早发射音频。在实时率上,滑动窗口基线数值最低为 0.718,但它用的是离线批量声码,吞吐高却不支持增量发射,因此不能直接说它流式更快。在都用流式声码的系统之间,所提方法 0.782 优于交织基线 0.843,支持有界上下文提升计算效率、防止无界键值缓存增长的判断。代价是前视 2 词本身带来文本等待,首音频仍在 1.3 秒量级。

再看质量问题:在短句和长文下,语言准确性和音色情感一致性如何。公平条件同上,指标方向是词错误率越低越好,两个相似度越高越好。

条件指标交织基线滑动窗口基线所提方法
标准短句词错误率7.48%6.03%4.03%
长文 280-320 词词错误率70.97%7.83%4.77%
标准短句说话人相似度0.530.570.64
长文 280-320 词说话人相似度0.560.220.65
标准短句情感相似度0.8990.9120.918
长文 280-320 词情感相似度0.8990.8570.912

主要收益是长文稳定性。交织基线长文词错误率升到 70.97%,论文描述为灾难性失败,伴随语义漂移、幻觉、乱码语音和提前终止的大量删除错误。滑动窗口基线词错误率稳定在 7.83%,但说话人相似度从 0.57 掉到 0.22,情感也掉到 0.857,说明没有边界和前视就判不准句子边界,出现韵律漂移。所提方法长文保持 4.77%、0.65、0.912,短句也是最优。未胜出项要明确:交织基线在长文情感相似度上仍报 0.899,但其词错误率已崩,说明该相似度是在严重缺字乱码下算的,不能当成音色保持好的证据。

交织基线 × 滑动窗口基线: 交织基线负责按固定比例把文本和语音词元交错在一个序列里生成,代表原生流式实现;滑动窗口基线负责每块只以前一块生成结果为提示,不用边界标记和前视,代表朴素截断历史方案。前者分工暴露无界缓存的语义漂移,后者分工暴露无前视的韵律漂移,二者搭配比较才能说明边界标记加前视同时解决了幻觉和说话人漂移两类失败。

块大小和前视怎么 trade?主观听感支持吗?

消融按块大小 1 到 10、前视 1 到 6 且前视不超过块大小的网格展开,每档在标准和长文各抽 50 条。测什么很清楚:语言保真对初始上下文是否敏感,前视过大是否反噬。

报告显示,块 1 词、前视 1 词时语义接地不足,标准和长文词错误率峰值分别为 33.27% 和 23.77%。块增大到 3 以上,标准档词错误率迅速降到 5% 以下,长文也有类似趋势,说明较小语义锚就足以稳住生成。说话人和情感一致性更鲁棒但仍受益于适度上下文,说话人相似度从最小上下文约 0.50 升到块不小于 5 时的 0.65 以上,情感相似度在各配置保持 0.90 以上。反例是块 10 词时前视从 2 加到 6,长文词错误率从 3.03% 升到 12.98%,支持过强未来条件在主导当前段时会破坏稳定的判断。

主观听感与客观一致,但更突出断裂感。比较问题是:在同样参考提示下,哪种更像同一个人连贯说完。

条件指标交织基线滑动窗口基线所提方法
标准短句可懂度3.99 ± 0.163.43 ± 0.204.28 ± 0.14
长文可懂度3.18 ± 0.231.60 ± 0.184.13 ± 0.13
标准加长文说话人相似度4.05 ± 0.15, 3.24 ± 0.223.18 ± 0.20, 1.68 ± 0.184.25 ± 0.13, 4.24 ± 0.13
标准加长文情感相似度4.03 ± 0.15, 3.21 ± 0.183.25 ± 0.18, 1.67 ± 0.174.38 ± 0.12, 4.19 ± 0.13

表后解释是:交织基线标准档可懂度尚可,长文掉到 3.18;滑动窗口基线长文掉到 1.60,听者频繁听到段间韵律不连续;所提方法长文仍保持 4.13 可懂度、4.24 说话人相似度和 4.19 情感一致性。代价是主观只有 20 人、置信区间仍有 0.1 以上宽度,不能把小数点后第二位当成确定胜负。

哪些还没测,哪些不能承诺?

论文直接报告的局限首先是语言和架构单一。训练是英文 CommonVoice 子集,基座是 CosyVoice2,未来工作才计划推广到其他大模型语音架构和多语种。因此不能把英文短读句加机器扩展长文的结论直接推广到中文或自发对话。

其次是长文构造的生态效度有限。长文是用大语言模型把短句扩展到 280 到 320 词的连贯段落,原句只作为开头,这能压测独白稳定性,但不等同于真实交互中话题切换、打断和噪声下的流式输入。论文未测量误判率、端到端对话延迟和成本,相关性不等于因果,不能承诺这些量得到改善。

第三是实现细节缺项。训练只说冻结流匹配和声码器、只微调语言模型,未报告优化器、学习率、训练步数和显存预算;推理只说流式声码增量合成,未给出分块转波形的帧长和拼接重叠。这些缺失不是技术错误,但复现时需要补验证。总体趋势也不等于每组每步都成立,例如前视过大反而恶化就是明确反例。

要复现,先做什么,后补什么?

先做数据与对齐。用 CommonVoice 13.0 英文子集并剔除与 Seed-TTS-Eval 重叠,预抽语音词元、梅尔频谱图、文本词元和说话人嵌入,用 WhisperX 跑词级时间戳。分词器按每秒 25 帧、最小截断 5 帧配置,完整保留概率设 0.15。随机截断构造要可重放:记录每个样本选中的词序号、插入位置和按音频结束时间算出的截断长度。

再做微调与推理。基座用 CosyVoice2,只更新语言模型,冻结流匹配和 HiFi-GAN。推理固定块 5 词、前视 2 词,第一块带参考文本与音频做零样本克隆,后续块用上一块文本和语音尾做提示,输入按当前段加标记加前视拼接,输出经流式声码分块转波形。评测沿用 Seed-TTS-Eval 协议,用支持长文的转录模型算词错误率,用 WavLM-Large 和 emotion2vec 加算余弦相似度,主观按 5 分制对照参考打分。

还需补的验证是:换另一套对齐器看弱对齐误差的影响,换多语种和另一基座看迁移性,记录训练步数、学习率、显存和推理分块延迟,把首音频、实时率和输出帧率分开讨论。代码与权重方面,论文只给出演示页链接,本解读依据的证据未包含可运行仓库,因此只能说演示页在原文中被提及,不能断言代码开源或权重可下载。

何时值得尝试这个方案?

当你的系统已经是可用的大模型语音合成,但一接流式文本就出现两类症状时值得尝试:一是短句尚可、长段落越说越乱甚至提前断掉,二是分块合成后音色忽变、句间停顿生硬。该方案的适用条件是:能接受每块多等 2 个词的前视延迟,能拿到词级粗对齐做训练构造,且声码器支持流式增量输出。

它的核心动作可复述为一句话:训练时随机插标记并截断语音让模型学会提前停,推理时每块只带上一块尾部加 2 词前视让缓存有界。记住两个边界:前视不是越大越好,块太小则语义不足;离线批量声码的实时率数字不能和流式增量直接比快慢。如果长文稳定性是首要目标,这个以小前视换大稳定的做法是当前证据下更稳的选择,但多语种和真实对话仍待验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总