英文题目:DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

会议身份:conference:interspeech:2026:conference-paper-id:madha26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#扩散模型 #零样本 #语音 #文本到语音

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Wasim Madha:机构信息未能从会议 PDF 纯文本可靠映射
  • Nityanand Mathur:机构信息未能从会议 PDF 纯文本可靠映射
  • Hamees Sayed:机构信息未能从会议 PDF 纯文本可靠映射
  • Apoorv Singh:机构信息未能从会议 PDF 纯文本可靠映射
  • Sameer Khurana:机构信息未能从会议 PDF 纯文本可靠映射
  • Akshat Mandloi:机构信息未能从会议 PDF 纯文本可靠映射
  • Sudarshan Kamath:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

零样本语音合成以文本与3秒至5秒参考语音的转录及码本为输入,输出高可懂度、高相似度波形,实际难点是自回归逐Token解码延迟高,而并行模型易丢词错位且依赖显式时长与对齐。DLLM-TTS将X-Codec2单码本序列按块长32切块,先将文本与参考码本拼接为条件,再以阶梯注意力在当前噪声块内双向建模声学连贯、对历史干净块跨块因果继承语义。随后每块以置信度阈值并行解掩码并顺序推进,用句尾符后填EOS处理变长以省去时长模型与音素对齐,相对已有方法的关键差异是以块内并行兼顾块间因果并支持键值缓存流式解码。在Seed-TTS-eval基准下,T=32条件的WER为2.25%,低于T=8条件的WER 14.58%。在 Seed-TTS-eval 英文集上最优配置 T=32、B=32 取得词错率 2.25%、字错率 1.05%、说话人相似度 0.750、主观分 4.25,接近 DiTAR 与 F5-TTS 等基线,实时率 0.15 且首块完成后可流式出声。结论仅在英文短句零样本场景验证,多语种、长文本、强噪声提示外推尚未验证。训练为两阶段课程学习共 20K 小时,耗 8 卡 H100 共 3 天。该0.6B模型在上述硬件上的推理开销以实时率0.15体现低延迟流式吞吐优势。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么对齐这么难?

这篇论文研究的输入是目标文本加一段 3 秒到 5 秒的参考语音及其转写,输出是保持参考音色的目标语音波形。研究生首先要保留的信息条件是零样本设定:测试说话人事先未见,模型只能从短参考中推断音色,不能依赖说话人编号。目标文本是生成内容,参考编解码器词元是音色条件,生成段初始全为掩蔽词元。论文把语音先经 X-Codec2 压缩为每秒 50 帧的单词元流,词汇量 6561,因此 1 秒语音对应 50 个离散符号,块大小 32 对应约 0.64 秒。

难点在于两个时间尺度同时存在:相邻帧必须声学连续,否则出现断裂或杂音;文本与语音又必须长程对齐,否则出现跳词或重复。传统自回归方法逐个预测词元,对齐稳定但延迟高;全并行非自回归方法速度快但容易对错位置。理解这一点后,才能明白为什么作者选择块内并行、块间串行的中间路线。

资源状态方面,本次收到的证据中没有完成验证的代码或模型资源,因此不能声称代码、模型或数据已公开,复现讨论只能依据论文文字条件进行。

初学者如何用一句话记住核心机制?

记住一句话:把长语音切成 0.64 秒一块,一块内部并行猜词,一块接一块串行推进,用注意力让每块既看到文本又看到前面已写好的声音。训练时随机遮住不同比例让模型见过多种残缺,推理时从全遮住开始按置信度逐步填实,简单块提前结束。这种设计把声学连续性放在块内解决,把文本对齐放在块间解决,因此能在数据较少时仍保持可懂度与音色。学习时建议先画出输入拼接、块切分、掩蔽、注意力可见性、置信提交、声码器解码 6 个环节,再对照两张图检查箭头与阶梯边界是否与自己的理解一致,避免跳过块间因果而误以为全并行 1 次生成。

自回归、非自回归与离散扩散各解决了什么?

按同输入、同目标、同运行阶段对照 3 条路线。第一条是自回归编解码语言模型,以 VALL-E、VALL-E 2、LLASA 为代表,把语音合成当作对离散词元的从左到右语言建模,优点是可懂度和零样本克隆强,代价是需要 60,000 到 250,000 小时数据和逐词元串行解码。第二条是非自回归合成,以 Voicebox、F5-TTS、NaturalSpeech 3、StyleTTS 2、CosyVoice、SoundStorm、MegaTTS 3 为代表,用流匹配或扩散并行生成,优点是速度快,代价是往往需要显式时长预测、帧级标注或多阶段流水线,否则文本语音对齐不稳定。

第 3 条是离散扩散语言模型,以 MDLM、LLaDA、BD3-LM 为代表,在文本上证明掩蔽去噪可以匹配自回归质量并支持并行解码,其中 BD3-LM 提出块分解以在速度与质量间插值。但论文指出这些工作只在文本上验证,条件语音生成中声学连贯与文本对齐需联合建模的情形尚未探索。DLLM-TTS 的定位就是把块离散扩散搬到条件语音生成,不引入音素对齐器和时长模型,直接在编解码器词元上学习重建。

与 MaskGCT 和 SoundStorm 的差异在哪里?

同为掩蔽或并行解码,差异在条件与粒度。MaskGCT 也是掩蔽生成编解码器变换器,但 DLLM-TTS 明确引入块分解与阶梯注意力,把并行限制在块内而跨块保持顺序,论文因此强调在保持并行速度的同时加强文本语音对齐。SoundStorm 用基于置信度的并行解码处理残差量化多码本,论文指出其在文本语音对齐吃力,而 DLLM-TTS 使用 X-Codec2 单码流加文本条件重建,简化了多并行流的对齐负担。F5-TTS 与 Voicebox 走连续特征的流匹配路线,省去离散词元但依赖扩散变换器与文本处理设计。

DLLM-TTS 则留在离散词元上,便于复用语言模型结构与键值缓存。对初学者而言,不应把类别差异直接当作同条件胜负,而应按是否使用时长模型、是否单码流、是否块串行 3 个条件对照,再看可懂度与相似度的分离指标。

论文把合成问题重新表述成什么可训练目标?

论文把合成表述为给定文本与说话人提示的条件下,对编解码器词元序列的条件块离散扩散重建。具体操作是把长度为 L 的序列切成块大小 B 的连续块,块数为上取整 L 除以 B。在训练时对目标块按扩散时刻 t 独立掩蔽,掩蔽概率为 1 减去阿尔法 t,线性调度取阿尔法 t 等于 1 减 t。模型看到被掩蔽序列和条件信息,目标是预测被掩蔽位置的原始词元,损失为这些位置上的交叉熵在 t 均匀采样下的期望。

举例说明:假设一段待合成序列被切成多个 32 词元块,训练随机抽一个时刻 t,例如高掩蔽率时刻,则块内大部分位置变为特殊掩蔽符号,模型必须结合生成文本、参考文本和已生成的干净历史块来猜回原词元。推理时则从全掩蔽出发逐块去噪。这种表述把数据效率的来源也讲清楚了:同一句话在不同 t 下呈现不同掩蔽模式,相当于隐式数据增强,而自回归训练每句只有一种从左到右顺序。

沿一个样本走完全流程需要经过哪些步骤?

以零样本推理为例,输入序列按参考文本、生成文本、结束符、参考编解码器词元、全掩蔽生成段拼接。参考编解码器长度为 150 到 250,对应 3 秒到 5 秒。最大序列长度 2048,对应约 40 秒语音。顶部输入进入块离散扩散 Transformer,内部按块 1 到块 N 顺序处理,当前块做迭代去噪,已完成块作为干净历史提供因果上下文。每个块去噪完成后得到干净编解码器词元,最后统一送入 X-Codec2 解码器还原波形。

为处理变长,论文引入结束符,结束符之后全部置为结束符,模型学会在合成完成时生成结束符,从而无需显式长度预测。训练输入格式略有不同,是文本词元后接编解码器词元,文本与编解码器使用各自嵌入层映射到同一维度后拼接。模型共 28 层,隐藏维度 896,注意力头 14,文本词表来自 Qwen 分词器,编解码器词表 6561,位置编码使用旋转位置编码。

以下导读针对总体结构图:请先把输入条的 4 段颜色与下方变换器、解码器、波形的箭头当作一条主路径来读,再看块间横向依赖与块内纵向去噪的关系,这样才能把串行与并行的分工分开。

看图路径: 1. 先从顶部输入条向中央箭头跟踪参考文本与参考编解码器词元的走向;2. 再确认生成文本与全掩蔽段在何处拼接到同一序列;3. 然后观察块 1 到块 N 的横向箭头与当前块向下解码的纵向箭头;4. 最后确认经 X-Codec2 解码器到波形的输出路径

原论文 Figure 1:Overview of DLLM-TTS. Text and reference codec tokens are concatenated with generation text and…

论文图 1。原论文 Figure 1:“Overview of DLLM-TTS. Text and reference codec tokens are concatenated with generation text and [MASK]L”。

该图显示顶部由参考文本、参考编解码器、生成文本和全掩蔽段组成输入,箭头向下进入标注迭代去噪的变换器框。框内块 1、当前块 k、块 N 横向相连,表示顺序生成;当前块向下先产生浅色掩蔽块再经箭头变为深色干净块,表示块内多步去噪。干净块向下经 X-Codec2 解码器指向波形。这一可视结构支持后文的复述:条件全部经注意力提供,生成按块推进,声码器只负责词元到波形,不参与文本对齐。

阶梯注意力与块划分如何分工?

块划分先决定并行粒度,阶梯注意力再决定可见性。设位置 i 所属块为 i 除以 B 上取整,当前噪声块为 b 星。注意力允许条件有 3 类:第一,噪声块内双向可见,保证块内局部声学连贯;第二,跨块只能看历史块,保证顺序上下文;第三,干净块内因果可见,保证自回归条件。

白话说,正在写的块内部可以左右互看,已经写好的块只能从左往右看,正在写的块可以看到以前写好的块,反之不行。这种设计使块大小 B 等于序列长 L 时退化为全并行扩散,B 等于 1 时退化为自回归生成。论文默认 B 为 32。教学例子:写第 3 块时,第 3 块内 32 个位置互相可见,第 1 块和第 2 块的干净词元全部可见,但第 4 块尚未生成不可见。这样既不会因全并行而对齐漂移,也不会因逐词元串行而过慢。

神经音频编解码 × 离散扩散: 神经音频编解码负责把连续波形压缩为离散的编解码器词元序列,提供语言模型可预测的符号;离散扩散负责定义如何把这些词元掩蔽破坏再逐步重建。两者搭配的理由是单码流降低建模复杂度,掩蔽重建提供并行预测能力,组合后新增的作用是可以在不使用多层残差码本并行流的情况下做语音生成。

块分解 × 掩蔽扩散: 块分解负责把长编解码器序列切成大小为 B 的连续块并规定块间按顺序生成,掩蔽扩散负责在目标块内独立掩蔽词元并并行预测。搭配理由是语音兼具块内强局部声学连续性和跨块长程文本语音对齐,组合后新增的作用是在块内保留双向上下文,在块间保留因果历史,从而在全并行与全自回归之间调节。

阶梯注意力 × 文本语音对齐: 阶梯注意力负责用掩蔽矩阵控制哪些位置可见,文本语音对齐负责让生成语音内容跟随输入文本。搭配理由是无需显式时长模型或音素对齐即可通过注意力建立对应关系,组合后新增的作用是噪声块内双向注意保证局部连贯,同时对历史干净块因果注意提供发音人与文本上下文。

需要提醒的是,原文给出注意力规则与训练损失形式,但未逐层报告梯度是否截断或某层参数冻结,复现时应按全文训练即更新 Transformer 参数理解,缺项部分不应从 Qwen2 初始化名称推定冻结策略。

两阶段训练的数据、优化与掩蔽操作是什么?

训练分为 2 阶段课程。第一阶段在 Emilia 数据集采样 16,000 小时训练 20 轮,建立给定文本与说话人提示的连贯编解码器生成能力;第二阶段在 4000 小时高质量合成语音上微调以改善韵律与对齐。合计 20,000 小时。硬件与优化条件为每卡批量 16、8 步梯度累积、有效批量 128,在 8 卡 H100 上用 3 天,优化器为 AdamW,学习率为 1 乘以 10 的负 4 次方,余弦调度加 1% 热身。

每步从 0 到 1 均匀采样 t,按每词元概率 1 减阿尔法 t 独立掩蔽。文本与编解码器分别嵌入后拼接为输入,损失只计算被掩蔽位置。变量长度由结束符机制处理。推理侧的去噪与训练侧的掩蔽是对应关系:训练见过从轻度到重度多种掩蔽,推理从全掩蔽逐步解开。

置信度采样 × 提前停止: 置信度采样负责在每步只固定预测概率超过阈值的掩蔽位置,提前停止负责在块内掩蔽集为空时结束该块的去噪。搭配理由是不同位置难度不同,不必用固定步数全部重算,组合后新增的作用是先提交高确定性词元再解模糊位置,减少简单块的计算量。

论文未报告第二阶段合成数据的具体来源分布与筛选阈值,也未报告验证集划分与早停指标,因此不能推断其泛化边界。复现时应先固定掩蔽调度、块大小、阈值与最大长度,再核对有效批量与学习率调度,避免把数据量差异误读为方法差异。

推理侧的采样循环具体如何执行?

推理从全掩蔽生成段开始,按块顺序每次处理一个 32 词元块,每块最多 T 步。设当前掩蔽集为 Ms,模型对每个掩蔽位置输出词表分布,取概率最大的词元为预测,若最大概率超过 0.6 则在该步固定为已提交,否则保持掩蔽进入下一步。高置信先固定后,剩余模糊位置在下一轮结合新固定的邻居重新估计。若某步前掩蔽集已空则提前停止,不再用满 T 步。每块跨度为 32 除以 50 即 0.64 秒音频,块完成后即可送解码并支持流式输出,跨块键值缓存减少后续块延迟。

默认实用点为 T 等于 16,此时实时率为 0.15;论文主精度点为 T 等于 32。复现时必须同时固定阈值、块大小与最大步数三者,单独比较步数而不固定阈值会混淆结论。论文未给出温度采样或 top-k 等随机采样细节,因此应按贪心取最大加阈值提交理解,不应自行加入随机性假设。

在什么基准、指标与基线下比较才算公平?

评估使用 Seed-TTS-eval 零样本基准,覆盖标准与挑战场景,包括生僻词、复杂韵律与长句。指标有 3 类方向需分清:字错误率与字形错误率用 Whisper-large-v3 计算,越低表示可懂度越好;说话人相似度用 WavLM-TDNN 嵌入余弦计算,越高表示音色越像;平均意见分由 25 名听众按 CodecMOS-Accent 协议在 5 分制打分,越高表示自然度与韵律越好。自动指标不能当作人评,数值相同也不代表同一维度。

基线覆盖自回归模型 LLASA、IndexTTS2、Qwen2.5-Omni,非自回归模型 F5-TTS、MaskGCT、CosyVoice3、OpenAudio-s1-mini,以及混合模型 DiTAR。论文主结果采用每块 32 步去噪与块大小 32,消融分别改变去噪步数 T 与块大小 B。延迟条件为每块 16 步、置信阈值 0.6 时实时率为 0.15。比较时必须保留原文实际可运行的推理策略,不能用事后最优步数代替可部署收益,也不能把不同 T 或不同 B 的数字混在同一列比较。

主结果显示什么收益,代价与未胜出项是什么?

在英文 Seed-TTS-eval 上,DLLM-TTS 在 32 步去噪与块大小 32 条件下报告字错误率 2.25%,字符错误率 1.05%,说话人相似度 0.750,平均意见分 4.25。论文称其使用 0.6B 参数与 20,000 小时数据,少于自回归系统常用的 60,000 到 250,000 小时,约为 3 到 12 倍的数据减少。主观分落后于 OpenAudio-s1-mini 与 LLASA-3B,但领先其他基线,支持块边界未损害自然度的判断。需要同时看到未胜出项:可懂度最优仍是 DiTAR 等基线,DLLM-TTS 并非全面第一;相似度高不等于可懂度最高,两者需分开陈述。

以下可视化帮助理解收益从何而来:块串行保证跨块条件,块内多步去噪逐步固定高置信词元,因此增加步数主要改善可懂度而相似度保持稳定。 以下导读针对去噪过程可视化:横轴是词元位置,纵轴是全局去噪步数,颜色区分仍掩蔽、已提交与尚未加入,阶梯形状对应块逐个完成,块内填充由稀疏到密集。

看图路径: 1. 先确认横轴为词元位置、纵轴为全局去噪步数的时间推进方向;2. 再区分橙色仍掩蔽、青色已提交与深色尚未加入区域的边界;3. 然后观察每个块宽 32 位置处的阶梯状推进与块内逐渐填充形态;4. 最后核对左下角已生成词元数与总步数的标注含义

原论文 Figure 2:Visualization of the block-wise denoising process. (B = 32, T = 32)

论文图 2。原论文 Figure 2:“Visualization of the block-wise denoising process. (B = 32, T = 32)”。

该图在 B 为 32、T 为 32 条件下显示 5 个块的阶梯推进:每个块宽约 32 位置,深色未加入区域随全局步数右移而缩小,橙色掩蔽面积在块内逐渐被青色已提交面积取代。块交界处出现明显的垂直边界,说明后一块在前一块基本完成后才大量提交。这种形态与论文的推理描述一致:块顺序解码、块内并行预测、跨块键值缓存复用。它也解释了为什么增加 T 能降低错误率:难位置获得更多轮次结合已提交邻居重新估计。

字错误率 × 说话人相似度: 字错误率负责用 Whisper-large-v3 转写衡量可懂度,数值越低越好,说话人相似度负责用 WavLM-TDNN 嵌入余弦衡量音色克隆保真,数值越高越好。两者搭配的理由是可懂度与像不像原说话人是不同维度,组合后新增的作用是避免只看文本正确性而忽略零样本音色保持,或只看音色而忽略漏字重复。

比较公平性方面,主结果的训练数据量与参数量与基线并不一致,因此应表述为在更少数据下达到可比可懂度并保持强相似度,而不是在同数据同参数下全面超越。

去噪步数与块大小的对照支持什么取舍?

第一个对照是固定块大小 32 改变每块去噪步数 T,阈值为 0.6。以下表格整理论文正文直接报告的连续证据,指标方向为字错误率与字符错误率越低越好,相似度越高越好,实时率越低越快。表前问题是:在同一块大小下,增加并行去噪轮次是否只改善可懂度而不破坏音色,以及 16 步的实用点损失多少精度。

去噪步数条件字错误率字符错误率说话人相似度速度与阈值条件
每块 8 步到 32 步的变化范围14.58% 到 2.25%7.86% 到 1.05%0.746–0.765阈值 0.6
每块 16 步实用点高于 32 步时的 2.25%高于 32 步时的 1.05%保持在 0.746–0.765 区间实时率 0.15

表后解释是:从 8 步到 32 步,字错误率从 14.58% 降至 2.25%,字符错误率从 7.86% 降至 1.05%,而相似度稳定在 0.746–0.765,支持增加步数主要解决文本对齐与模糊词元、不改变音色条件的判断。代价是计算量随步数上升,论文因此把 16 步即块大小一半作为速度质量折中点,此时实时率为 0.15。

反例是 64 步并未继续改善,论文表格显示 64 步字错误率回升至 8.83%,说明并非步数越多越好,过度迭代可能引入不稳定,复现时不应默认最大步数最优。 第二个对照是固定去噪步数等于块大小,改变块大小 B。以下表格整理块大小证据,比较问题是:块内并行窗口多大时既有足够局部上下文又有足够串行边界。

块大小条件字错误率字符错误率说话人相似度数据效率条件
32 词元最优点2.25%1.05%0.750参数 0.6B 与数据 20K 小时
8 与 16 词元小块高于 2.25%高于 1.05%0.725–0.750 区间同上训练条件

表后解释是:经验上 32 词元最优,对应字错误率 2.25%、字符错误率 1.05%、相似度 0.750;更小的 8 与 16 块错误率升高,论文解释为并行上下文受限;过大块则序列边界减少,阶梯掩蔽的跨块条件减弱,对齐能力下降。相似度在 0.725–0.750 间保持稳定,显示音色克隆对块大小不敏感。

限制是该消融只报告英文结果,未验证中文或长句下最优块大小是否迁移,复现时应先固定 32 再在目标语种上重做扫描。

哪些边界尚未评测,哪些推测不能当结论?

论文直接报告的是英文 Seed-TTS-eval 上的可懂度、相似度与小规模主观分,未报告中文或其他语种的同条件数字,因此不能把块大小 32 与 16 步的结论推广到所有语言。训练资源只报告 8 卡 H100 共 3 天与有效批量 128,未报告推理硬件、显存占用与首包延迟的测量方法,实时率 0.15 不应直接等同于端到端交互延迟。主观评估为 25 名听众的特定协议结果,样本量与口音覆盖有限,不能当作通用自然度证明。

数据效率的解释是有限解释:掩蔽多样性提供隐式增强的说法与观察一致,但论文未做拿掉掩蔽多样性而保留其他条件的因果消融,因此只能说支持而不能说证明。此外,64 步变差、过大块变差属于报告的负结果,应保留为边界:并行度与步数存在上限,超过后顺序建模或迭代稳定性会受损。缺失证据不是技术错误,但复现与选型时必须把未测量项列为待验证。

要复述与复现应先固定哪些实现细节?

先按样本走通数据管线:文本经 Qwen 分词器编码,语音经 X-Codec2 以每秒 50 帧编码为 6561 词表单流,参考段取 150 到 250 词元,生成段初始全掩蔽,最大长度 2048。模型按 28 层、隐藏维度 896、注意力头 14、旋转位置编码搭建,从 Qwen2 初始化后适配块离散扩散。训练按有效批量 128、AdamW、学习率 1 乘以 10 的负 4 次方、余弦调度加 1% 热身、t 均匀采样、线性调度掩蔽、只对掩蔽位置算交叉熵的流程执行,先做 16,000 小时 20 轮再用 4000 小时微调。推理按块大小 32、阈值 0.6、每块最多 16 或 32 步、置信采样加提前停止、跨块键值缓存的顺序实现,结束符后全置结束符。

核对时先复现 16 步实时率 0.15 对应的解码循环,再扫描 8 到 32 步验证可懂度单调改善与相似度稳定,最后扫描块大小验证 32 最优。常见误解是把单码流当作音质必然更差,或把掩蔽扩散当作无需顺序信息;实际上单码流靠语义声学融合编码保证信息密度,顺序信息由块串行与阶梯注意力保留,两者缺一不可。

何时值得尝试这种方法,还需补什么验证?

当任务是零样本短提示克隆、训练数据只有 20,000 小时量级、且需要流式低首音延迟时,块离散扩散值得尝试,因为它在不使用时长模型与音素对齐的情况下同时给出可比可懂度与强相似度。选择时应接受其代价:推理需要多步去噪与逐块串行,步数与块大小必须按语种与延迟预算重调,不能照搬英文最优点。若追求单步极致可懂度或已有大规模自回归基线,则应先比较同数据量下的增益再决定切换。

还需补的验证包括中文与长句下的块大小扫描、不同参考时长下的相似度曲线、推理硬件一致的延迟与显存测量,以及更大规模主观评估。只有补齐这些,才能把当前英文基准上的竞争性结论扩展为可部署的选型结论。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总