英文题目:Scaling Properties of Continuous Diffusion Spoken Language Models
会议身份:
conference:interspeech:2026:conference-paper-id:ramapuram26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#扩散模型 #预训练 #语音 #语音合成
评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jason Ramapuram:机构信息未能从会议 PDF 纯文本可靠映射
- Eeshan Gunesh Dhekane:机构信息未能从会议 PDF 纯文本可靠映射
- Amitis Shidani:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Busbridge:机构信息未能从会议 PDF 纯文本可靠映射
- Bogdan Mazoure:机构信息未能从会议 PDF 纯文本可靠映射
- Zijin Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Russ Webb:机构信息未能从会议 PDF 纯文本可靠映射
- Tatiana Likhomanenko:机构信息未能从会议 PDF 纯文本可靠映射
- Navdeep Jaitly:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
无文本口语语言模型需以80Hz连续对数梅尔滤波器组为输入并延续生成语音,帧率相对文本约20倍导致序列极长,且扩散模型缺乏可分解似然难以做语言性排序。管线先将24kHz长对话波形重采样并提取80维对数梅尔滤波器组,切分为上下文与待生成延续,为条件建模提供定长声学输入。接着多模态扩散变换器以两路语音流替代原文文本图像流,用速度参数化与最小信噪比加权去噪损失学习条件速度场,并以零信号作无条件分支避免额外无条件训练以节省计算量。然后将采样滤波器组经声码器合成波形,再经通用音素识别器抽取音素序列并统计真实与生成数据的音素n元经验分布差异,以音素散度完成模型无关评估。相对离散自回归量化的信息瓶颈,该连续扩散路线保留声学细节并将感知质量与语言分布评估解耦,使扩展规律可直接在波形层面验证。在等算力扫描验证集评测下,测试拟合的平均相对误差为0.80%,高于训练拟合的平均相对误差0.49%。外推结论的适用边界受限于当前函数形式与有限算力范围,多数感知指标快速饱和至真实基线正负标准差内,部分按现有形式在任意算力下不可达真实基线。更大上下文与感知器下采样至4096 token及千万小时级训练带来显著计算量,长程连贯仍未解决且尚未验证更大算力下的外推有效性。
🔗 开源与复现资源
- 代码相关资源:https://github.com/apple/ml-diffuslm → https://github.com/apple-aiml-research/ml-diffuslm — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/xinjli/allosaurus — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么只听声音学语言这么难?
输入是公开来源收集的大规模对话语音,目标是在没有任何文本监督的情况下让模型直接续写语音。初学者容易把这件事理解成语音识别加语言模型,但论文研究的无文本语音语言模型更严格:训练时看不到转写文本,测试时也要直接生成波形对应的连续声谱。
必须保留的关键信息是语音的信息密度远低于文本,论文给出一个可复述的换算:1 秒对话语音约 3 个词,对应文本大模型约 4 个词元,而 80 Hz 帧率的对数梅尔谱 1 秒有 80 帧,等效语义内容的序列长度膨胀约 20 倍。这意味着同样的语义需要更长的序列、更大的算力和更多数据,还要同时应付说话人、情感、韵律和环境变化。输出是给定 10 秒上下文后延续 30 秒的语音谱段,再经声码器变成可听波形。
理解这个任务后,才能明白后文为什么要讨论离散自回归的瓶颈、连续扩散的替代价值,以及为什么需要新的语言性度量。
已有路线在同输入同目标下走到了哪里?
同输入同目标的路线主要是把自监督语音表示离散化为语音词元,再训练自回归模型延续词元,代表工作包括生成式口语建模、音素结构发现和近年离散语音语言模型的扩展律研究。论文报告这类模型在词汇、句法和语义评测上大致相当于三到四岁儿童水平,明显落后于文本模型和图文交错模型。另一条同目标但输入不同的路线是文本到语音和文本语音联合模型,它们有文本条件或文本预训练大模型可用,因此不在同一无文本约束下比较胜负。
同运行阶段的扩散工作多集中在神经声码器、文本到语音和潜在编解码空间生成,少数扩散语音理解工作仍依赖文本条件或冻结的离散扩散语言模型。论文的定位是首次在完全无文本监督下把连续扩散用于语音语言模型,并系统研究其扩展性质。学习依赖是先分清有无文本条件,再看表示是离散词元还是连续谱,最后看建模是自回归还是扩散,这样才不会把文本带来的增益误记为建模范式的增益。
论文要回答的扩展问题是什么?
论文要回答的是语言性是否随模型尺寸、数据量和算力可预测地改善,以及连续扩散是否改变了离散自回归给出的陡峭扩展轨迹。这里语言性指生成长程连贯语言的能力,是语音语言模型的核心指标。难点在于连续扩散模型不像自回归模型那样可以方便地分解序列似然,因而难以直接沿用基于正确与错误句子对打分的词汇、句法和语义判别评测。为此论文提出基于采样的音素 Jensen-Shannon 散度,用生成语音与真实语音的音素 n 元经验分布差异来度量语言性。
第二个问题是最优参数数据配比如何随算力变化,以及在高算力下是否允许偏离最优点仍接近最优,这直接关系到能否用更小模型实现更快推理。第 3 个问题是感知质量指标是否同样服从扩展律,论文明确把语言性指标与平均意见分、美学分数分开处理,避免把好听等同于说得连贯。
一个样本如何走完从波形到续写语音?
以一段原始单声道波形为例,流程先重采样到 24 kHz,再提取 80 维对数梅尔滤波器组,窗长 50 毫秒、帧移 12.5 毫秒,得到帧率 80 Hz 的谱序列。然后把谱切成两段:在扩展律实验中上下文取 10 秒,要生成的延续取 30 秒。上下文谱直接线性投影到模型维度,延续谱先按前向加噪过程加高斯噪声,再做时间维折叠与通道扩展后线性投影,两路一起送入多模态扩散变换器。
变换器有上下文流和延续流两条独立通路,各自的归一化、多层感知机和投影相互独立,只在注意力内部把查询、键、值拼接后做全双向自注意力,重复多层后取出延续流做扩散损失。训练目标是预测速度向量并用最小信噪比加权平衡不同时间步的损失贡献。推理时从噪声出发迭代去噪得到延续谱,再用现成 HiFi-GAN 声码器合成波形。
条件增强不用训练时随机丢弃条件的标准做法,而是把全零信号编码为无条件分支,在推理时用弱引导与强引导两种尺度放大条件差异,论文报告无引导采样质量较差。
下面先看整体双流结构,再对应到文字描述中的上下文与加噪续写两条路径。
看图路径: 1. 先沿上支上下文谱到线性层再到中央模块的箭头走一遍;2. 再沿下支加噪续写谱到线性层的箭头走一遍;3. 确认两支只在中央注意力内交互且时间步从下方注入
论文图 2。原论文 Figure 2:“Continuous diffusion SLM architecture.”。
图中上支是上下文谱经线性层进入中央模块,下支是续写谱加噪声后经线性层进入同一中央模块,时间步从下方注入,输出再经线性层还原为谱。这种画法对应正文所说的双流独立加注意力内交互:除注意力外两路不共享归一化和前馈参数,时间信息以外加条件进入每个块。初学者复述时要能指出哪一条是条件,哪一条是被去噪对象,以及声码器在扩散模型之外。
表示、主干和评价组件各自负责什么?
表示组件选择对数梅尔滤波器组而非神经编解码词元,理由是物理可解释、压缩损失小、与具体编解码器解耦,且在多变声学环境下更稳健。代价是序列更长,训练和推理的计算量更大。主干组件采用多模态扩散变换器并把原文的文本与图像双流替换为上下文谱与续写谱双流,模型尺寸通过保持嵌入维度与层数比为 128 来调节。评价组件包括新提出的音素 JSD 和两类感知质量预测器。
音素 JSD 的做法是先采样谱并经声码器合成波形,再用通用音素识别器得到音素序列,统计 1 到 5 元音素 n 元的经验分布,计算生成集合与真实集合之间的 Jensen-Shannon 散度,越低表示分布越接近。感知质量一侧用 DNSMOS、NISQA 和 Meta Audiobox 美学分数的 4 个子维度,分别报告均值。论文明确把内容享受度和内容有用度与制作质量、制作复杂度分开,因为只有前两者在后文表现出可预期的等算力行为。
语音语言模型 × 连续扩散: 语音语言模型负责在没有文本监督时从语音本身学习可延续的语言结构,连续扩散负责在连续声谱空间里学习从噪声恢复信号的条件分布,二者搭配的理由是语音波形和语谱本身连续而其承载的语言离散,直接离散化会引入瓶颈,组合后前者定义任务目标,后者提供不必计算精确似然也能训练和采样的生成机制。
对数梅尔滤波器组 × 多模态扩散变换器: 对数梅尔滤波器组负责把 24 kHz 波形变成 80 维、帧率 80 Hz 的物理可解释连续表示,保留语义和声学细节并与任意兼容声码器解耦,多模态扩散变换器负责把上下文谱段和加噪续写谱段分别投影后做联合注意力去噪,二者搭配是因为前者决定信息密度和序列长度,后者决定条件建模容量,组合后形成上下文加噪声续写的续写任务。
组合机制的新增作用是让训练目标、采样方式和评价方式自洽:连续表示决定扩散可以直接作用于谱,扩散主干决定训练是去噪而非下一词元预测,采样评价决定语言性必须用分布比较而非似然比较。缺少任一环节,扩展结论都无法闭环。
训练如何组织,超参数如何跨尺寸迁移?
训练数据是名为 SpeechCrawl 的大规模对话语音,原始样本平均约 30 分钟、多语种多说话人,约六成为英语。扩展律实验用的过滤版本要求单样本超过 5 分钟且英语占比至少 99%,用 WhisperX 加 Whisper 大模型的流程估计语言占比,最终得到 7,000,000 小时英语为主的语音。训练时模型学习在不同噪声水平下从加噪延续谱恢复速度向量,损失按信噪比截断加权以提高训练效率。
超参数先在一个约 36,000,000 参数的 4 层基座模型上充分训练约 20,000 步,网格搜索学习率与权重衰减,得到学习率 0.001 与权重衰减 0.03 最优,再用最大更新参数化和完全参数化方法按尺寸缩放,其余超参数按此规则推导。论文报告学习率和权重衰减是关键超参数,推理步数与噪声调度器类型因算力限制而固定。每个尺寸数据配比至少跑 3 个随机种子并报告均值与标准差,避免把单次波动当成扩展趋势。
需要指出的缺项是原文未给出优化器 1 阶 2 阶矩参数与梯度裁剪等细节的具体迁移公式,复现时只能沿用其基座最优值加缩放框架,不能从模型名称推定实现。
无分类器引导 × 音素 JSD: 无分类器引导负责在推理时放大条件分数与无条件分数之差以增强上下文约束,音素 JSD 负责把生成语音与真实语音的音素 n 元分布差异量化为语言性分数,二者分工是前者控制采样行为,后者评价采样结果,搭配原因是扩散模型难以直接计算序列似然做 sWUGGY 类判别评测,组合后可以用采样加通用音素识别的分布比较来观察语言性是否随扩展改善。
该组合的实际含义是训练阶段把全部算力用于条件分布,推理阶段用静音零信号作为无条件分支做引导,评价阶段用采样分布差异反映条件建模是否学到了语音的语言结构。
扩展实验的算力网格与拟合方法是什么?
扩展实验覆盖 10 档算力,从 10 的 18 次方到 10 的 21 次方,包括中间的 3 倍与 6 倍档,模型从约 600,000 参数的 1 层到约 11,500,000,000 参数的 27 层。约束关系采用总算力约等于 6 倍参数量乘以数据量。对每档算力画出指标随模型尺寸变化的等算力线,好的扩展应呈现先降后升的 U 形损失曲线或先升后降的倒 U 形质量曲线,并且整体随总算力单调改善。
验证损失拟合采用带外层指数的参数曲面,包含不可约熵、模型项与数据项,用 Huber 损失与 basin-hopping 加 L-BFGS-B 优化拟合,论文强调保留外层指数对连续扩散模型取得低于 5% 平均相对误差很关键。下游指标拟合采用融合 2 阶段方法,把验证损失曲面代入广义 S 形函数同时联合优化全部参数,因为指标在两端应饱和于随机水平与最优水平。直接拟合与分步拟合在预试验中误差较大,这是选择联合优化的已验证对照。
等算力线 × 计算最优分配: 等算力线负责固定总算力 C 约等于 6ND 后扫描模型尺寸 N 与数据量 D 的权衡曲线,计算最优分配负责在每条曲线上找到损失或指标最优的 N 星与 D 星,二者搭配是因为单点比较无法区分是模型太小还是数据太少,组合后才能拟合损失曲面并外推更大算力的最优词元参数比。
该设计让后文可以同时回答拟合精度、最优点位置和曲线平坦程度 3 个问题,而不是只报告损失下降。
验证损失与语言性指标给出了什么可预测关系?
先看验证损失的拟合精度与最优点漂移。上方面板显示多条等算力拟合虚线与训练点、测试点和星形最优点吻合,拟合报告训练平均相对误差 0.49%,测试平均相对误差 0.80%。下面板显示最优点处曲率随算力下降,容忍精度千分之一内的模型区间与数据区间扩大约两个数量级。这支持的判断是高算力下可以用明显更小模型或明显更少数据达到接近最优的损失,为快速推理留下空间,但这只是损失层面的结论,不能直接等同于语言连贯。 下面结合上下面板理解损失最优与带宽放大的并存现象。
看图路径: 1. 先看上方面板横轴数据集规模与纵轴验证损失的多条虚线拟合;2. 再看橙色星形最优点如何随算力颜色从上向下移动;3. 最后看下面板曲率与容忍带宽度随算力变化的方向
论文图 1。原论文 Figure 1:“(Top) Scaling law fit for validation loss.”。
上图说明拟合不是单调下降线的简单外推,而是每档算力内部存在最优配比,星形从左上向右下移动表示最优点向更大数据方向走。下图说明曲线在最优点附近越来越平,曲率下降对应容忍带扩大,复现时应同时检查最优点与带宽,而不是只记一个最优比值。
再看不同指标是否都服从预期形状。上排验证损失、1 元与 5 元音素 JSD 都呈现清晰的 U 形等算力线,下排内容有用度呈现倒 U 形,而制作复杂度与 P808 平均意见分很快进入真实数据基线的正负标准差带内不再随算力改善。这支持把指标分为可扩展与快速饱和两类,饱和不代表模型不好,而是说明这些感知质量在小算力下已接近基线波动范围。 为完整起见补充该图的阅读动作与结论边界。
看图路径: 1. 先对比上排三幅 U 形等算力线与下排趋平曲线的形状差异;2. 再看每幅横轴模型参数与颜色表示算力的对应关系;3. 最后看下排黑虚线真实数据基线与灰色正负标准差带的位置
论文图 3。原论文 Figure 3:“IsoFLOP curves with ±σ range at weak CFG level.”。
阅读时应先确认上排纵轴越低越好、下排内容有用度越高越好,再按颜色从深到浅跟踪算力增大时曲线整体下移或上移,最后用黑虚线与灰带判断下排后两幅是否已触及基线。该图不能用来读出具体最优参数量,只能判断哪些指标值得继续拟合扩展律。
最优词元参数比随算力的变化是另一个核心结果。拟合给出在 10 的 21 次方算力附近最优比约 245,按论文每文本词元对应约 20 谱帧的换算相当于文本比约 12.25,低于文本自回归报告的 20 左右,也与离散语音语言模型随算力上升的趋势不同。图中红色星形标出比值等于 400 时的算力、模型与数据位置,可作为复现时的锚点。 下面用该图确认下降趋势与锚点数值。
看图路径: 1. 先看横轴算力与纵轴最优词元参数比的双对数下降趋势;2. 再找到红色星形标注的转折点与其数值框
论文图 4。原论文 Figure 4:“Dependence between optimal tokens-per-parameter”。
该图横轴是算力,纵轴是最优词元参数比,双对数下近似直线下降,橙色星形是各档拟合最优点,红色星形是比值 400 的交点。解释时要强调这是损失最优推导的结果,换成下游指标最优会略有偏移,且外推远超实测算力时需谨慎。
为便于复述拟合条件与精度,把关键网格与误差整理成表。表前的问题是:在什么算力与尺寸网格上拟合,以什么误差支持可预测性,哪些指标拟合更好。公平条件是同一验证损失定义、同一采样与声码流程、至少 3 种子取均值,指标方向是损失与音素 JSD 越低越好。
| 条件 | 指标 | 拟合范围 | 训练误差 | 测试误差 |
|---|---|---|---|---|
| 10 档算力从 10 的 18 次方到 10 的 21 次方,模型约 0.6M 到约 11.5B 参数 | 验证损失 | 全部网格 | 0.49% | 0.80% |
| 同上网格,弱引导与强引导采样 | 1 元音素 JSD | 全部网格 | 4.22% | 8.21% |
| 同上网格,弱引导与强引导采样 | 5 元音素 JSD | 全部网格 | 0.71% | 1.04% |
| 同上网格,弱引导 | 内容有用度 | 全部网格 | 1.15% | 0.47% |
| 真实数据基线 6.266 正负 0.752 | 内容有用度外推 | 远超实测算力 | 饱和未达基线带 | 待验证 |
表后解释是主要收益与代价。收益是验证损失与高阶音素 JSD 拟合误差低,5 元明显好于 1 元,支持高阶 n 元更能抓住与训练损失相关的语音结构。代价是 1 元拟合误差相对较高,且下游联合拟合得到的基座系数与纯损失拟合不完全一致,说明 S 形映射或联合优化引入偏差。未胜出项是内容有用度外推显示即使大幅增加算力,最优值仍在真实数据基线带之下,论文明确给出两个限定:函数形式与优化可能不足,以及连续扩散在当前表示下可能存在固有限制,需要更强归纳偏置或文本条件才能弥合。表内真实基线不能与自动分数直接混为人工评分,百分点与相对百分比含义不同。
哪些设计选择最影响质量与语言性?
消融固定嵌入维度 1024、8 层、训练 512,000 小时、推理 100 步,单独改变训练时长、时间折叠块大小、噪声调度与扩散步数,并在弱引导与强引导下报告。训练时长从 0.25M 到 1.5M 小时按 0.25M 步进,块大小从 1 到 6,噪声调度比较线性、余弦与指数并考虑是否强制零终端信噪比,扩散步数比较 100 到 4000。论文的综合结论是噪声调度对感知质量影响最大,训练时长对语言性以及内容享受度与有用度影响最大,块大小增大则各项指标一致变差,说明时间分辨率对自然韵律和可懂度很关键。噪声调度细节是余弦整体不占优,零终端信噪比与线性搭配收益最明显,因为它显式训练了高噪声端的完全破坏与恢复。
为复现消融,先明确每类变量的取值网格与固定条件,再比较分布而非单点。公平条件是同一基座超参数、同一推理步数与引导尺度,指标方向是感知分数越高越好、音素 JSD 越低越好。
| 消融维度 | 取值网格 | 固定条件 | 主要影响指标 | 论文报告趋势 |
|---|---|---|---|---|
| 训练时长 | 0.25M 到 1.5M 小时 | 嵌入 1024,8 层,推理 100 步 | 音素 JSD,内容享受度与有用度 | 时长影响语言性最大 |
| 时间块大小 | 1 到 6 | 同上 | 全部指标 | 块增大一致变差 |
| 噪声调度 | 线性,余弦,指数,是否零终端信噪比 | 同上 | 感知质量 | 调度影响最大,余弦偏弱 |
| 引导尺度 | 弱引导与强引导 | 同上 | 采样质量 | 无引导较差,需引导 |
表后需要说明代价与反例。计算节省的代价是增大块大小虽缩短序列,但会损失细粒度时间细节,对韵律要求高的应用不可接受。反例是并非所有美学与平均意见分都随消融改善,制作质量与复杂度等维度很快饱和,这与主扩展实验一致。未评测边界是推理步数与调度器类型在扩展律部分被固定,消融的步数结论不能直接推广到更大模型与更长上下文。复现时应先固定引导尺度再比较调度,否则容易把引导增益误记为调度增益。
什么结论还不能下,哪些边界尚未评测?
论文直接报告的是损失与部分指标的幂律拟合、最优比下降与容忍带扩大,以及 16B 模型的定性生成能力。有限解释是内容有用度外推未达真实基线,这支持但不证明表示存在固有限制,因为函数形式、外推范围与声码器重建误差都可能影响结论。未验证推测是更大算力或新表示必然带来长程连贯,论文明确把长程连贯列为显著挑战。缺失证据不是技术错误:韵律与副语言属性被认为更适合后训练阶段评价,预训练阶段未系统评测。
误判率、延迟与成本未与趋势一起测量,不能承诺这些量同步改善。总体趋势不等于每组都成立,个别算力档的等算力线可能因种子波动偏离拟合,复现时应保留均值与标准差。此外,16B 模型用了冻结 Whisper 编码器加 Perceiver 下采样的 richer 条件,输入从 300 秒上下文生成 60 秒延续,这与基座扩展律的 10 秒加 30 秒设置不同,因此其验证损失低于基座不可约损失不能直接理解为同一架构下的外推成功,而是表示与条件改变了下界。
复现时先做什么,需要哪些信息条件?
先按学习依赖准备数据与表示:收集长时对话语音并过滤出英语占比高、时长足够的子集,重采样到 24 kHz 后提取 80 维对数梅尔谱,固定上下文与续写时长。基座超参数先在小模型上搜索学习率与权重衰减,再按缩放规则推广到大模型,每个配置跑至少 3 个种子。训练用速度预测加最小信噪比加权,推理固定步数并比较弱引导与强引导。评价分 3 路:验证损失拟合、音素 JSD 采样评价、感知质量预测器打分,采样后必须经过同一声码器再做音素识别,否则分布差异不可比。
拟合时先画等算力线确认 U 形与单调性,再拟合带外层指数的损失曲面,最后用联合优化的 S 形映射拟合下游指标并报告训练与测试平均相对误差。资源状态是正文开源声明的唯一依据:代码资源当前可用,地址为苹果的扩散语言模型仓库,可获取示例与生成脚本;第三方音素识别器资源当前可用,可用于复现音素 JSD 中的识别环节。
需要区分代码开源、权重下载与系统可运行:论文给出示例链接不等于完整训练权重可直接下载运行,大规模训练还需数百万小时语音与大规模算力。还需补的验证是更大算力外推、替代函数形式、不同声码器的影响,以及长程连贯的人工评价。
何时值得尝试连续扩散语音语言模型?
当研究目标是无文本条件下探索语音的语言结构,且已接受长序列与高算力成本时,连续扩散值得作为离散自回归之外的对照路线。它的适用条件是能承担 80 Hz 谱序列的训练与采样开销,并愿意用采样加音素分布比较来评价语言性。论文的证据表明它没有从根本上改变扩展轨迹,但带来了实用的新行为:高算力下偏离最优配比仍接近最优,允许用更小模型换更快推理。
16B 规模能生成多说话人、多语种、富有情感与韵律的语音,但长篇连贯仍缺席,这意味着若目标是长程故事或指令跟随,仅靠扩大当前架构与数据可能不划算,应考虑新表示、新架构或转向文本语音联合模型。复述方法时记住一条主线:连续谱输入决定序列长度,扩散主干决定去噪训练,引导决定采样质量,音素 JSD 决定语言性是否可测,扩展律决定算力花在哪里最划算。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



