📄 Scaling Transformers for End-to-End Discrete Audio Tokenization

#音频编码 #语音合成 #语音识别 #Transformer #自回归模型 #多任务学习 #流式处理

7.1/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5

7.1/10 | 前50% | #音频编码 | #Transformer | #语音合成 #语音识别 | arxiv

👥 作者与机构

  • 第一作者:Yitian Gong(复旦大学、上海创新研究院、MOSI Intelligence)
  • 通讯作者:Xipeng Qiu(复旦大学、上海创新研究院、MOSI Intelligence)
  • 作者列表:Yitian Gong、Kuangwei Chen、Zhaoye Fei、Xiaogui Yang、Ke Chen、Yang Wang、Kexin Huang、Mingshu Chen、Ruixiao Li、Qinyuan Cheng、Shimin Li、Xipeng Qiu

💡 毒舌点评

TAC 把 ConvNet、预训练编码器、语义蒸馏这些被社区用了好几年的“拐杖”全扔掉,用一套纯因果 Transformer 从零开始联合优化所有模块,重建质量和下游任务效果确实能打。但“统一可扩展接口”的口号,在代码、模型、数据全部闭源面前,听起来更像是为自家闭源生态写的一份白皮书。另外,靠着碾压同行的内部数据量去比公开数据训出来的模型,然后说架构更好——这种“降维打击”,审稿人心里是不会给足创新分和公平性分的。

📌 核心摘要

  1. 要解决的问题:为自回归音频语言模型设计一个统一、可扩展、流式的离散音频分词器,避免现有方法因依赖预训练编码器、语义蒸馏、CNN 归纳偏置带来的扩展瓶颈和训练-推理不一致性。
  2. 方法核心:提出 TAC,一个完全端到端的纯因果 Transformer 音频分词器,将编码器、32层 RVQ、解码器、多尺度/多周期判别器、以及一个用于语义对齐的 0.5B 解码器 LLM 置于统一损失函数下联合训练,从原始 24kHz 波形直接得到低帧率(12.5 Hz)、可变比特率的离散 token。
  3. 与已有方法相比的新意:彻底去除 CNN 模块和预训练编码器,采用完全同构的 Transformer 架构并以此为基础研究联合缩放规律。同时提出 Progressive Sequence Dropout 策略,使得单个自回归 TTS 模型首次能在不同推理码率下无缝切换,无需重新训练。
  4. 主要实验结果:
    • 重建质量:在 LibriSpeech、AISHELL-2、AudioSet、MUSDB 上,TAC 在 750-4000 bps 多个码率下的 SIM、STOI、PESQ、Mel-Loss、STFT-Dist. 等指标大幅优于 Encodec、DAC、Mimi、MiMo-Audio-Tokenizer 等主流开源分词器。例如 4 kbps 时 SIM (EN) 达 0.97,PESQ-WB (EN) 达 3.69。
    • 语音合成:基于 TAC 的全自回归 TTS 模型在 Seed-TTS-Eval 上取得 WER 1.89 (EN), CER 1.23 (ZH), SIM 73.1/78.5,首次以纯自回归离散方案超越 MaskGCT、CosyVoice3 等非自回归和级联系统,且支持可变比特率。
    • 语音识别:基于 TAC tokens 的 1.7B LLM-ASR 在 LibriSpeech test-clean 上 WER 为 2.96,AISHELL-2 iOS 上 CER 为 3.44,无需额外音频编码器即具竞争力。
    • 一般音频/音乐:AudioCaps 上生成 FAD 达 8.77,大幅优于 Mimi (13.08) 和 MiMo (13.19);MusicCaps 上 FAD 为 6.88,亦具竞争力。
  5. 实际意义:为构建统一的原生音频基础模型提供了一种可流式、低帧率的离散接口,通过联合缩放实验为后续研究提供了宝贵的经验和可行上限。
  6. 主要局限性:模型、代码、训练数据完全闭源,无法复现和公平对比;训练数据规模远大于多数开源基线,性能优势难以纯粹归因于架构创新;纯 Transformer 流式推理延迟较高(单帧约 105ms),可能在强实时交互场景受限。

🔗 开源详情

  • 代码:未提及。
  • 模型权重:未提及。
  • 训练数据集:未公开。
  • 评估数据集:使用公开数据集如 LibriSpeech、AISHELL-2、AudioSet、MUSDB 等。
  • Demo:未提及。
  • 引用的开源项目:论文附录 B 和 E 中列出了用于对比的基线分词器和TTS系统的链接,如 UniSpeech、Encodec、Mimi、XCodec2.0 等(详见原文),但均非论文本身的贡献。

🏗️ 方法概述和架构

TAC 是一个完全端到端的音频分词系统,输入 24kHz 原始波形,输出重建波形及离散 token 序列,并可选地预测文本描述。其核心设计哲学是“最小化架构先验”,整个系统由编码器、残差矢量量化器、解码器、判别器和语义对齐 LLM 五部分构成,所有模块联合优化。

编码器:采用 68 个因果 Transformer 块堆叠,自带 10s 滑动窗口注意力以实现流式推理。为逐步降低时间分辨率,在输入阶段和第 12、24、36 层后嵌入“patchify”操作(patch 尺寸为 240/2/2/2),将连续波形逐步压缩至 12.5 Hz 的帧率。编码器分四个阶段,隐藏维度为 768/768/768/1280,FFN 维度为 4 倍,注意力头数为 12/12/12/20,采用 RoPE。

RVQ 量化器:使用 32 层残差矢量量化,每层码本大小 1024,采用分解式矢量量化(潜维度 8)和 L2 归一化码字,码本通过梯度直接更新。训练时应用 quantizer dropout(概率 1.0)以实现可变比特率,并包含承诺损失和码本损失。

解码器:结构与编码器完全对称,由 68 个因果 Transformer 块构成,通过逆 patchify 逐步恢复 24kHz 波形。整个编码-解码管线参数约 1.78B。

判别器:沿用了以往工作的多周期判别器和复数 STFT 判别器,通过对抗损失、特征匹配损失来提升重建的感知质量。

语义对齐模块:在量化器输出后接入一个 0.5B 的预训练解码器 LLM(Qwen2.5 架构),以任务标签([ASR][Caption] 等)为前缀,自回归地预测目标文本(ASR、多说话人 ASR、音频字幕),通过交叉熵损失鼓励离散表征富含语义。

训练流程与目标:总损失为 \(L = \lambda_{\text{sem}}L_{\text{sem}} + \lambda_{\text{rec}}L_{\text{rec}} + \lambda_{\text{cmt}}L_{\text{cmt}} + \lambda_{\text{code}}L_{\text{code}} + \lambda_{\text{adv}}L_{\text{adv}} + \lambda_{\text{feat}}L_{\text{feat}}\)。其中 \(L_{\text{rec}}\) 为多尺度 mel 频谱损失(窗长 \(2^5\) 到 \(2^{11}\))。训练分两阶段:第一阶段 520k 步无对抗训练(batch size 1536),第二阶段 500k 步加入判别器和语义损失进行微调(batch size 768)。

可控比特率生成:下游 TTS 采用 Temporal Transformer + Depth Transformer 架构,并在训练时应用 Progressive Sequence Dropout——以概率 \(p\) 随机截断 RVQ 前缀层,让模型学会在不同量化深度下预测。推理时仅需指定活跃 RVQ 层数 \(K_{\text{infer}}\) 即可控制码率。

此设计的核心在于通过同构且简单的架构,使音频分词器的性能可以像语言模型一样,随计算量、数据量和模型大小的增加而可预测地提升,同时原生支持流式与自回归。

💡 核心创新点

  1. 完全同构的 Transformer 音频分词器:彻底摒弃 CNN 和预训练编码器,用纯因果 Transformer 构建编码器和解码器。此设计不仅实现了架构简洁性,更为研究音频分词器的缩放规律提供了干净的平台。
  2. 彻底的端到端联合优化:将编码、量化、解码、对抗训练和语义对齐置于统一框架下从零开始训练。消融实验证明,这种完全端到端的方式相较于分阶段/冻结部分模块的方法,能带来持续的性能提升,避免了早期饱和。
  3. Progressive Sequence Dropout 实现可控比特率生成:在 TTS 模型的首次深度预测训练中应用 RVQ 前缀丢弃策略,使一个模型适应多种码率,推理时无缝切换,无需任何额外模块。
  4. 语义-声学联合建模:通过引入 ASR、字幕等多任务,证明在不牺牲重建质量的前提下,学习到的离散 token 能够富含语义信息,可直接用于下游理解和生成任务。

📊 实验结果

论文在低、中、高三个比特率区间全面比较了 TAC 与多个开源音频分词器。下表为选取的代表性结果:

模型bpsN_VQSIM↑ (EN/ZH)STOI↑ (EN/ZH)PESQ-WB↑ (EN/ZH)Mel-Loss↓ (Audio/Music)STFT-Dist.↓ (Audio/Music)
MiMo-Audio-Tokenizer3650200.91/0.850.95/0.933.25/2.890.66/0.652.17/2.06
Mimi4400320.94/0.830.96/0.943.43/2.781.02/0.982.34/2.21
Encodec450060.86/0.750.92/0.912.46/2.150.91/0.842.33/2.17
DAC600080.89/0.840.95/0.943.41/3.200.65/0.631.97/1.87
TAC (Ours)3000240.96/0.920.97/0.963.61/3.200.69/0.661.98/1.84
TAC (Ours)4000320.97/0.930.97/0.963.69/3.300.68/0.641.96/1.82

TAC 在所有比特率区间均表现优异。在 MUSHRA 主观评测中,TAC 也展示了统一的领先或持平水平。

TTS 对比

系统Bitrate ControlEN WER↓EN SIM↑ZH CER↓ZH SIM↑
MaskGCT2.6271.72.2777.4
CosyVoice3-1.5B2.2272.01.1278.1
IndexTTS22.2370.61.0376.5
VoxCPM1.8572.90.9377.2
TAC-TTS (Ours)1.8973.11.2378.5

TAC-TTS 在 BIT 控制上具有独占性,且在多数主客观指标上达到最佳或顶尖水平,首次证明了纯自回归离散 TTS 系统的 SOTA 能力。

Progressive Sequence Dropout 消融

不使用该策略(p=0)时,模型仅在完整比特率下表现最佳,码率降低时性能急剧恶化。当 p>0 时,模型在各个码率下性能稳健,且 p=1.0 时显存消耗最低,性能无损失。

端到端 vs 分阶段优化消融

端到端优化在所有指标上随着训练步数增加持续提升,而冻结编码器的方案会早期饱和,证明了联合优化对缩放的关键作用。

扩展性实验

在 319M、505M、710M、1169M 四个参数规模下验证,发现参数和量化深度必须协同缩放。在极低比特率下,比特率本身比参数量更成为瓶颈。

ASR 结果

基于 TAC tokens 的 1.7B LLM-ASR 在 LibriSpeech test-clean 上 WER 为 2.96,AISHELL-2 iOS 上 CER 为 3.44,展现了与专用编码器方案竞争的性能。

一般音频/音乐下游

AudioCaps 上 TAC 生成 FAD (8.77) 远优于 Mimi (13.08) 和 MiMo (13.19)。MusicCaps 上 FAD 6.88,各项指标全面占优。

🔬 细节详述

  • 训练数据:共约 3.09M 小时音频,包括 2.208M 小时语音、30k 小时音效、850k 小时网络音频。文本监督方面,含 8k 小时多说话人 ASR、2.86M 小时 ASR、10k 小时音频字幕和 210k 小时纯重建音频。网络爬取音频由内部流程自动标注,所有音频重采样至 24kHz 单声道。此数据规模远超多数基线模型所用的公开数据集。
  • 损失函数:总损失各权重为 \(\lambda_{\text{sem}}=20, \lambda_{\text{rec}}=15, \lambda_{\text{cmt}}=0.25, \lambda_{\text{code}}=1.0, \lambda_{\text{adv}}=1.0, \lambda_{\text{feat}}=2.0\)。
  • 训练策略:使用 AdamW 优化器,bf16 精度训练。生成器学习率 1e-4,权重衰减 0.01;判别器无权重衰减。两阶段训练合计 1.02M 步。
  • 关键超参数:因果 Transformer 滑动窗口长度为 10s;RVQ 32 层,码本大小 1024,因子化维度 8;辅助 LLM 为 0.5B Qwen2.5 架构;TTS Temporal Transformer 在消融实验中用 Qwen3-1.7B 初始化,Depth Transformer 为 4 层,hidden 1536,FFN 8960;TTS 训练 batch size 1.35M tokens,学习率 2e-4,Progressive Sequence Dropout p=1.0。
  • 训练硬件与时间:完全未提及 GPU 类型、数量和总训练时间。
  • 推理细节:流式推理时,batch RTF 为 0.001254(batch=16),单帧整体延迟约 105ms(编码约 55ms,解码约 50ms),所有同构模型变体延迟相近。

⚖️ 评分理由

  • 创新性 (1.4/2):提出纯 Transformer 端到端音频分词器,并与联合缩放研究紧密结合,路径明确。Progressive Sequence Dropout 对可变码率 TTS 是一个简洁有效的贡献。但核心组件(RVQ、判别器、LLM 多任务监督)均为已有技术,更多是系统性的架构重设计和经验验证,并非范式级颠覆。
  • 技术严谨性 (1.3/1.5):架构描述完整,设计了配套的训练(两阶段、端到端 vs. 分阶段对比)和生成策略,逻辑自洽。大规模的消融实验(端到端、dropout概率、模型参数、LLM初始化)很好地支撑了核心论点。主要扣分项是缺乏对因果 Transformer 下重建与语义权衡的深入理论分析;推理延迟的工程权衡讨论也不够充分。
  • 实验充分性 (1.3/1.5):基线选择全面,覆盖了主流开源分词器和多种TTS模型。重建评测涵盖语音、音效、音乐三个领域,指标客观全面。但TTS和ASR的优异表现极大程度上依赖海量内部数据,与公开数据训练的基线对比存在不公平性,使得纯粹的架构优势难以被独立评估。音乐/音频下游评估仅用3000小时数据,规模较小,结论普适性有待验证。
  • 清晰度 (0.8/1):论文结构清晰,图、表和核心方法描述直观。但训练细节(硬件、时间)的缺失严重损害了读者对方法可行性的直观感知,这不符合顶会论文对复现细节透明度的要求。
  • 影响力 (1.2/1.5):若开源,TAC 将为音频社区提供一个强大的通用分词工具,其缩放经验对后续研究有很高的参考价值。但目前完全闭源的状态使其实际推动力大打折扣,更像是一个供工业界参考的标杆而非社区共建的基础设施。
  • 开源 (0.0/1.5):论文未提供任何代码仓库、模型权重或训练数据链接,也无相关开源计划声明,属于完全闭源。
  • 可复现性 (0.2/0.5):附录提供了详细架构和超参数,纯学术团队可进行小规模复现验证。但训练数据(2.86M小时内部ASR等)、内部标注pipeline和硬件环境全部未公开,完整复现几无可能。
  • 工程/实践价值 (0.9/1.5):贡献了一套完整的端到端音频分词和TTS流水线,包含流式、可变码率等实用特性,工程细节相对充分。对希望构建类似系统(尤其是拥有海量内部数据的团队)有指导价值。但过高的推理延迟(单帧>100ms)和完全闭源是实际落地的重要障碍。

🚨 局限与问题

论文自认局限:下游评估侧重于语音,更多音频域和生成设定留作未来工作。

审稿人发现的潜在问题:

  1. 完全闭源带来的科学危害:代码、模型、数据均不开源,使得所有声称的“可扩展统一接口”无法被学界检验、复现和公平对比,严重削弱了此工作的科学价值。
  2. 不公平对比:声称“优于”或“达到SOTA”的结论建立在不公平的基础上。TTS和ASR使用了远超多数开源基线的内部数据,重建任务使用了2.86M小时ASR数据。性能优势难以纯粹归因于架构创新,更像是一次大规模数据工程的胜利。
  3. “端到端”标签的过度宣传:论文强调的“完全不使用预训练编码器”,但TTS的Temporal Transformer却用了Qwen3-1.7B的预训练权重初始化。虽然消融称这表明初始化的影响不大,但最终SOTA模型的宣称仍部分受益于外部的、规模更大的语言模型。
  4. 语义与声学的根本冲突未解:尽管引入了语义损失,但实验显示加入对抗训练后ASR指标有所下降。论文未深入探讨在如此大规模的端到端框架下,语义理解和声学保真之间是否仍存在根本性的竞争,以及如何系统地缓解。
  5. 推理延迟的工程挑战:纯 Transformer 编码解码的单帧延迟达到约 105ms,这对于需要实时语音交互的场景(如语音助手、MOSHI式的全双工对话系统)是一个明确的短板,而论文对此一笔带过,未进行任何工程优化探讨。

← 返回 ICML 2026 论文速递