英文题目:MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis

会议身份:conference:interspeech:2026:conference-paper-id:nguyen26c_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #高效推理 #语音 #文本到语音

评分:6.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Tan Dat Nguyen:机构信息未能从会议 PDF 纯文本可靠映射
  • Sangmin Bae:机构信息未能从会议 PDF 纯文本可靠映射
  • Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射
  • Ji-Hoon Kim:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

LLM文本到语音以文本输入生成语音词元输出,自回归注意力二次复杂度使长序列显存与计算激增。MamTra交错保留部分Transformer负责全局语义、其余替换为Mamba-2负责局部时序,避免纯线性化丢失全局上下文。先搜索杂交位置与比例,在交错、连续与数据驱动七种策略及1:1至1:11比例中优选骨干布局进入映射。再去掉Softmax用结合律得到循环隐状态,把教师查询、键、值投影直接拷贝为Mamba-2的输出投影\(C_t\)、输入参数\(B_t\)与输入投影\(x_t\)完成初始化。最后冻结教师,用真值交叉熵、教师-学生logits偏斜KL与词元嵌入均方误差联合蒸馏学生以恢复生成行为。在Seed-TTS-eval英文集上1:1 BlockBeg相对教师CosyVoice 2词错率(Word Error Rate, WER)从2.03%升至2.28%,绝对上升0.25个百分点,自然度主观分(Naturalness Mean Opinion Score, NMOS)3.66对3.68基本持平,2048上下文每词元节省约1.4e11次浮点运算,A6000上推理显存降低约34%。结论限于LibriTTS约0.5k小时英文朗读微调与3至27词英文朗读加1至62词长度压力集验证,1:11激进替换可懂度明显退化,未验证多语种、噪声提示与播客级超长部署,未报告端到端延迟吞吐与完整训练时长。该适用边界受限于英文朗读场景,激进替换失败条件与超长部署尚未验证,推理开销只报计算量与硬件显存未测延迟吞吐。

🔗 开源与复现资源

  • 演示资源:https://mm.kaist.ac.kr/projects/mamtra/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

长语音合成卡在哪里:要全局连贯又要装得下?

输入是文本加一段参考语音,目标是生成自然、多说话人、可懂的长语音。刚入门容易以为把文本丢给大语言模型加声码器就结束,但原文强调的瓶颈在骨干网络。主流方案用自回归 Transformer 做语言模型式语音合成,一个 token 一个 token 往外吐,每个新 token 都要看前面全部历史。自回归 Transformer 这个术语初学者可理解为边看历史边写下一个音频 token 的全局建模器。它的好处是韵律、语义、跨句连贯都能建模,代价是自注意力要算两两相似并缓存全部键值。当合成播客、有声书或流式对话这种长序列时,计算和显存随长度平方增长,延迟变大,边缘设备放不下。

自回归 Transformer × 2 次复杂度: 自回归 Transformer 负责逐个 token 依赖全部历史做全局语义和韵律建模,分工是保质量;2 次复杂度指注意力计算和键值缓存随序列长度平方增长,分工是决定成本。二者搭配的原因是质量来自全历史可见,代价也来自全历史可见,组合意义是长播客和有声书场景下必须先承认这个矛盾,后续的稀疏化、缓存压缩或线性化都是在动这个矛盾的不同侧面。

论文的官方项目页当前可用,地址见资源状态为 available 的演示链接,本文事实仍以论文正文证据为准。学习这篇论文要先保留 3 个信息:教师是 CosyVoice 2 对应的预训练 Transformer,学生是把其中部分层换成 Mamba 的混合模型,训练数据只是教师英文数据的约 2%。输出上论文承诺更低的推理显存和每 token 计算量,同时尽量不损失可懂度和自然度。后面各节就按这个依赖展开:先看有哪些路线,再看混合体怎么做,再看怎么初始化和蒸馏,最后看实验条件和反例。

已有路线如何省计算:改注意力还是换掉注意力?

同输入同目标的路线有两类。第一类是留在注意力框架内省钱,例如分组查询注意力、稀疏注意力、剪枝,以及推理侧的键值缓存压缩和推测解码。原文明确把它们定性为 2 次机制上的优化,不是结构替换,意思是注意力还是两两比较,只是算得少一点或存得少一点。第二类是把计算原语换成线性注意力或状态空间模型,Mamba 是代表。白话说,选择性状态空间模型就是用一个随当前输入变化的压缩状态往前递推,记住该记的、忘掉该忘的,训练时用并行扫描加速,推理时每步只更新固定大小状态。

选择性状态空间模型 × Mamba: 选择性状态空间模型负责用随输入变化的递推状态压缩历史,分工是把解码做到线性时间和常数级状态;Mamba 是该路线中加入输入依赖的离散化参数和并行扫描的具体实现,分工是让训练可并行、推理可递推。搭配原因是前者给原理,后者给工程可用的选择性遗忘与记忆机制,组合意义是为语音的局部声学连续性提供低成本建模器,但原文也报告纯该路线在大规模表达力和上下文学习上仍弱于 Transformer。

在语音任务里已有工作把 Mamba 用于分离、识别、合成和增强,报告了效率收益,但原文引用 prior 观察指出纯状态空间模型在规模、上下文学习和长上下文推理上仍弱于 Transformer。于是自然出现第 3 条路线:混合架构,隔层或分区混用两种块,让 Mamba 处理局部声学连续性,Transformer 保留全局语义推理。原文指出语音合成里的混合研究很少,唯一现有尝试是从零预训练且细节未公开,成本很高。这就引出本文选择:不从零训练,而是把预训练 Transformer 直接改造成混合体,用参数搬运加蒸馏恢复性能。

本文要回答的具体问题是什么?

问题不是做一个全新的合成器,而是给定一个已经很好的 Transformer 语音合成教师,能否只换掉其中一部分注意力层,用很少的数据和训练代价得到一个又快又好的学生。约束很具体:保留教师的感知质量,包括自然度、说话人相似度和可懂度;降低推理显存和每 token 计算量;训练数据只用 LibriTTS 上的约 0.51,000 小时,相对教师原始英文数据约 2%。评估要同时看效率和质量,效率看显存、缓存大小和每 token 浮点运算,质量看词错误率、可懂度、说话人相似度、客观自然度打分和人工自然度打分。词错误率越低越好,自然度和相似度越高越好。

教学上举一个例子帮助理解,但不代表论文数值:比如合成一句短提示和合成一章有声书,后者序列长得多,2 次项的差距会被放大,混合体的优势才显现。论文为此还专门构造了长度压力测试,文本从 1 个词到 62 个词,覆盖比常规评测更宽的长度,用来检验长上下文下的稳定性。

MamTra 全景:一个样本如何走完教师到学生?

沿一个样本走一遍。输入是文本 token 序列和说话人提示,先经过词嵌入得到表示,逐层经过保留的 Transformer 层和新插入的 Mamba 层,最后输出下一个音频 token 的 logits。教师路径是全 Transformer,学生路径是混合。构造分两步:先选位置替换,再做知识迁移。替换策略分交错、连续和数据驱动 3 类,交错指周期性保留 Transformer,连续指按前中后或三明治分组,数据驱动指按余弦相似度或词错误率重要性挑不重要的层换掉。比例从 1 比 1 到 1 比 11,冒号前是保留的 Transformer 份数,后面是 Mamba 份数,比例越大换得越激进。

下面这张总览图先帮你建立教师到学生的两条纵线,再看横向迁移箭头,读完再往下看文字解释会更顺。

看图路径: 1. 先看顶部 Teacher 与 Student 两列的纵向主路径;2. 再看横向绿色 Linearization 箭头连接的层对应关系;3. 最后看紫色 Multi-Level Distillation 箭头的起点与落点

原论文 Figure 1:Overview of the hybrid Mamba-Transformer configu- rations for speech synthesis.

论文图 1。原论文 Figure 1:“Overview of the hybrid Mamba-Transformer configu- rations for speech synthesis.”。

这张图显示左侧三块绿色 Transformer 纵向堆叠为教师,右侧红绿相间为学生,绿色横箭头标线性化,紫色长箭头标多级蒸馏。它的教学价值是把两件事分开:绿色箭头是结构初始化,解决起点问题;紫色箭头是训练监督,解决行为恢复问题。论文强调选择性层迁移降低训练成本并加速收敛,性能则靠蒸馏用不到 2% 的教师英文训练数据恢复。理解了这个分工,就不会把权重复制和蒸馏混为一谈。

混合架构 × 线性化: 混合架构负责决定哪些层保留 Transformer 做全局推理、哪些层换成 Mamba 做局部声学建模,分工是空间布局;线性化负责把去掉 softmax 后的注意力改写成键值累加的递推形式,分工是给出参数可迁移的结构对齐。搭配原因是只有先在数学上看到查询对应输出投影、键对应输入参数、值对应输入投影,才能把预训练权重直接搬运,组合意义是避免从零预训练,用初始化加蒸馏恢复性能。

权重如何搬运:查询键值与状态参数怎样对上?

组件细节是本文最需要核对的部分。Transformer 自注意力先算查询、键、值的投影,再做缩放点积加 softmax 加权。Mamba 则维护递推状态,状态更新用输入依赖的矩阵,输出用输出投影读出。原文的线性化思路是给注意力加因果掩码并去掉 softmax,利用结合律把查询从历史累加中解耦,得到键值乘积累加作为隐状态的形式。这样键值乘积对应状态空间的输入更新,键对应输入参数,值对应投影后输入,查询对应输出投影。白话说,就是把全局加权平均改写成可递推的累加器,数学形式对上了,权重才敢直接搬。

读这张权重复制图时,先看左右两块虚线框内的投影命名,再看箭头是否只覆盖对应 3 组。

看图路径: 1. 先对照左侧 Transformer 的 QKV 投影与右侧 Mamba 的 CBx 投影;2. 再看中间 Copy weights 箭头的方向与覆盖范围;3. 最后确认右侧新增的 A 与 Delta 分支是否参与复制

原论文 Figure 2:Following the alignment between Eq. 2 and Eq.

论文图 2。原论文 Figure 2:“Following the alignment between Eq. 2 and Eq. 4, pro- jection weights for C, B, and x in Mamba are initialized with Transformer’s Q, K, and V projection weights, respectively.”。

这张图左侧是教师的查询、键、值 3 组投影权重,右侧是学生的输出投影、输入参数、输入投影等,中间绿色箭头写复制权重。可见内容支持原文说法:查询投影搬到输出投影,键投影搬到输入参数,值投影搬到输入投影,而右侧的离散化相关参数不参与这次复制。解释段要强调这只是初始化,不是训练完成,去掉 softmax 非线性后表达能力已经改变,后续必须靠蒸馏补回生成行为,否则可懂度会掉。

训练目标与初始化如何配合:三项损失各管什么?

训练不是从零预训练,而是基于 CosyVoice 2 骨干做性能恢复和微调。优化器用 Adam,学习率和批大小按原文交代,趋势分析阶段训练 15 轮,最终严格对比训练 50 轮以保证收敛。监督来源有三项:交叉熵学真值输出,保证基本可懂;教师与学生 logits 之间的偏斜 KL 散度学生成行为,补回线性化丢失的细腻分布;词嵌入上的均方误差约束表示结构,对齐语义声学联合空间。总目标是三项相加,原文没有报告加权系数和冻结细节,哪些层冻结、梯度是否截断、嵌入层是否更新都属于缺项,复现时不能从模型名推定,只能先按全部可训练理解并记录假设。

权重重用初始化 × 多级蒸馏: 权重重用初始化负责把教师 Transformer 的查询、键、值投影权重分别搬到学生 Mamba 的输出投影、输入参数和输入投影上,分工是给起点;多级蒸馏负责用交叉熵学真值、用偏斜 KL 学教师 logits 行为、用均方误差对齐词嵌入表示,分工是给过程监督。搭配原因是去掉 softmax 后表达能力已改变,光有起点不够,还需行为和表示 2 级拉回,组合意义是只用少量数据就能收敛并保持自然度和说话人相似度。

下面曲线的读法是先看整体高度,再看相对顺序,最后看早期放大框,判断起点优势还是全程优势。

看图路径: 1. 先看横轴 Steps 与纵轴 Training Loss 的整体下降趋势;2. 再比较 Reused 虚线与 Xavier、Kaiming 曲线的相对位置;3. 最后看左上放大框中前 1000 步三条曲线的分离速度

原论文 Figure 6:Convergence speed after 15 epochs.

论文图 6。原论文 Figure 6:“Convergence speed after 15 epochs.”。

这张图横轴是训练步数到 20000 步以上,纵轴是训练损失,3 条曲线分别是随机初始化的两种常用方法和重用预训练权重的方法。可见内容是重用曲线从一开始就明显更低,下降更快,最终也保持最低,常用随机初始化起点高、收敛慢。这个现象支持原文判断:结构化初始化让混合模型从一开始就站在教师附近,因此只用很少数据就能恢复。需要提醒的是这是训练损失曲线,不是最终词错误率,不能直接当成合成质量证明,还要结合后面的评测表看。

实验条件如何保证可比:数据、基线与指标是什么?

数据与划分按原文交代。训练用 LibriTTS,评测用 Seed-TTS 评测集英文子集和 LibriTTS 干净测试集。常规评测文本长度 3 到 27 个词,另构造的长度压力集覆盖 1 到 62 个词,用于检验长文本鲁棒性。基线有 3 个可运行系统:CosyVoice 2 作为教师和直接对照,Llasa-1B 作为大参数 Transformer 对照,Zonos-v0.1 作为已有混合模型对照。硬件统一用英伟达 A6000,效率指标看显存、缓存和每 token 浮点运算,质量指标看词错误率、说话人相似度、客观自然度和人工自然度。人工评测是每模型随机抽 50 条、15 名听众打分,给出 95% 置信区间。

下面这张表把训练预算这件事讲死,避免把数据量小误解为训练轮数少,表前先提出问题:只用 2% 数据时,优化条件是否一致。

配置阶段硬件优化器学习率动态批大小训练轮数人工评测采样
趋势分析NVIDIA A6000Adam1e-540,000 tokens15 epochs50 utterances
最终严格对比NVIDIA A6000Adam1e-540,000 tokens50 epochs15 listeners

表后解释是预算要分开看:数据总量小不等于每步便宜,批大小和轮数决定了总步数,最终对比多训到 50 轮是为了让结论不受欠收敛影响。未胜出项也要记下:原文没有报告训练 wall 时间和总 GPU 小时,也没有报告推理延迟的端到端数字,只有显存、缓存和浮点运算,因此不能把效率直接翻译成快了多少毫秒。统计方法上只有人工打分的置信区间,客观指标没有报告显著性检验,这是明确的验证边界。

主结果:显存降了多少,质量付出什么代价?

先问比较问题:在同一评测集、同一缓存开启条件下,混合体相对教师和已有混合体,效率收益是否成立,质量代价有多大。指标方向是显存和每 token 浮点运算越低越好,词错误率越低越好,自然度和相似度越高越好。论文报告 1 比 1 配置相对 CosyVoice 2 降低约 34% 显存,相对 Zonos 约 17%,上下文 2048 时每 token 最多省约 1.4e11 次运算,词错误率绝对上升约 0.25%,感知指标基本持平。更激进的 1 比 3 和 1 比 5 继续省计算但词错误率逐步上升,1 比 11 则掉到已有混合基线之下,说明存在明确的效率质量权衡。

对比维度评价指标教师侧条件学生侧条件原文报告的差值与结论
推理显存VRAM usageCosyVoice 2MamTra 1:1reduces by up to 34%
推理显存VRAM usageZonos-v0.1MamTra 1:1reduces by 17%
每 token 计算FLOPs per tokencontext 2048hybridreduction up to 1.4e11
训练数据English databaselineMamTrajust 2% / only 2%
可懂度代价WERteacherMamTra 1:10.25% absolute increase

表后要讲收益与代价:收益来自 Transformer 层数减少带来的次平方计算和次线性缓存增长,代价是全局上下文建模能力被压缩。未胜出项是激进比例,虽然缓存更小,但在常规和压力测试下可懂度都变差,不能只看效率数字。另一个细节是长度压力下按词错误率选层的重要性策略反而比保守的 1 比 3 更稳,说明放哪里比留多少更关键,这为复现时的层选择提供了可操作的起点。

键值缓存 × Mamba 状态: 键值缓存负责保存 Transformer 剩余层随长度增长的全部历史键值,分工是保全局精度但随长度膨胀;Mamba 状态负责用固定尺寸压缩状态递推,分工是几乎不随长度增长。搭配原因是混合模型的推理缓存是两者之和,序列越长时 Transformer 残留层数决定斜率,组合意义是替换比例越高、保留 Transformer 越少,缓存随长度增长越平缓,这正是显存下降的直接来源。

读缓存图时不要把柱子总高度直接当成质量,纵轴是缓存兆字节,越高只是存得越多。

看图路径: 1. 先看横轴序列长度从 256 到 4096 的分组;2. 再比较同一组内 1:1 到 1:11 柱子中斜线 KV 部分高度变化;3. 最后看底部深色 Mamba 状态部分是否基本不变

原论文 Figure 5:Cache size growth in the hybrid model, where the sequence-length dependency scales with the…

论文图 5。原论文 Figure 5:“Cache size growth in the hybrid model, where the sequence-length dependency scales with the number of remain- ing Transformer layers.”。

这张图横轴是序列长度从 256 到 4096,纵轴是缓存兆字节,每组有 4 个比例的柱子,柱子底部深色窄条是几乎不变的 Mamba 状态,上部斜线是随长度膨胀的键值缓存。可见内容是序列越长,1 比 1 的斜线部分涨得最快,1 比 11 涨得最慢,底部状态基本持平。这支持原文的次线性增长判断,也解释了为什么长文本下混合体的显存优势更大。但这只是缓存,不是端到端延迟,实际部署还要测解码速度和首包延迟。

拿掉哪一块最疼:损失项与层位置的对照说什么?

消融按问题组织:三项损失是否都必要,层放在哪里最稳。论文在 15 轮的低成本设置下比较了不同比例和位置,发现周期性保留开头部 Transformer 的方案在各比例下交叉熵和词错误率都更低、方差更小,而把 Mamba 堆在前部或尾部等方案随比例变大更不稳定。当替换非常激进时,按词错误率重要性选层开始显现优势,因此最终选择是 1 比 1 和 1 比 3 用固定头部保留,1 比 5 和 1 比 11 用重要性选择。这是一个可复述的动作:先小比例扫位置,再大比例上数据驱动选择。

下面这张表聚焦损失项,问题是去掉每一项后语言准确性掉多少、感知质量是否跟着掉。

消融条件WER ↓CER ↓SSIM ↑UTMOS ↑原文解读
MamTra 1:13.482.860.724.16full objectives
w/o LCE6.704.320.724.15most severe degradation
w/o Llogits6.133.460.724.15generation behavior lost
w/o Lemb5.633.260.724.15representation misaligned

表后解释是三项主要打在语言准确性上,感知指标几乎不动,去掉真值交叉熵最疼,词错误率(%)从 3.48 升到 6.70,去掉 logits 蒸馏次之,去掉嵌入对齐也有明显损失。这支持多级蒸馏的必要性,但也划出边界:自然度和说话人相似度对这三项不敏感,不能用这张表证明音质变好。失败条件是 1 比 11 的激进替换,即使有蒸馏也可懂度明显恶化,说明蒸馏不能无限补偿全局层的缺失。

哪些结论还不能下:缺了什么验证?

先区分 3 类表述。直接报告的是显存、缓存趋势、每 token 浮点运算和评测集上的词错误率与主观客观分数。有限解释的是混合布局的优劣和初始化加速收敛,证据来自 15 轮趋势实验和最终 50 轮对比,支持但不等同于所有数据和所有长度都成立。未验证推测是边缘部署和实时流式的好处,原文没有给出端到端延迟、吞吐、首 token 延迟和不同硬件上的实测,不能承诺这些量一定改善。

缺项要具体点名:损失权重、冻结策略、梯度路径、随机种子、显著性检验、误判率分析都没有报告;训练总算力和推理帧率与实际延迟分开讨论,总体趋势不等于每组每步都成立;评测主要是英文,跨语言泛化未验证;教师本身的偏见和错误可能通过蒸馏传给学生,但论文没有测量这种继承。这些不是技术错误,而是复现和选型时必须补的验证。

要复现先做什么:最小可运行路径是什么?

复现顺序按学习依赖排。第一步拿到教师 CosyVoice 2 权重和 LibriTTS 划分,跑通原始评测管线,用同一工具算词错误率、说话人相似度和客观自然度,确认基线可比。第二步实现层替换,按 1 比 1 的头部保留策略把一半注意力层换成 Mamba-2,把查询、键、值投影权重分别复制到对应投影,离散化参数保持随机或默认初始化,不要猜教师没有的东西。第三步加上三项损失做蒸馏,先用 15 轮扫位置和比例,观察交叉熵与词错误率是否同向变化,再用 50 轮做最终对比。第四步在 256 到 4096 序列长度上记录缓存和显存,复现次线性趋势,同时记录延迟,避免只报缓存。

信息条件上,论文给了项目页链接且资源状态为 available,但正文没有说代码和权重是否公开,复现前要先确认可达性,不能把页面存在等同于一键可运行。超参数保留学习率 1e-5、动态批 40,000 tokens、A6000 硬件、人工评测 50 条 15 人,这些是保持可比的关键。常见误解是以为数据少就一定训得快,实际上小数据多轮仍可能过拟合,要盯住压力测试集上的词错误率,而不是只看训练损失下降。

何时值得尝试 MamTra,何时不值得?

值得尝试的场景是长文本、多轮对话或显存受限部署,且已经有一个好的 Transformer 语音合成教师,不想从零预训练。此时按本文路线,用头部保留的 1 比 1 或 1 比 3 起步,配合权重重用加三项蒸馏,能在很少数据下拿到可观的显存和计算节省,同时把词错误率代价控制在较小范围。不值得的场景是短句为主、对可懂度零容忍或没有教师可蒸馏,此时激进替换的收益有限,1 比 11 的退化已经说明上限。另一个不值得是把缓存下降直接当成延迟下降去立项, latency 需要另测。

收束时回到中心矛盾:全局语义需要看全历史,效率需要忘掉历史,MamTra 的回答是分工,让少数 Transformer 层看全局,让多数 Mamba 状态记局部,再用对齐的初始化和多级监督把两者缝起来。复现者先做可比基线,再做位置扫描,最后补延迟和跨长度验证;研究者下一步值得补的是损失权重敏感性、冻结策略、跨语言和真实硬件延迟,这样才能把次平方的理论优势变成可部署的收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总