英文题目:Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling

会议身份:conference:interspeech:2026:conference-paper-id:yano26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #参数高效微调 #大语言模型 #语音 #语音识别

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Kazuki Yano:机构信息未能从会议 PDF 纯文本可靠映射
  • Jun Suzuki:机构信息未能从会议 PDF 纯文本可靠映射
  • Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为离散化语音token序列与文本指令,输出为转写或按指令生成的文本,难点在于语音持续预训练会灾难性遗忘文本大语言模型已习得的语言与指令能力。方法链分四步:先按OpusLM范式将语音离散化为语义加声学token并追加到原词表尾部,再在冻结文本模型中插入占原层数25%的新层并仅训练新增嵌入与新层,接着对新增层采用函数保持初始化使其初始为恒等映射,最后语音任务用全模型推理而纯文本任务丢弃新增层以精确恢复原模型。相比全量微调与低秩适应,其机制差异在于完全不改动原权重而用新增深度吸收跨模态失配,保留原始计算路径的可逆性。在LibriSpeech test-clean与test-other上,1.7B规模的交错式E-Branchformer变体以0.75B可训练参数取得2.3%与5.3%词错率,持平或优于全量微调的2.3%与5.6%,而文本平均分仅下降6.8%,远小于全量微调的32.6%。结论边界限于英文自动语音识别与SmolLM2系列,未验证多语言多任务与长时推理下的保持能力。原文未披露训练推理部署成本与代码模型数据发布。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要保留什么?

本文的输入是两类序列。第一类是已经在大规模文本上训练好的自回归大模型,实验用 SmolLM2 系列的 360M 和 1.7B 两个尺寸,分别有 32 层和 24 层,文本预训练量级达到 11T 词元。第二类是英语语音转换成的离散语音词元,做法是沿用 OpusLM 路线,把语义词元与声学词元组合后追加到原文本词表之后,形成统一的文本加语音大词表。目标是让同一个模型能做自动语音识别,也就是听一段英文朗读,直接生成对应的英文转写,同时在只给文本时仍能做问答、常识推理和指令跟随。

必须保留的信息有 3 条。第一是原模型权重在语音训练中是否被修改,这是能否精确恢复文本能力的关键。第二是新增参数的数量与位置,因为它决定语音容量和推理开销。第三是评价是否在无文本回放条件下进行,本文明确训练时不混入纯文本数据,就是要孤立地检验结构本身对遗忘的抑制作用。

输出是 1 篇可复述的方法解读:先讲清为何全量微调和低秩适配在此任务上遗忘严重,再讲清冻结加插层的完整数据流,最后用可核对的识别词错率与 8 个文本基准平均分说明收益与代价。本文没有公开代码、模型或数据的可用声明,证据中资源状态为无绑定,因此所有复现讨论只依据正文报告的配置,不声称任何链接当前可用。

持续预训练 × 灾难性遗忘: 持续预训练指拿已经在文本上训练好的大模型,再在语音离散序列上继续做自回归训练以获得听的能力;灾难性遗忘指这个第二阶段把第一阶段的文本问答和指令能力冲掉。本文把二者绑在一起:正因为持续预训练要改权重才会遗忘,所以后文冻结原有权重、只让新增层学习语音,才成为有针对性的解法。

沿一个样本走一遍有助于建立直觉,这只是一个教学例子,不代表论文用过该句子。假设输入是一段朗读的离散语音词元序列,模型先经过词嵌入查表得到向量,再自下而上经过冻结的文本 Transformer 块与新插入的可训练块的交替堆叠,最后由语言模型头逐词预测转写文本。训练监督只来自语音识别的转写目标,没有额外的翻译或总结监督。推理分两种模式:需要听时保留全部层,需要纯文本时丢掉新增层。理解这条分叉是理解全文实验的前提。

同样做语音大模型,前人路线为何仍会丢文本能力?

语音大模型目前有两条主流接入方式。一条是用连续语音编码器接大模型,编码器输出作为前缀嵌入输入;另一条是用离散语音词元,直接扩词表后让大模型做统一序列建模。本文属于后者,明确扩词表并训练新增嵌入。两条路线在做语音持续预训练时都报告了文本能力下降。

为缓解下降,前人试过文本数据回放,即在语音训练中混入纯文本继续训练。但回放需要额外文本数据并按比例增加训练量,且多数开源权重模型并不发布原始预训练数据,忠实回放实际上不可行。另一条是低秩适配,只训练低秩旁路而冻结主权重,被认为更抗遗忘并在语音大模型中广泛使用。本文的对照显示,在本研究的 48k 小时纯识别训练下,低秩适配并未保住文本,反而在两个尺寸上都出现大幅下降,小模型上识别本身也很差。

这说明跨模态需要的变换可能不是低秩的。在更广的持续语音学习中也有经验回放研究,但本文有意不用回放,以检验结构方法的独立效果。深度扩展在文本领域已有工作,通过复制插入层来做继续预训练,并研究了零初始化、恒等初始化和最优传输初始化。本文把它推广到跨模态,并系统研究插入位置与新增层结构,这是与文本域扩展工作的区别。

深度扩展 × 低秩适配: 深度扩展的分工是通过增加新层来提供新容量,原有矩阵完全不动;低秩适配的分工是在原有矩阵旁加低秩旁路,原有矩阵虽冻结但前向路径仍被旁路扰动。搭配理由是两者都想省文本数据回放,但本文论证低秩容量不足以跨模态,而新增整层能提供完整的注意力加前馈变换,因此选择深度扩展作为主路线。

问题到底难在哪里:要学新模态,又不能动老知识?

困难来自表示冲突与优化耦合。如果直接全量微调,原文本层的注意力与前馈参数会被语音梯度大幅改写,语言知识随之漂移。论文在 1.7B 上报告全量微调后 8 个文本基准平均分从 69.0 掉到 36.5,下降 32.6 分;在 360M 上从 56.8 掉到 34.6,下降 22.2 分。这不是某个单题的波动,而是平均分的大幅塌陷。

低秩适配虽冻结主权重,但旁路输出仍加到主路径上,推理时若保留旁路,文本路径已被改变;若去掉旁路,语音能力又丢失。本文数据显示低秩在 1.7B 上文本平均分掉到 33.4,比全量微调还低,说明冻结主权重不等于不干扰。另一难处是语音信号兼具长程语言结构与局部声学连续性,纯文本 Transformer 的全局注意力对后者建模效率不高,需要局部卷积类归纳偏置。

因此问题可表述为:在不修改原函数、不依赖文本回放的前提下,在何处、以何种结构增加多少容量,才能同时装下语音声学与保持文本语义。新增太少则识别上不去,新增位置不当则要么语音学不好,要么文本干扰大。后续方法正是围绕位置与结构两个自由度展开。

冻结加插层的方法全景:数据走哪条路,哪些参数可动?

方法全景可分为 4 步。第一步是词表扩展,把离散语音词元追加到原词表,调整嵌入层尺寸,训练时只更新新增嵌入行,原文本嵌入行冻结。第二步是深度扩展,在原有 n 层中插入 m 层,实验取 m 为 n 的 25%,即 360M 插入 8 层、1.7B 插入 6 层,所有原层冻结,只有新增层可训练。第三步是结构选择,新增层可以是与原模型同维的标准 Transformer 层,也可以是同隐维的 E-Branchformer 层,后者多一路卷积局部支路。第 4 步是推理分支,语音任务用全模型,纯文本任务可丢弃新增层以精确恢复原模型。

训练目标是标准的识别序列建模,上下文最长 8192 词元,优化器为 AdamW,峰值学习率 1 乘 10 的负 4 次方,预热 25,000 步后线性衰减到 2 乘 10 的负 5 次方。评估时识别用贪心搜索测 LibriSpeech 的干净集与其他集词错率,文本用 8 个常用基准的平均分及其相对预训练的变化量。下图把冻结与可训练的交错关系画了出来,是理解参数冻结与梯度路径的关键。

这段导读帮你带着问题看图:先分清左右 2 个模型谁是起点谁是终点,再看新增块插在哪里、谁冻结谁训练,最后确认文本与语音输入分别从哪里进入。

看图路径: 1. 先从底部向上看:左侧文本输入进预训练模型,右侧语音输入进语音模型,主干都是自下而上的堆叠;2. 再数右侧交替出现的灰色冻结块与黄色可训练块,确认新增块是插在原块之间而非整体外挂;3. 对照左右两侧的浅蓝色横向箭头,理解右侧冻结块的权重直接来自左侧对应层;4. 注意雪花与火焰图标的分工:雪花表示冻结不更新,火焰表示仅该块参与语音训练

原论文 Figure 1:Proposed multimodal depth up-scaling strategy for Speech LM adaptation: trainable E-Branchformer…

论文图 1。原论文 Figure 1:“Proposed multimodal depth up-scaling strategy for Speech LM adaptation: trainable E-Branchformer blocks are interleaved with frozen transformer blocks to acquire speech ca-…”。

从实际收到的像素看,左侧为预训练语言模型,自下而上是 3 个灰色 Transformer 块,底部标注文本输入。右侧为语音模型,自下而上交替出现灰色 Transformer 块与黄色 E-Branchformer 块,底部标注语音输入。灰色块右上角带雪花标记,黄色块右上角带火焰标记,分别对应冻结与可训练。左侧各块有浅蓝色箭头指向右侧对应冻结块,顶部还有一条标注多模态深度扩展的粗箭头,表示整体的扩展方向。黑色向上箭头表示主干前向顺序。

该图只示意交错思想,实际插入数量按 25% 计算,不是图中画出的层数。推理开销随新增层线性增加,丢弃后开销消失,这是后文讨论成本的基础。

新层放在哪里:五种位置如何影响语音与文本?

位置是第一个可控变量。论文比较 5 种策略。交错式把新增层均匀分布在所有原层之间;底部集中放在下半部分;中部集中放在中间。

顶部集中放在上半部分;三明治式放在底部与顶部各 1/4 处。每种策略的新增参数量相同,只是分布不同。直觉是底部更接近声学特征,中部偏向音素与词汇,顶部偏向语言生成,均匀分布则每层都有机会校正。初始化上,新增标准 Transformer 层复制对应原层并把注意力输出投影与前馈输出投影置零,利用残差连接使新层起点为恒等映射,即输入等于输出。

这样扩展后模型初始行为与原模型一致,训练再逐渐偏离。梯度只流经新增层与新增嵌入,原层不参与更新,因此原权重在数值上保持不变。实验结论是交错式识别最好,三明治次之,顶部、中部、底部识别更差;但文本保持顺序大致反转,顶部保持最好,交错居中。这说明分布越广,语音适配容量越大,但对原计算路径的扰动也越大。

复现时应先固定交错式做主结果,再补其他位置做对照,不宜只报最优位置。

标准 Transformer 层 × E-Branchformer 层: 标准 Transformer 层的分工是先多头自注意力抓长程依赖,再前馈网络逐点变换;E-Branchformer 层的分工是并行两路,一路仍用注意力抓全局,一路用卷积门控单元抓局部声学纹理,再经拼接加深度卷积融合。搭配理由是冻结的原文层已擅长全局语言建模,新增层只需补足语音特有的局部连续性,所以用语音识别专用结构做新增层能以相近文本代价换来更低词错率。

新增层内部算什么:E-Branchformer 的两路与融合如何工作?

当新增层选为 E-Branchformer 时,计算与标准层不同。标准层是串行两步,先多头自注意力加残差,再前馈加残差。E-Branchformer 是先并行两路,再融合加前馈。全局支路对层归一化后的输入做多头自注意力,捕捉长程依赖;局部支路对同样输入做门控多层感知机内的卷积空间门控单元,捕捉局部声学模式。

两路输出拼接成 2 倍维度,经深度卷积做空间细化,再经合并投影矩阵压回原维度,加残差后送入单个前馈网络。本文为简化只用一个后置前馈,而非原始的麦卡龙式前后两个半步前馈。一个关键细节是文本词元在新增层中绕过卷积支路与合并模块,只用注意力输出,这是为了避免卷积破坏文本表示。函数保持初始化不能直接照搬标准层的双零投影,因为两路共享一个合并投影。

做法是把合并投影初始化为上为单位矩阵、下为零矩阵的分块矩阵,同时把注意力输出投影与深度卷积输出投影置零。此时注意力输出为零,拼接后经合并投影仍为零,整层退化为恒等。下节训练部分会说明该初始化的实测收益。

函数保持初始化 × 层丢弃推理: 函数保持初始化的分工是让新层在训练起点表现为恒等映射,不扰动预训练表示;层丢弃推理的分工是在纯文本使用时直接移除新层,精确恢复原模型。搭配原因是只有起点不破坏,训练过程才稳定渐进,而只有原权重从未被修改,丢弃才有数学上的精确性保证,二者共同构成文本零退化的兜底机制。

训练时谁更新、梯度走哪里、监督从何而来?

训练时可更新的是新增的 Transformer 或 E-Branchformer 层参数,以及扩词表后新增的嵌入行。原模型全部 Transformer 层与原文嵌入行冻结,不接收梯度更新。梯度路径只经过新增层内部的注意力、前馈或卷积分支,以及新增嵌入,不回写到原权重。监督来源是英语自动语音识别的配对数据,输入为离散语音词元序列,目标为对应转写文本,损失为标准的下一词预测,没有文本回放损失,也没有额外的翻译或总结损失。数据来自 OWSM 3.2 套件中的英语识别子集,总量约 48k 小时。

优化用 AdamW,峰值学习率 0.0001,预热 25000 步后线性衰减到 0.00002,最大上下文 8192 词元。论文未报告批量大小、总步数、硬件型号与耗时,因此无法核算训练预算,这是复现时的缺项,需自行按显存与吞吐补测。新增嵌入的初始化方式、语音词元分词器的具体码本大小在正文未展开,只说明沿用 OpusLM 与相关工具包做法,复现需回到那些引用实现。

需要强调的是,冻结不等于输出确定,解码仍用贪心搜索,相同输入下贪心是确定的,但训练本身的随机性与数据顺序仍会影响最终权重,不能把冻结理解为全系统无随机性。

实验条件如何对齐:数据、基线、指标与参数量?

数据条件是只用英语识别数据训练,不混文本,目的是检验无回放时的文本保持。评估分两端。识别端用 LibriSpeech 的测试干净集与其他集,指标为词错率,越低越好。文本端用 8 个基准,包括 ARC 简易与挑战集、BoolQ、HellaSwag、OpenBookQA、PIQA、WinoGrande 和 MMLU,用统一评测工具测平均准确率,越高越好,并报告相对预训练模型的差值。基线有两个。

一是全量微调,更新全部原参数,不新增层。二是低秩适配,冻结主权重只训练低秩旁路,为公平起见把秩调得很大以对齐可训练参数量,360M 用秩 144 对应 0.20B 可训练参数,1.7B 用秩 356 对应 0.66B 可训练参数,远大于常用的秩 16,这已是对低秩有利的设置。深度扩展的新增量为原层数的 25%,360M 新增 8 层约 0.20B 参数,总量约 0.51B;1.7B 新增 6 层约 0.66B 参数,总量约 2.27B。E-Branchformer 因合并模块与卷积分支会略多一点,360M 为 0.22B,1.7B 为 0.75B。

报告文本分数时,深度扩展默认保留新增层参与推理,以考察干扰;另说明丢弃后可精确恢复预训练分数,差值为零。比较时需注意参数口径:全量微调的可训练量等于全模型,而深度扩展的可训练量仅为新增部分,推理总量则更大。

主结果:识别追上全量微调了吗,文本保住了多少?

先看 1.7B 上最强的对照问题:在可训练参数少约 60% 的条件下,语音专用新增层能否在识别上追平全量微调,同时大幅减少文本退化。表中词错率越低越好,文本平均分越高越好,变化量负得越少表示遗忘越轻。

方法可训练参数干净集词错率其他集词错率文本平均分
全量微调1.87B2.35.636.5
E-Branchformer 交错扩展0.75B2.35.362.3

全量微调在 1.7B 上干净集 2.3、其他集 5.6,文本从 69.0 掉到 36.5;E-Branchformer 交错扩展干净集同样 2.3、其他集 5.3 略优,文本 62.3,仅下降约 6.8 分。按退化幅度换算,减少幅度超过 75%,且可训练参数少约 60%,与摘要宣称一致。

标准 Transformer 交错扩展在 1.7B 上为干净集 2.4、其他集 5.5、文本 60.8,已接近全量,但仍弱于 E-Branchformer。在 360M 上,全量微调干净集 2.7、其他集 6.0,文本 34.6;交错标准扩展干净集 3.1、其他集 6.7,文本 54.9,识别差距比大模型时更明显,说明小模型下新增 25% 仍不足以完全弥补容量。低秩在 360M 上干净集 11.3、其他集 17.3,识别完全落后;在 1.7B 上干净集 3.2、其他集 7.1,仍弱于扩展,且文本 33.4 差于全量。

这支持低秩容量不足以跨模态的判断。需要同时看到代价:保留新增层时仍有数分文本下降,且推理层数多 25%;只有丢弃新增层才能零退化,但此时语音能力也一并失去,因此同一前向不能兼得两端最优。

位置与初始化的反证:换个放法或随机初始化会怎样?

先看位置的对照问题:在可训练量相同、仅分布不同的条件下,识别与文本保持是否此消彼长。表中词错率越低越好,文本分越高越好。

方法与位置可训练参数干净集词错率其他集词错率文本平均分
交错标准扩展200M3.16.754.9
顶部集中扩展200M3.57.555.9

在 360M 上,交错式干净集 3.1、其他集 6.7,顶部集中为 3.5 与 7.5,交错识别明显更好;文本上顶部 55.9 略高于交错的 54.9,保持更好。在 1.7B 上同样规律,交错干净集 2.4、其他集 5.5,顶部为 2.9 与 6.3,而文本顶部 66.4 远高于交错的 60.8。

三明治居中,底部与中部在两端都不占优。这构成未胜出项的证据:顶部虽文本最好但识别最差之一,不能只看文本就选顶部。初始化方面,在 1.7B 的 E-Branchformer 上,函数保持初始化干净集 2.3、其他集 5.3、文本 62.3,而合并投影随机初始化为 2.5、5.5、62.1,识别端稳定优于随机,文本端基本持平。这支持起点恒等有助于稳定适配的解释。

论文还报告三任务的零样本语音指令例子:给出口语内容加英文指令,要求直接生成法语翻译、简化改写与单句总结,深度扩展能给出连贯答案,全量微调则退化为重复无意义词元。但该部分为定性展示,无自动指标与统计检验,只能视为文本保持的旁证,不能当作翻译质量的定量结论。

边界在哪里:哪些结论不能推广,哪些成本没测?

第一,任务边界窄。训练与评估都集中在英语自动语音识别,LibriSpeech 的干净集与其他集不能代表口音、噪声、远场或多语情况,论文结论不能直接推广到翻译、对话或多语识别。第二,文本评估虽覆盖 8 个基准的平均分,但未报告误判率、幻觉率或生成式指令的系统评分,定性 3 例不能替代统计。第三,成本缺项多。训练侧未报告 GPU 型号、数量、时长与能耗,无法比较回放与扩展的真实预算。

推理侧只说明新增 25% 层带来开销,丢弃后开销消失,但未测首词延迟、吞吐或显存占用,不能承诺延迟改善。第四,结构细节依赖引用实现。语音离散化、嵌入初始化、E-Branchformer 中文本绕过卷积的具体掩码实现,均需回到 OpusLM 与相关工具包,本文未给出完整伪代码。第五,低秩对照虽已放大秩到 144 与 356,仍可能存在学习率与初始化未最优的可能,但至少在本文统一优化条件下,低秩同时输掉识别与文本。

第六,模型规模只到 1.7B,更大模型上交错与全量的差距是否继续缩小待验证,不能从趋势断言必然反超。区分措辞很重要:识别追平与文本减少退化是直接报告,卷积分支帮助局部建模是有限解释,而更大规模一定更好则是未验证推测。

要复现先做什么:按什么顺序搭出可运行的对照?

第一步先复现基座与数据管线。下载 SmolLM2 的 360M 与 1.7B 权重,按引用方法把语音转成离散词元并扩词表,冻结原文嵌入,只让新增嵌入可训练。先用小子集验证前向维度与掩码:确认文本词元在 E-Branchformer 新增层中只走注意力,不进卷积与合并模块。第二步实现深度扩展。按 25% 比例插入新层,360M 插 8 层、1.7B 插 6 层,先做交错式。

标准层复制对应原层并置零注意力与前馈输出投影;E-Branchformer 层按分块单位加零矩阵初始化合并投影,并置零注意力与深度卷积输出投影,验证初始时新层为恒等。第三步对齐训练。用约 48k 小时英语识别数据,只做识别目标,不混文本,优化器用 AdamW,峰值学习率 0.0001,预热 25000 步后线性衰减到 0.00002,上下文 8192,解码用贪心。第 4 步跑全对照:全量微调、低秩大秩版本、5 种位置、两种新增结构,分别记录两集词错率与 8 基准平均分,保留新增层与丢弃新增层各测 1 次文本。

关于可用性,本文证据未绑定任何经校验的代码、模型或数据资源,因此只能写本次未能确认公开链接可达,不写已公开或当前可用。若要补验证,优先补训练耗时与推理延迟,以及噪声与其他英语测试集的识别稳定性,再补生成式指令的自动评分。

何时值得尝试这种冻原加新层的方法?

当同时满足 3 个条件时值得尝试。第一,你的起点是一个文本能力很好的开源大模型,且你没有它的原始文本预训练数据,做不了忠实回放。第二,你的目标任务可用离散序列统一建模,且你能接受语音使用时多约 25% 的层开销,纯文本使用时通过丢弃新层回到原模型。第三,你更在意文本指令能力的保留而非单点词错率的极限压缩,因为本文最强点是大幅减少遗忘而非在所有规模上都显著超越全量。

不适合的情况也很明确:如果必须在同一前向内同时达到最优识别与最优文本,或部署预算不允许增加深度,或任务超出英语干净朗读很多,都不应直接套用本文数字。教学上最易误解的是把冻结等同于无干扰,实际上保留新增层推理时文本路径已被改变,干扰大小取决于位置与结构;只有丢弃才是精确恢复。另一误解是把低秩失败理解为低秩无用,本文只证明在给定大秩与统一优化下低秩不足以跨模态,不否定其他调参与混合回放的可能。

回到中心矛盾:跨模态需要整层级的新变换,而非旁路微调;把新变换隔离在新增层中,并给语音专用结构留出局部建模位置,就能在少约 60% 可训练参数下换来可比识别与超过 75% 的遗忘减少,代价是结构性推理开销与任务分支管理。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总