英文题目:Merging the Knowledge of LLMs for Automatic Speech Recognition

会议身份:conference:interspeech:2026:conference-paper-id:futami26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#领域适应 #模型融合 #大语言模型 #语音识别

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Hayato Futami:机构信息未能从会议 PDF 纯文本可靠映射
  • Tatsuya Kawahara:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理基于大语言模型(Large Language Model,LLM)的自动语音识别(Automatic Speech Recognition,ASR)向目标文本域适配问题,输入为源域配对语音文本与目标域纯文本,输出为目标域转写文本,难点在于无目标域配对数据且大模型解码时融合开销过高。方法链分为三步:先在同一基座上分别训练源域语音识别适配器与源域和目标域语言模型适配器;再将目标域语言模型向量加到语音识别参数上实现域扩展,或进一步减去源域语言模型向量实现域迁移;最后引入稀疏合并(TIES-Merging)做截断选符号与掩码合并以抑制任务干扰。相比浅融合(Shallow Fusion,SF)与密度比(Density Ratio,DR)在每步解码调用外部模型,该机制把知识压缩进单组权重,推理保持单模型前向。在CSJ-SPS到CSJ-APS适配中目标评估集eval1字符错误率从13.9%降至13.3%,而英语LibriSpeech到SPGISpeech词错误率从11.2%降至10.6%。该结论适用边界受限于同基座同秩适配器与学术演讲和金融电话两类偏移验证,失败条件为增大语言模型系数会导致跨模态崩溃且增益不及显式融合。原文仅在NVIDIA RTX A6000上报告实时率不变,未披露训练硬件时间与完整部署成本统计。

🔗 开源与复现资源

  • 第三方资源:https://github.com/arcee-ai/mergekit — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,为什么换个领域就变差?

这篇论文研究的是端到端语音识别的领域适配。输入是一段声学特征序列,也就是声音波形经过前端处理后得到的帧序列,输出是对应的文字序列。端到端模型直接估计给定声音条件下文字序列的后验概率,训练需要大量配对的语音加转写文本。

论文的起点是这类模型在通用域表现很好,但到了缺少配对数据的特定领域就会明显变差。而纯文本相对容易收集,因此希望用目标域纯文本训练的外部语言模型去补救。例如日语从日常话题演讲适配到学术发表,英语从朗读书籍适配到金融电话会议,声音风格和词汇分布都变了。

初学者要先建立的动作是区分两种数据。配对数据同时提供声音和文字,用于训练识别器。纯文本只提供文字,用于训练语言模型。领域适配的约束是目标域只有纯文本,没有或很少有目标域配对语音,因此不能直接在目标域重训识别器。

论文要回答的是如何在不增加推理负担的前提下,把纯文本中的目标域知识搬进已经训练好的基于大语言模型的语音识别器。必须保留的信息是声音本身的声学证据和目标域的词汇句法偏置,输出仍然是文字序列,不能为了适应语言模型而破坏声学对齐。

已有路线如何用纯文本,代价各在哪里?

按输入、目标、监督和运行阶段划分,已有路线可以分为 3 类。第一类是语言模型融合,代表是浅融合与密度比融合。浅融合在束搜索每一步把识别器分数与目标域语言模型分数加权相加,密度比融合进一步减去源域语言模型分数以更好地做领域迁移。

它们的监督都来自目标域纯文本和源域转写文本,运行阶段在解码时介入。优点是目标知识在每一步显式参与,缺点是每步都要调用一个或两个大语言模型,计算开销大。论文还提到延迟融合试图隔几步算 1 次分数,但仍未消除额外调用。

第二类是后处理的重打分与生成式纠错。做法是识别器先解出多个候选,再用语言模型 1 次性打分或生成修正文本。监督同样是纯文本,运行阶段在解码之后。优点是只需 1 次语言模型调用,缺点是总参数量变大,且性能依赖候选多样性。

贪婪解码只有一个候选时基本无法施展,而近期基于大语言模型的识别器恰恰常用贪婪解码。第 3 类是训练时蒸馏。教师语言模型在训练阶段指导学生识别器,推理时不调用语言模型。监督在训练阶段使用,运行阶段无额外开销,但缺点是推理时模型固定,换一个目标域就要重新训练。

模型合并属于另一条路线,它既不在解码时调用语言模型,也不在训练时蒸馏,而是在参数空间做算术运算。论文把跨模态合并与以往单模态内合并区分开。以往是识别器之间或翻译模型之间的合并,这里是语音到文本模型与纯文本模型的合并。

论文把领域适配形式化成哪两类操作?

论文把问题拆成领域扩展与领域迁移。领域扩展对应浅融合。已有在源域配对数据上训练的识别器,加上目标域纯文本训练的目标域语言模型,希望在目标域变好,同时尽量不破坏源域。领域迁移对应密度比融合。

除上述两者外,再引入用源域识别训练转写文本训练的源域语言模型,通过减去源域偏置更彻底地转向目标域,但可能牺牲源域性能。形式化上,识别器估计给定声音的文字后验,语言模型估计文字先验。浅融合搜索使识别器对数概率加权目标语言模型对数概率最大的假设,密度比融合再减去加权的源语言模型对数概率。

论文明确指出两者都需要在束搜索每一步运行语言模型,这是大语言模型时代难以承受的成本。举例来说,如果基座是十亿量级的大模型,解码每步多跑一个同样量级的模型,显存和实时率都会显著恶化。

论文因此提出把公式层面的加减搬到参数层面。既然识别器和语言模型都从同一个预训练大模型出发并用同样低秩适配结构微调,它们的参数增量就处于可比坐标系,可以直接相加减。1 次合并后推理仍是单个识别器,这就是后续方法的核心假设。

参数合并的全景:一次离线运算替代每步外部打分

论文的方法全景可以沿一个样本走通。输入仍是声音帧序列与已生成的历史文字,输出仍是下一个文字的概率分布。不同在于训练与部署的安排。训练阶段分别得到两类低秩增量。一类是语音识别增量,由语音编码器加基座大模型在源域配对数据上微调得到。另一类是语言模型增量,由同一基座大模型在目标域纯文本或源域转写文本上微调得到。

合并阶段是离线算术,不需要语音数据,只对低秩增量做加减。推理阶段只加载合并后的单组参数,做常规束搜索或贪婪解码,不再加载独立语言模型。下图直观对比了分数级融合与参数级合并的差异,左侧需要 2 个模型同时参与,右侧只需一个模型,值得沿箭头方向仔细核对输入输出与合并位置。

看图路径: 1. 先看左侧两个独立方块的输入输出:识别器输入声音与历史文本,语言模型只输入历史文本;2. 再看右侧单模型中编码器与大模型的连接方式,以及历史文本从右侧单独输入的位置;3. 找到右侧标注为增量相加的两个斜纹方块,确认是参数级相加而非分数级插值;4. 对比左右两侧在推理时需要几个模型前向,理解右侧为何不增加计算开销

原论文 Figure 1:Illustration of (a) conventional LM fusion and (b) proposed LM merging for domain extension.

论文图 1。原论文 Figure 1:“Illustration of (a) conventional LM fusion and (b) proposed LM merging for domain extension.”。

上图左侧显示传统融合有两条独立前向。识别器输入声音与历史文本输出条件概率,目标语言模型只输入历史文本输出先验概率,解码时再插值。右侧显示所提合并把语音编码器与大模型封装为单个识别器,大模型内部虚线部分表示被低秩增量修改的区域,右侧两个斜纹方块分别表示语音识别增量与目标语言模型增量,二者经加号汇入大模型。关键动作是合并发生在推理之前,推理时顶部只输出 1 个条件概率,不再有外部语言模型分支。

因此论文报告该方法不增加参数量、实时率与部署复杂度,并可与现有推理引擎兼容。需要强调的是这种对齐依赖同基座同适配位置,换基座则无法直接相加,论文在结尾把跨结构合并列为未来工作。

两种合并如何计算,稀疏化解决什么冲突?

先解释术语。低秩适配是一种参数高效微调方法,白话说就是冻结大模型原始权重,只在注意力等位置插入两个小矩阵乘积作为增量,训练量小且增量可单独保存。任务向量是微调后权重减去预训练权重的差值,白话说就是模型为学会某任务而走出的方向。

论文中每层的识别器参数等于预训练参数加语音识别低秩增量,目标语言模型参数等于预训练参数加目标语言模型低秩增量,源语言模型同理。领域扩展合并的计算是预训练参数加语音识别增量再加系数加权的目标语言模型增量,系数是超参数。领域迁移合并再减去另一系数加权的源语言模型增量。

直觉是把目标域文本方向叠加到语音识别方向上,迁移版本同时减去源域文本方向以类比出目标域语音识别方向。论文进一步用高级合并方法增强上述加减,具体是稀疏化合并。它先按幅度裁剪,只保留每组增量中幅度最大的前一部分参数。再对每个位置把两组保留值加权相加后取符号作为共识符号。最后只合并与共识符号一致的参数,不一致的置零。

这样做的理由是跨模态增量容易在同一位置方向相反,直接相加会互相抵消或引入噪声,稀疏加符号投票可以缓解任务干扰。论文还报告语言模型增量的平均绝对改动远小于语音识别增量,因此系数调大容易导致识别崩溃,这是后续复现需要小步搜索系数的依据。

浅融合 × 领域扩展合并: 浅融合的分工是在解码每一步把语音识别模型分数与目标域语言模型分数做对数线性插值,领域扩展合并的分工是把目标域语言模型的 LoRA 增量直接加到语音识别模型的 LoRA 增量上,二者搭配的理由是都利用目标域纯文本知识做领域扩展,组合意义在于后者把前者的外部打分依赖搬进同一组参数,实现单模型前向且推理时不再调用语言模型。

密度比融合 × 领域迁移合并: 密度比融合的分工是在浅融合基础上再减去源域语言模型分数以校正源域偏置,领域迁移合并的分工是在参数空间同时加上目标域语言模型增量并减去源域语言模型增量,二者搭配的理由是都对应从源域后验向目标域后验的贝叶斯转移假设,组合意义在于把需要两个语言模型参与束搜索的减法转化为 1 次离线参数运算。

低秩适配 × 任务向量: 低秩适配的分工是冻结基座大模型只训练注意力层的小秩增量矩阵,任务向量的分工是把微调后参数与预训练参数之差视为可加减的知识载体,二者搭配的理由是本研究所有语音识别与语言模型都从同一基座出发因此增量坐标对齐,组合意义在于跨模态的语音到文本向量与纯文本向量可以直接相加减而不需要重新训练。

TIES 合并 × 跨模态干扰: TIES 合并的分工是按幅度裁剪保留重要参数并按符号投票只合并方向一致的参数,跨模态干扰的分工是指语音识别增量与语言模型增量在同一位置符号冲突会互相抵消,二者搭配的理由是直接相加容易把小而杂的语言模型改动淹没或破坏语音识别能力,组合意义在于先稀疏化再按一致符号合并,使目标域增益保留而源域性能少受损。

上述 4 个组合覆盖了从分数到参数、从单域到双域、从表示到去干扰的完整链条,下一节讲它们在训练流程中的真实冻结与更新情况。

哪些参数训练,哪些冻结,合并何时发生?

论文的训练与构造分为 3 条线,均有明确交代。日语实验以日语大模型为基座,附加一个卷积增强的语音编码器,编码器维度为 512,注意力头 8 个,层数 12 层。编码器参数全量微调,大模型部分只更新低秩适配参数,作用位置是自注意力中的键、查询、值与输出层,秩为 8,缩放系数为 16。

优化器用学习率最大值 0.0005、先预热 25000 步再衰减的策略,并用频谱增强与 0.9 和 1.1 倍速扰动,辅助连接时序分类损失权重为 0.3。语言模型同样从同一基座出发做低秩微调,配置与识别器相同,优化器学习率为 0.00001 带衰减。论文报告语言模型参数的平均绝对变化为 0.0001,而语音识别为 0.0037。

这解释了为何合并系数需要仔细选择。英语实验以另一基座为基础,前端用自监督语音模型提取特征,再接分支型编码器,编码器与低秩适配器同时更新。合并本身没有梯度,不需要语音或文本数据参与优化,只在得到两组增量后离线做加减与稀疏化。

超参数包括加权系数与保留比例,日语实验中稀疏保留比例为 50%。推理时用束宽 5 的束搜索并联合连接时序分类解码,权重为 0.3。需要指出的缺项是论文未报告合并系数的完整搜索网格与验证集选择细节,复现时应把系数与稀疏比例视为必须在开发集上调参的量,而不是固定常数。实现基于公开语音工具与常见变换器库,合并算法遵循公开合并工具包的流程,当前该工具包链接可用。

在哪些数据上测,与谁比,如何算好坏?

实验覆盖两个适配场景。日语用自发话语料库,其中模拟公众演讲部分约 280 小时作为源域用于训练识别器,学术发表部分约 240 小时作为目标域,只用其文本训练语言模型,评估分别在目标域测试集与源域测试集上进行,指标为字错率,越低越好。

英语用朗读书籍约 960 小时作为源域,金融电话会议作为目标域,只用目标域文本,评估用随机抽取的 10,000 条目标域样本,指标为词错率,越低越好。比较对象包括基线识别器、简单加减合并、稀疏化合并的扩展与迁移版本,以及可运行的传统方法。

传统方法包括浅融合、密度比融合、5 候选重打分与密度比式重打分,还有合并与融合或重打分的叠加。公平条件是同一基座与同一编码器,解码束宽主要为 5,另做束宽 1、3、5 的对比。成本用总参数量与在特定图形处理器上测得的实时率表示,两者越低越好。

论文还报告了解码行为差异。合并方法在贪婪解码下仍有效,而重打分在束宽为 1 时无法施展。初学者复述时要核对每个数字的数据集、模型、阶段、指标与聚合对象,字错率与词错率不能混比,百分点差值与相对百分比也不同。

主结果:合并带来多少增益,代价是什么?

先看日语从日常演讲到学术发表的对比问题。在相同解码条件下,参数合并能否在不增加参数与实时率的前提下接近重打分。下表整理了目标域字错率与成本,字错率、参数量与实时率方向均为越低越好,原表头单位保留,数据格为原文裸值。

方法目标域字错率总参数量实时率推理时外部依赖
基线识别器13.91.1B0.45无
稀疏合并迁移版13.31.1B0.45无
浅融合12.82.1B0.52目标语言模型
密度比融合12.53.1B0.57目标加源语言模型
5 候选重打分13.32.1B0.45目标语言模型后处理
密度比式重打分13.23.1B0.46源加目标后处理
合并加浅融合12.42.1B0.53目标语言模型
合并加密度比融合12.43.1B0.58目标加源语言模型

上表显示合并迁移版把目标域字错率从 13.9 降到 13.3,与重打分基本持平,但参数量与实时率与基线完全相同。浅融合与密度比融合分别降到 12.8 与 12.5,更好但参数量分别增至 2.1B 与 3.1B,实时率升至 0.52 与 0.57。合并与融合叠加可进一步降到 12.4,说明参数内知识与解码时外部打分互补。未胜出项是合并不如显式每步融合,论文将其归因于合并未能在每步充分注入目标知识,且增大语言模型系数会导致识别崩溃的跨模态对齐问题。

N-best 重打分 × 模型合并: N-best 重打分的分工是先用语音识别模型解码出若干候选再用语言模型 1 次性重新排序,模型合并的分工是在解码前就把语言模型知识写进语音识别参数,二者搭配的理由是都避免解码每一步调用大语言模型,组合意义在于合并保证贪婪解码也有增益而重打分依赖候选多样性,二者还可以叠加进一步下降。

不同束宽下的趋势如下图所示,重点是小束宽与贪婪解码的可用性,左图为日语字错率随束宽变化,右图为英语词错率随束宽变化,需要先确认图例再比较曲线走向。

看图路径: 1. 先确认横轴为束宽 1、3、5,左纵轴为字错率,右纵轴为词错率;2. 对比束宽为 1 处合并方法与重打分方法的可行性差异;3. 观察束宽增大时密度比曲线与合并曲线的相对位置变化

原论文 Figure 2:LM adaptation methods on different beam sizes.

论文图 2。原论文 Figure 2:“LM adaptation methods on different beam sizes.”。

上图左面板为日语字错率随束宽的变化,右面板为英语词错率随束宽的变化,图例包含基线、合并迁移版、密度比融合与密度比式重打分。可见动作是先看束宽为 1 处。重打分因无候选多样性无法生效,合并仍有增益,在日语贪婪解码下合并甚至超过密度比融合。再看束宽增大。密度比融合的增益在束宽 5 时才充分显现,束宽 1 与 3 处增益较小,说明融合方法依赖搜索空间。右面板基线随束宽增大反而变差,而合并与融合曲线保持下降或平稳,提示英文金融域的搜索与打分交互与日语不同,不能把一侧结论直接推广到另一侧。

扩展与迁移谁更好,稀疏化是否必要?

论文做了两组对照。第一组是扩展与迁移的对比。日语目标域上简单扩展把字错率从 13.9 降到 13.6,稀疏扩展降到 13.4,简单迁移降到 13.3,稀疏迁移保持 13.3。源域上扩展保持 4.8 不变,迁移升至 5.1 或 4.9,即目标域迁移更强但源域有损。

这支持按需选择的判断。若需兼顾源域则选扩展,若只关心目标域则选迁移,且迁移需要源域转写文本训练源语言模型,不可用时只能用扩展。第二组是稀疏化的作用。无论扩展还是迁移,加入稀疏化后目标域都有进一步或持平的增益,说明裁剪加符号投票对跨模态合并有帮助。

英语适配的对照问题是。在不同基座与编码器下结论是否成立。下表整理英语从朗读到金融域的词错率与成本,词错率、参数量与实时率越低越好,最后一列说明是否保持单模型前向。

方法目标域词错率总参数量实时率是否单模型前向
基线识别器11.21.4B0.40是
稀疏合并扩展版10.61.4B0.40是
稀疏合并迁移版10.61.4B0.40是
浅融合9.12.4B0.49否
密度比融合9.03.4B0.56否
重打分9.82.4B0.41否
合并迁移加浅融合8.92.4B0.49否
合并迁移加密度比融合8.83.4B0.55否

上表显示合并把词错率从 11.2 降到 10.6,降幅有限但同样零额外成本,而融合可降到 9.0 左右但参数与实时率明显增加。合并与融合叠加降到 8.8,再次显示互补性。限制是英文下合并与重打分的差距比日语更大,论文未给出显著性检验,复现时应报告多次运行方差与统计方法,不能把 0.6 个点的单次改进夸大为稳定优势。源域侧的反例同样存在,迁移版本以源域损失换取目标域增益,使用时必须同时考核两个领域。

哪些边界没有测,哪些推测尚未验证?

论文直接报告的是两个特定方向的适配增益与零额外推理开销,有限解释是参数算术对应分数插值与密度比减法,待验证的是跨模态对齐的一般机制。未评测的边界包括反向适配、源域与目标域差异更大或更小的情形、不同低秩秩数与适配位置、以及换基座后的可合并性。

论文明确把不同结构间的合并列为未来工作,因此不能假设任意两个语言模型都能与任意识别器相加。另一个限制是系数敏感性。论文报告增大目标语言模型系数会导致识别崩溃,但未给出崩溃阈值与自动选择策略,实际部署需要预留验证集调参。

成本方面,论文测量了参数量与实时率,但未测量首字延迟、吞吐随并发的变化与长音频下的内存峰值,不能把实时率不变等同于所有延迟指标都不变。相关性不等于因果。合并后目标域变好支持知识转移,但不能证明模型真正学会了领域句法而非仅偏置了高频词,论文也未做词级错误分析来支撑更细的因果断言。

要复现先准备什么,先跑哪条最小链路?

复现的第一步是准备同基座。日语需同一日语基座同时训练识别器与语言模型,英语需同一英文基座,二者不可混用,否则增量坐标不对齐。低秩配置要完全一致,包括作用层、秩与缩放系数,否则无法逐元素相加。

数据方面,日语源域用模拟演讲配对数据训练识别器,目标域学术发表文本与源域转写文本分别训练目标与源语言模型。英语源域用朗读配对数据,目标域金融文本训练语言模型,评估用抽取的 10,000 条样本。最小可运行链路是先训出基线识别器与目标语言模型,做 1 次简单加权相加得到扩展合并。

束宽 5 解码看目标域是否下降,再加入源语言模型做迁移合并,最后再试稀疏化保留 50% 的版本。超参数先在开发集上小步搜索合并系数,观察目标域增益与源域保持的权衡,出现识别崩溃立即减小系数。评估要同时报告目标域与源域、字错率或词错率、总参数量与实时率,并固定束宽与解码权重。

代码方面,合并流程遵循公开合并工具包,当前该工具包链接可用,但论文的语音训练基于特定语音工具与变换器库,复现需核对版本与随机种子。论文已声明生成式人工智能仅用于语句校对,不影响方法与数字的重现性判断。

何时值得尝试这种合并,何时仍用传统融合?

当目标域只有纯文本、推理预算不允许每步调用大语言模型、且部署要求单模型前向时,值得尝试这种参数合并。它尤其适合贪婪解码或小束宽场景,因为重打分在这些场景下受限,而合并仍能提供增益。

当追求最高精度且能承受 2 到 3 倍参数与更高实时率时,仍应选用浅融合或密度比融合,或把合并与融合叠加。需要记住的关键条件是同基座同适配结构、预留系数调参、同时考核源域保持。若源域文本不可得,只能做扩展合并。

若源域性能必须严格不降,应优先验证扩展而非迁移。未来还需补的验证包括显著性与多次运行稳定性、词级错误类型分析、不同秩数与保留比例的敏感性、以及跨结构合并的可行性。只有补齐这些,才能把当前在 2 个方向上观察到的有限但零成本的增益,推广为可部署的领域适配常规操作。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总