英文题目:Avoiding Catastrophic Forgetting in Text-Only Adaptation of LLM-based ASR via Multi-View Text Denoising

会议身份:conference:interspeech:2026:conference-paper-id:burdisso26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#领域适应 #LoRA #大语言模型 #语音识别

评分:7.9/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Sergio Burdisso:机构信息未能从会议 PDF 纯文本可靠映射
  • Esaú Villatoro-Tello:机构信息未能从会议 PDF 纯文本可靠映射
  • Thibault Bañeras-Roux:机构信息未能从会议 PDF 纯文本可靠映射
  • Shashi Kumar:机构信息未能从会议 PDF 纯文本可靠映射
  • Srikanth Madikeri:机构信息未能从会议 PDF 纯文本可靠映射
  • Pradeep Rangappa:机构信息未能从会议 PDF 纯文本可靠映射
  • Manjunath K E:机构信息未能从会议 PDF 纯文本可靠映射
  • Petr Motlicek:机构信息未能从会议 PDF 纯文本可靠映射
  • Andreas Stolcke:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

基于大语言模型的语音识别以语音编码器提取声学特征并经投影器映射为类文本嵌入再由大语言模型解码转写,纯文本微调易破坏已学语音文本对齐而引发灾难性遗忘。该方法将目标域自适应重构为文本去噪任务,先在每批中保留源域音频文本对以锚定对齐,再为源域转写构造投影器诱导噪声与合成字符噪声以模拟投影输出。随后其输出与加噪目标域文本共同混批输入,驱动大语言模型在去噪中学习目标词汇句法并保持跨模态桥接。在DefinedAI银行域测试集上词错率(Word Error Rate,WER)为6.53%,相对未自适应基线8.02%改善18.6%。相比直接文本微调或软提示替换语音的做法,多视角批量混合在同一批次内同时保留语音锚点与文本去噪信号,从而兼顾对齐保持与领域适应。该结论的适用边界限于对话式转写文本且目标文本与测试分布接近的场景,声学严重偏移时仍需少量配对音频补充,否则对齐保持可能失效。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要解决哪一步?

本文输入包括两类材料。第一类是源域的成对音频与转写,用于先训练出可用的语音识别基座。第二类是目标域只有转写文本,没有目标域音频,这是适配阶段唯一能用的新领域信息。目标是在不改模型结构、不加参数的前提下,让系统在目标域上的词错误率下降,同时不丢失原来对语音输入的理解能力。

必须保留的信息包括基座如何搭建、对齐为何会丢失、批次由哪四部分组成、每部分的监督来源是什么,以及 3 类难度递增的评测条件和可运行基线的对比结果。输出是 1 篇能复述方法的解读,明确区分论文直接报告与尚未验证的推测。后续先讲任务与相关路线,再讲方法全景与组件计算,然后讲训练构造与实验条件,最后讲结果反证与复现收束。例子均为教学举例,不代表论文数值。

同输入同目标的已有路线为何不够?

传统端到端语音识别的纯文本适配路线包括中间层连接时序分类适配、用外部语言模型做浅融合、用文本生成梅尔频谱、以及对 Whisper 解码器做文本适配。这些路线处理的是传统编码器解码器结构,不直接回答大语言模型式语音识别中投影层与大语言模型之间的跨模态对齐如何保持。大语言模型式语音识别的已有纯文本尝试有两条可运行路线。

一条是方等人先用原始目标域文本微调大语言模型,再在带音频的验证集上每隔固定步数监测困惑度,在灾难性遗忘发生前停下。另一条是马等人先冻结模型学习若干个放在音频位置的可训练嵌入,再用这些嵌入代替音频去微调大语言模型,同样需要定时选点以避开遗忘点。两条路线都承认只用文本会破坏对齐,但分别用早停和软提示来缓解,没有把适配显式写成与投影输出形态一致的去噪练习。

本文的差别在于把噪声建模和批次混合作为主要手段,而不是只靠停止时机或替代嵌入。

为什么直接用目标文本微调会破坏语音理解?

大语言模型式语音识别由三部分组成。语音编码器把波形变成帧级表示。投影层把帧级表示映射到大语言模型输入嵌入空间。大语言模型按固定提示把输入读成待转写的语音并生成转写。论文沿一个样本走完全程有助于理解。

举例说明,音频对应转写是你想表达的一句话,编码器先给出声学帧序列,投影层把它变成一串软词元,大语言模型再从这串软词元恢复出干净转写。已有工作发现即使是很简单的两层投影加非线性,配合冻结的大语言模型也能得到较强转写效果,并观察到投影输出经最近词元映射后像是带重复和错字的噪声文本,例如把简单英文短句映射成带有重复字母和杂散符号的形态。这支持把识别看作去噪。

如果此时直接用干净目标文本做语言建模式微调,模型见到的输入不再是噪声形态,投影层映射的有效性会退化,推理时再输入真实语音投影就会对不上,这就是本文所说的灾难性遗忘。教学例子仅用于说明形态差异,不新增论文外的效果数字。

多视角去噪适配的全景是什么?

本文把纯文本适配重写为文本去噪问题。给定目标域文本,用一个噪声函数生成加噪版本,再微调大语言模型从加噪版本恢复原文。关键不在单条噪声怎么写,而在每个小批次同时混合 4 种视角。第一种是源域音频投影加原文,用于锚定原始语音文本对齐。第二种是源域文本经投影诱导噪声加原文,用于提供最贴近真实投影失真的文本视图。

第 3 种是源域文本经合成噪声加原文,用于在无音频时也能练习去噪。第 4 种是目标域文本经合成噪声加原文,用于真正引入新领域词汇与句法。四者比例记为源域三项与目标项之和为一,目标比例控制适配强度,保留一小部分音频对是防止遗忘的关键。下图把这种纵向堆叠的批次结构画了出来,上半是已知源域,下半是未知目标域,右侧标注了每段的符号与二元组类型。

为理解批次构成,先看下图如何把源域保留与目标域适配放在同一个小批次里,下图是本次收到的官方原图像素,重点看左右括号与右侧符号的对应关系。

看图路径: 1. 先从左侧大括号确认上半为已知源域下半为未知目标域;2. 再沿右侧四个符号核对每段对应的输入输出二元组类型;3. 比较目标域绿色段高度与其他三段之和的相对占比;4. 观察源域内部三段是否大致均分以理解保留对齐的设计

原论文 Figure 1:Batch composition used for fine-tuning the LLM dur- ing text-only adaptation to a target domain.

论文图 1。原论文 Figure 1:“Batch composition used for fine-tuning the LLM dur- ing text-only adaptation to a target domain.”。

上图从上到下依次是音频文本对、投影诱导噪声文本对、合成噪声文本对和目标域合成噪声文本对,左侧括号把前 3 段归为源域、最后一段归为目标域。从像素可见目标域绿色段明显高于源域每一段,说明目标比例在示例中占比较大。右侧每段都标注为输入到原文的恢复关系,意味着 4 种输入在训练时共享同一个恢复目标。这种堆叠不是简单的拼接,而是让模型在同一优化步骤里同时见到保对齐的信号和学新领域的信号,从而在更新大语言模型参数时兼顾两者。

编码器投影与大语言模型各自做什么?

语音编码器采用预训练的 WavLM 大模型,负责提取帧级声学表示,基座训练时保持冻结。投影层是单隐层加激活加回归层的可学习映射,负责把变长声学帧压缩映射到大语言模型嵌入维度,基座训练时它是唯一被更新的部分。大语言模型采用 Llama 系列指令模型作为解码器,基座训练时冻结,适配阶段才用低秩适配器更新其自注意力查询与值投影。提示模板固定为要求把语音转写为文本的形式,训练时花括号中的输入按批次成分在真实语音投影、投影诱导噪声或合成噪声之间切换,花括号中的转写为真值,推理时输入恒为真实语音投影,输出为模型生成的转写。

语音编码器 × 投影层: 语音编码器负责把波形变成帧级声学表示,投影层负责把这些表示映射到大语言模型输入嵌入空间,二者搭配的理由是让大语言模型把语音当作带噪文本来读,组合意义是适配时只要保住这条映射,大语言模型就能继续理解语音输入。

沿单样本再走一遍有助于固定指代。音频先进编码器得到帧表示,再经投影层得到软词元序列,大语言模型在固定提示下把该序列当作噪声文本并恢复出干净转写。公式与梯度路径方面,原文未给出显式损失公式,只说明基座按原框架训练投影层,适配按去噪对做自回归恢复,因此本解读不虚构公式,只讲清监督来源是每对输入对应的干净原文,更新对象是适配阶段的大语言模型低秩参数。

两种噪声如何构造,去噪目标是什么?

投影诱导噪声的构造是把源域音频过当前投影层得到嵌入,再映射到大语言模型词表中最近的词元,以此近似最优噪声函数。它需要源域音频,因此只能在源域构造。合成噪声的构造分两步,先用字符级随机增强工具选一部分词并替换其中一部分字符,再按字符概率做重复,重复次数在较小范围内均匀选择。第二步的重复是为了模仿投影输出中常见的拉长现象。去噪目标都是从加噪输入恢复对应干净转写,而不是做无条件的语言建模。组合时源域同一句话最多可出现 3 种视图,模型被鼓励在三者之间建立对应关系。

灾难性遗忘 × 去噪任务: 灾难性遗忘指只用目标域纯文本微调大语言模型后语音文本对齐被破坏,去噪任务指让模型从加噪输入恢复干净转写,二者搭配的理由是去噪输入在形态上更接近投影层输出,组合意义是让模型在学新领域词汇的同时仍练习对齐所需的恢复能力。

投影诱导噪声 × 合成文本噪声: 投影诱导噪声是把源域音频过投影层再映射到最近词表得到的最贴近真实失真的文本,合成文本噪声是用字符替换加重复人工构造的近似失真,前者分工是提供最优噪声参照,后者分工是在无音频时可大规模构造,搭配理由是让模型在同一源句上桥接音频视图与两种噪声视图。

需要指出原文未报告投影诱导映射的具体距离度量与最近邻搜索实现细节,也未给出合成噪声随机种子的固定方式,这些是复现时需要补记的缺项,不能从模型名称推定实现。

批次比例与参数更新如何安排?

每个批次的四项占比之和为一。论文采用的启发式是目标比例按目标域训练样本量相对源域的大小来定,剩余源域比例由三项均分。目标比例的具体数值随领域变化,在结果表中直接标出。维持一个虽小但非零的音频比例被报告为避免遗忘的关键,消融显示去掉该项会导致词错误率大幅上升。训练安排分两段。

基座阶段在源域成对数据上训练投影层若干轮,保持编码器与大语言模型冻结。适配阶段在混合批次上用低秩适配器微调大语言模型若干轮,学习率与预热步数按原文设定,编码器与投影层不再更新。监督来源始终是每对输入对应的干净转写,梯度只流向低秩参数。

源域音频文本对 × 目标域纯文本: 源域音频文本对分工是锚定原有语音到文本的映射,目标域纯文本分工是提供新领域词汇与句法,搭配理由是前者防止遗忘后者推动适配,组合意义是通过批次比例控制保留与特化的权衡。

原文未报告批次大小在适配阶段是否与基座一致,也未报告目标比例是否在验证集上另行搜索,只说明理想做法应在验证集上优化,本工作为系统分析而采用按数据量定比例的启发式,这一点在复现时应如实保留,不宜改为自行搜索的最优值来代替可部署收益。

数据划分基座与基线条件是什么?

实验用两个会话语料。DefinedAI 是商业客服电话的人工转写,口语自然,包含不流畅与打断。源域覆盖银行保险医疗,目标为银行与保险的纯文本训练划分,另有各自的验证与测试划分。SlideSpeech 是来自在线会议视频的大规模视听语料,源域取生活人才英语,目标取农业动画乐器,目标训练划分为纯文本,验证与测试用于评测。目标训练划分的文本均为真实会话转写,而非网页任意文本。

SlideSpeech 目标域的选择经过用基座大语言模型算域级困惑度并按陌生程度排序,以保证有足够样本可划分。评测指标为词错误率,数值越低越好,同时报告相对基座的相对改善量,改善量越高越好。基线包括未适配基座、有目标音频的最优适配、可运行的方等人和马等人纯文本方法。所有方法共享同一编码器解码器与投影结构,基座训练轮数与优化设置一致,适配阶段的早停式基线按固定步数在带音频验证集上选点,本文方法按启发式定目标比例。

代码当前可用,已公开仓库链接,本次核对资源状态为可用。硬件与训练时长原文未系统报告,这是成本讨论的缺项。

三档难度下谁在变好,代价是什么?

比较问题是纯文本适配能否在不破坏语音理解的前提下降低目标域词错误率,公平条件是同一基座同一测试集同一词错误率指标,方向是词错误率越低越好。下表整理同域适配的核心数字,表头单位为词错误率,相对改善量为相对百分比,基线裸值单位见原表头说明。

目标域指标未适配基座音频适配上限本文纯文本方法
银行词错误率与相对改善8.024.55 与 43.36.53 与 18.6
保险词错误率与相对改善9.366.01 与 35.87.59 与 18.9

表后解释需要同时讲收益与代价。表显示本文方法在同域两目标上均明显优于未适配基座,并缩小了与有音频上限的差距,但仍未达到上限,说明纯文本主要弥补语言失配,不能完全替代目标音频带来的声学收益。与两个可运行纯文本基线相比,本文方法改善幅度更大,而对照方法改善很小。跨难度趋势为同域改善最大,异域次之,跨语料跨声学最难但本文仍保持领先,最高相对改善报告为 25.4%。未胜出项是所有纯文本方法在跨域下均明显低于音频适配,这明确了适用边界。百分点与相对百分比不可混淆,此处改善量均为相对基座的相对百分比。

拿掉音频锚与换掉噪声会发生什么?

比较问题是批次中哪一路对防止遗忘最关键,以及目标输入是否必须加噪,公平条件是同一目标域同一基座同一指标。下表整理同域上与可运行对照的对比,数值保留原文写法,相对改善为相对百分比。

目标域指标方等人马等人本文方法
银行词错误率与相对改善7.89 与 1.67.75 与 3.46.53 与 18.6
保险词错误率与相对改善9.10 与 2.89.24 与 1.37.59 与 18.9

表后解释分两组消融。第一组去掉源域音频成分会导致词错误率急剧恶化并出现负改善,说明音频锚是保留对齐的必要条件,去掉投影诱导噪声在银行上略有波动但保险基本不变,说明完整混合更稳健。第二组把目标输入换成随机等长串、原样回显或空输入,效果均不如合成噪声,支持把任务写成去噪更能学到目标词汇与句法。负结果是随机与空输入仍有一定改善,说明仅暴露目标文本也有语言模型收益,但形态匹配的噪声带来额外增益。未评测边界包括噪声超参数的大范围搜索与目标比例的最优搜索,原文只报告了按数据量定比例的启发式结果。

哪些结论有限,哪些验证还没做?

论文直接报告的是在给定编码器解码器与投影结构下的词错误率与相对改善,不涉及误判率延迟与推理成本的测量,因此不能承诺这些量得到改善。有限解释是投影输出像噪声文本的观察支持去噪建模,但这只是形态相似性的证据,不是因果证明,相关性不等于因果。未验证推测包括更好的噪声函数是否进一步提升、目标比例在文本极丰富时的最优值、以及少量目标音频加入后能否闭合剩余差距,后者在后续工作中才初步探讨。

数据边界是目标文本均为会话转写,若换成网页任意文本是否同样有效尚未评测。资源边界是原文未报告硬件预算与训练时长,部署成本需自行补测。总体趋势不等于每组每步都成立,例如乐器域目标比例较低但仍有改善,具体幅度需按域单独看。

复现先做什么,需要哪些超参数?

复现先按原文顺序做 3 步。第一步用源域成对数据训练投影层,保持编码器与大语言模型冻结,得到基座与投影诱导噪声的来源。第二步实现合成噪声的两步流程,字符替换与重复的比例按原文默认值微调后的设置记录,并固定随机种子以保证可重放。第 3 步按启发式定目标比例并三等分剩余源域比例,构造 4 路混合批次,用低秩适配器微调大语言模型的查询与值投影,提示模板与推理输入保持与原文一致。

关键超参数包括基座与适配的轮数、学习率、预热步数、低秩秩数与缩放系数,以及目标比例随域变化的取值,复现时应原样保留启发式取值,若另行搜索需单独标注为事后最优,不能代替可部署收益。代码当前可用,仓库已公开,但权重下载与完整可运行环境需按仓库说明另行确认。常见误解是以为纯文本适配不需要任何音频,实际上源域音频对必须保留一小部分,否则会对齐遗忘。另一个误解是把相对改善当作绝对百分点下降,两者计算不同,不可直接比较。

何时值得尝试,还需补哪项验证?

当已有源域语音识别基座、手头只有目标域转写文本、且目标与源在声学上相近而词汇差异明显时,本文方法值得尝试,因为它无需改结构加参数,且在三档难度下均优于已有可运行纯文本方法。当目标与源声学差异很大时,纯文本只能弥补语言部分,仍需规划少量目标音频的补充采集。复现后还需补两项验证。一是按应用在验证集上优化目标比例并报告敏感性,而不是只用按数据量定比例的启发式。

二是补测训练与推理开销、输出稳定性与不同噪声参数下的鲁棒性,以确认收益在预算内可落地。判断标准始终回到同一基座同测试集同指标下的可运行对比,事后最优与需要目标音频的上限另行标注,不与纯文本可部署收益混放。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总