英文题目:Parameter-Efficient Continual Learning for Automatic Speech Recognition

会议身份:conference:interspeech:2026:conference-paper-id:eeckt26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#持续学习 #参数高效微调 #多语言 #语音识别

评分:8.3/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Steven Vander Eeckt:机构信息未能从会议 PDF 纯文本可靠映射
  • Hugo Van hamme:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

面向冻结语音基础模型逐任务适配新方言并保留初始多语言能力的持续学习任务,输入为新方言语音与对应转写,输出为覆盖全部已学任务的转写结果,难点在于严格参数高效约束下新任务有效适配与旧任务灾难性遗忘之间的冲突。方法首先对每个线性层权重矩阵做奇异值分解,按奇异值能量将前部大能量方向划为头部并冻结,以保留主导表征不受干扰。接着仅在后部低能量尾部子空间内学习近似旋转矩阵,上一步冻结头部后剩余的尾部残差直接作为本步旋转学习的输入,使更新局限于低干扰方向。然后在学习后续任务时重新计算奇异值分解并重划头尾,再将历史尾部旋转解与新任务临时解做凸权重平均,前一步的尾部解直接进入平均以抑制共享尾部内的任务间干扰。在实验1荷兰语系评测设置下,CSSVD的平均WER为18.33%,低于LoRA+FTA的平均WER19.64%。与直接约束低秩增量或仅做增量平均的已有方法不同,该方法以尾部约束限定更新子空间并以近似旋转保持变换结构,消融显示去掉平均会明显增加遗忘而额外学习重缩放几乎无增益。该结论仅在单基座、两任务步、荷兰语系内验证,跨语系、长序列与推理成本外推尚未证明。该结论的适用边界受限于单基座与荷兰语系短序列场景,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,为什么大模型顺序适配会忘?

本文的输入是语音波形对应的帧序列与文字转写,目标是自动语音识别,即把连续语音映射为词序列。研究对象不是从零训练一个小模型,而是拿一个已经在大规模多语数据上预训练好的语音基础模型,去顺序适配新的语言或方言任务。输出仍然是词序列,评价用词错误率衡量,数值越低越好。

对刚入门的读者,关键矛盾要先讲清。基础模型参数量大,全量微调每个新任务代价高;更麻烦的是顺序微调会引发灾难性遗忘,即学会新任务后,旧任务的词错误率大幅回升。论文把这两个约束合在一起,称为参数高效持续学习。它的要求是每次只允许更新极小一部分参数,学新任务时不能访问旧任务的完整训练数据,推理时也不给任务编号,模型必须用同一套参数处理所有已学任务。

官方代码资源当前可用,已公开在 RESOURCE_1 对应的仓库链接,状态码为 200。本文解读只依据论文正文证据与本次收到的官方原图像素,不引入外部评价。后续所有方法与数字讨论都围绕上述设定展开:如何在不动主成分的前提下,用很小的可训练量学会新任务,同时把旧任务的性能保持住。

已有路线做了什么,本文与它们在输入与约束上有何不同?

在自然语言处理与视觉领域,参数高效持续学习已经有较多工作。论文梳理的路线包括约束低秩适配更新子空间、平均任务相关适配器、改进初始化等。这些工作共享的输入是大型预训练模型,共享的目标是在参数受限下顺序学习,共享的监督是新任务标注数据。但它们的验证主要在文本或图像分类上,没有直接回答语音声学与语言混合建模时的遗忘特性。

在语音识别领域,持续学习过去主要靠存旧数据回放或加正则项,没有显式考虑参数高效约束。少数把低秩适配用于语音的工作,如用正交低秩适配与自适应预算分配改造 Whisper,或对低秩模块做权重平均,都没有显式针对初始预训练模型做遗忘控制。另一类任务相关适配器需要推理时知道任务编号,与本文假设任务编号不可用不一致。

低秩适配 × 正交投影: 低秩适配负责以 Wi+Bi+1Ai+1 形式学低秩增量以高效适配新任务,但无显式防遗忘机制,正交投影负责把该增量约束在 Wi 的 top-kOP 奇异子空间的正交补内以减少对主方向的干扰,二者搭配的理由都是想用低秩结构控制参数量,组合意义是说明仅靠初始化或投影约束仍不足以在语音任务上稳定保留旧知识,从而引出尾部旋转的必要性。

本文的起点是结构化奇异值分解微调。它把权重矩阵做奇异值分解,对 top-k 大奇异方向学重缩放与近似旋转,在语音参数高效微调中表现较好。本文明确指出要改造它:不再动大奇异方向,转而只动小奇异方向,并为后续任务引入平均机制。这一定位决定了后文的实验对照必须包含从自然语言处理与视觉迁移过来的低秩类持续学习方法,否则无法说明语音场景的特殊性。

任务形式化:模型从哪里出发,每一步允许动什么?

论文把问题写成参数序列的更新过程。初始模型参数记为西塔零,它已在初始任务集合 T0 上训练好,但 T0 的数据 D0 不再可用。随后依次到来新任务 T1 到 Tt,每个任务 Ti 有自己的标注数据 Di。学 Ti 时,只能把上 1 阶段参数西塔 i-1 更新为西塔 i,且更新量必须参数高效,同时要保持在之前所有任务上的性能。

具体到实现,论文限制适配范围为线性层的权重矩阵,不包括输出层,其他参数全部冻结。输出层冻结意味着词表与分类头不变,适配只改变中间表示的线性变换。推理时不提供任务身份,同一个模型要同时服务旧任务与新任务。评价分两个维度:最终模型在每个任务上的词错误率及其平均值,以及后向迁移,用最终词错误率相对刚学完该任务时的变化来度量遗忘,负值表示遗忘。

举一个教学例子帮助理解,但不代表论文数值。假设初始任务是英语、德语、西班牙语,新任务是荷兰与佛兰芒语。第一步只允许动线性层中很小一部分参数学荷兰语,第二步再用同样小的预算学佛兰芒语,最终用同一模型测 5 种语音的词错误率,并看英语等初始任务相对第一步结束时变差了多少。这个例子只说明流程,实际数据划分与语料来源见实验条件节。

方法全景:先沿一个样本走完头部与尾部的两条路

先沿一个线性层的一个输入样本走一遍。输入向量 x 同时进入左右两条计算路径。左路是头部,用冻结的大奇异方向矩阵相乘得到一部分输出;右路是尾部,用冻结的左右奇异向量夹住一个可训练的小矩阵 Gi+1 再相乘得到另一部分输出。两路结果在顶部相加得到输出向量 h。

训练时梯度只流入橙色 Gi+1,头部与尾部的奇异向量与奇异值保持不动。推理时头部与尾部同样相加,不需要任务编号。

参数高效微调 × 持续学习: 参数高效微调负责只更新线性层权重矩阵中的极小可训练部分、冻结其余参数以控制计算量,持续学习负责在顺序学习新任务时不丢失旧任务性能,二者搭配的理由是大语音基础模型既大又容易遗忘,组合意义是把可训练量限制在尾部旋转矩阵 Gi+1 内,同时用跨任务平均来同时满足高效与不忘。

下图是论文给出的单层示意,左侧画出输入输出与冻结可训练标记,右侧标出 3 步流程。阅读时注意冻结与可训练的图例区分,这是理解参数高效与防遗忘的关键。

看图路径: 1. 先看左侧输入 x 分两路进入头部大块与右侧尾部小块,顶部相加得到 h;2. 再确认右侧尾部中只有橙色 Gi+1 标为可训练,其余 UT,i 与 VT,i 标为冻结;3. 最后沿右侧三步箭头看分解、训练 Gi+1、平均合并为 Wi+1 的顺序

原论文 Figure 1:Overview of CSSVD for a single linear layer (bias omitted) when learning task Ti+1.

论文图 1。原论文 Figure 1:“Overview of CSSVD for a single linear layer (bias omitted) when learning task Ti+1.”。

从像素可见,左侧大灰块标注为前 d-k 个奇异方向构成的头部,标有雪花冻结标记;右侧从上到下依次是尾部左奇异矩阵、奇异值、橙色可训练 Gi+1 与尾部右奇异矩阵,输入 x 用箭头同时指向头部与尾部,顶部加号汇合为 h。右侧流程从顶部当前权重分解开始,向下箭头指向训练 Gi+1 得到的新权重,再经由上下两个空心箭头汇合到中间的平均合并块,标注为平均合并。这说明每个新任务都要经历分解出新头尾、只练尾部旋转、再与上 1 阶段解平均 3 步,而不是 1 次训练到底。

头尾如何划分,第一任务的旋转具体加在哪里?

对线性层权重矩阵 W,论文先做奇异值分解,得到左奇异矩阵、按降序排列的奇异值对角阵与右奇异矩阵。设 d 为输入输出维度中的较小值,取超参数比例 p 得到 k。论文把前 d-k 个大奇异方向称为头部,后 k 个小奇异方向称为尾部。头部记为 W0,尾部记为 UTΣTVT 转置。原文设定 p 为 0.40,因此尾部约占四成方向,但这些方向能量低。

头部分量 × 尾部子空间: 头部分量指按奇异值从大到小排序后前 d-k 个方向构成的 W0,i 部分,承担保留初始任务与已学任务的主要能量而不被修改,尾部子空间指后 k 个小奇异值方向构成的 UT,iΣT,iVT,i 部分,承担提供新任务适配容量,二者搭配的理由是重要方向不动、低能量方向可转,组合意义是把干扰限制在对旧任务影响最小的子空间。

学第一个新任务 T1 时,论文在尾部引入近似旋转矩阵 G1。G1 写成单位阵减 2 倍偏斜对称矩阵的形式,初始接近单位阵,只训练其中下划线标出的部分。适配后权重为头部加尾部夹住 G1 的形式。因为头部完全不动,初始任务 T0 的主成分不受直接修改,这就是减少干扰的来源。论文说明由于采用近似正交约束,G1 隐式同时包含旋转与重缩放,因此省略显式重缩放项,只学 G1。

结构化奇异值分解微调 × 持续结构化奇异值分解: 结构化奇异值分解微调负责在 top-k 大奇异方向上学重缩放加旋转以追求单任务性能,持续结构化奇异值分解负责只在 bottom-k 小奇异方向上学近似旋转并重算头尾划分与跨任务平均,二者搭配的理由是原文明确把前者作为起点、把后者作为持续学习改造,组合意义是把追求单点最优的机制改为保护主成分的机制。

需要强调的是,这一步与原结构化奇异值分解微调的方向相反。原方法动 top-k 大方向以追求单任务拟合,本文动 bottom-k 小方向以保护旧任务。这个选择是后文消融中最关键的对照,单独拿掉平均仍能超过基线,主要就靠这个划分。

学第二个及之后任务时,旋转如何组合与重算?

学第二个任务 T2 时,如果假设头尾划分不变,论文从同一分解出发,先在尾部学新的 G2,得到未合并解。此时新旋转可能覆盖旧旋转导致遗忘,因此把旧解 G1 与新解 G2G1 做凸组合,权重为 1-α 与 α。这等价于直接对权重矩阵做凸组合,即 W2 等于 1-α 倍 W1 加 α 倍未合并 W2。这种平均策略此前在语音持续学习中被证明有效,论文把它从全量权重平均搬到尾部旋转平均。

近似旋转 × 权重平均: 近似旋转指在尾部内学习 Gi+1 = I-2Ki+1 形式的可训练变换,负责在不改变头部的前提下调整尾部表示以拟合新任务,权重平均指把上一任务解 Wi 与新任务解 Wi+1 波浪线按凸组合合并为 Wi+1,负责缓解新旋转对上一任务旋转的覆盖,二者搭配的理由是单靠限制子空间仍会在任务间共享尾部,组合意义是先限位再折中。

实际实现与理想公式有一个差别。理想公式假设头尾划分固定,但论文在每学完 1 个任务后只保存结果权重 Wi,学下一任务前重新对 Wi 做奇异值分解,再按新的奇异值大小重新取前 d-k 为头、后 k 为尾。因此重要性上升的方向可以从尾部升入头部,从而被后续保护;适配容量始终集中在新的低能量子空间。当头尾之间没有奇异值交叉时,重算只相当于尾部内换基,退化为固定划分情形。

有交叉时则不再等价于固定公式。实践中论文直接用权重平均公式合并,α 取 1/(i+1)。

这一重算细节解释了方法的持续保护能力:不是 1 次划分管所有任务,而是每步都让数据决定哪些方向值得冻结。这也意味着复现时必须严格按先分解、只练 Gi+1、再平均的顺序实现,不能把平均省掉或把头部放开。

训练与推理如何组织,哪些参数冻结、梯度流向哪里?

训练组织按任务流进行。每个新任务到来时,对每个线性层的当前权重做奇异值分解,划分出新的头部与尾部。冻结头部与尾部的左右奇异向量及奇异值,只把尾部旋转矩阵 Gi+1 设为可训练,用新任务标注数据优化它。优化器为 Adam,论文说明每个方法跑 20 轮,学习率在第一个适配任务的新任务验证集上选择。这意味着学习率选择只看新任务验证性能,不偷看旧任务,这对公平比较很重要。

得到未合并解后,训练阶段还要做 1 次平均合并,把上 1 阶段权重与未合并解按 α 加权平均为新权重,再进入下一任务。梯度只在训练 Gi+1 阶段流动,平均合并阶段没有梯度更新,是确定性加权。推理时不做分解也不需要任务编号,直接用最终合并后的权重做前向,头部与尾部两路相加即为线性层输出。

论文未报告逐层学习率、批量大小与具体训练时长等完整硬件预算,这是复现时的缺项,不能从模型名称推定。监督来源明确为新任务标注数据,旧任务数据不可用;弹性权重巩固基线例外地用了英语数据估计重要性,论文已明确交代该特例,解读结果时要单独考虑其数据条件差异。

在什么数据、模型与对照上测,指标方向如何看?

模型为 OWSM v3.2 small,含 9 层 E-Branchformer 编码器与 9 层 Transformer 解码器,训练时带 CTC 分支,词表与参数规模等基本条件如下表所示。比较问题是:在相同参数预算与相同任务顺序下,哪种方法能在学好新任务的同时少忘旧任务。公平条件是所有参数高效持续学习方法只更新线性层权重矩阵且可训练量相近,任务从左到右顺序学习,最终用同一模型测所有任务。指标方向为平均词错误率越低越好,后向迁移越接近零或正值越好,负值表示遗忘。

项目内容数值说明适用条件
模型词表与总量输出词元与总参数50,000 与 366.7M冻结输出层OWSM v3.2 small
训练轮数与优化器每方法训练配置20 轮 Adam学习率按首个新任务验证集选所有线性层
参数预算与秩可训练量与秩比例约 9.0M,r 为 20,p 为 0.40低秩类与奇异值类对齐全部持续学习方法
正交投影基线顶部奇异方向数kOP 为 126约束更新在正交补内OPLoRA

上表整理了论文明确给出的可运行配置,数值写法保留原文。表后需要说明代价与边界。20 轮与约 9.0M 预算保证了高效约束,但学习率只按首个新任务验证集选择,可能对后续方言任务不是最优;冻结输出层减少了参数量,但也限制了词表层对新方言的适配能力。数据方面,英语、德语、西班牙语来自 Common Voice 且属于预训练语料,作为初始任务;实验一的新任务为荷兰语料库的荷兰荷兰语与比利时佛兰芒语,实验二的新任务为佛兰芒语与南荷兰方言语料中的强方言,方言难度更高。

对照包括全量微调与独立模型两个参照,以及低秩适配、低秩适配加平均、结构化奇异值分解、MiLoRA、OPLoRA、BiLoRA、弹性权重巩固结合低秩适配等基线。独立模型为每个任务单独微调并用任务 oracle 解码,只作为无遗忘上界,不能当作可部署收益。弹性权重巩固基线用了英语数据估计 Fisher 重要性,这与无旧数据假设有差异,比较时要记住这一额外信息条件。

主结果:谁的平均错误最低,遗忘减少了多少,代价是什么?

论文报告的主结果是学完所有任务后的各任务词错误率、平均词错误率与后向迁移。实验一中新任务相对温和,实验二中强方言导致遗忘更严重。总体显示,普通低秩适配与结构化奇异值分解能学会新任务,但旧任务词错误率上升超过 30 个点,遗忘甚至超过全量微调。MiLoRA 只改初始化不足以保留旧知识。正交投影低秩适配把低秩适配的遗忘降低约 15%,但在学第二个新任务时仍会从第一个新任务遗忘,说明保护 top-k 子空间之外仍有竞争。

在基线中表现最好的是低秩适配加平均与 BiLoRA,前者把低秩适配的遗忘降低约 90%,后者降低约 73%。BiLoRA 在新任务上更好,低秩适配加平均在保留旧知识上更好。本文方法在此基础上进一步把二者的平均词错误率降低 7% 到 22%。相对结构化奇异值分解,本文方法把遗忘降低约 95% 且保持对新任务的有效适配;相对低秩适配加平均,把遗忘再降约 45%,代价是新任务词错误率有轻微上升。实验二中本文方法把低秩适配的遗忘降低约 97%,把最强基线的遗忘降低超 50%,平均词错误率比最强基线好约 7%。

方法族可训练量级关键超参数更新位置遗忘控制手段
低秩类约 9.0Mr 为 20全矩阵低秩增量无或平均或正交约束
奇异值类约 9.0Mp 为 0.40顶部或尾部奇异方向旋转或平均
正交投影类约 9.0MkOP 为 126正交补低秩更新投影约束
本文方法约 9.0Mp 为 0.40,α 为 1/(i+1)尾部旋转重算头尾加平均
全量参照244.8M 级20 轮相同线性层全量无

上表按论文证据归纳了可运行策略的对照维度,没有为凑宽度添加无源列。表后必须讲反例与代价。代价一是为减少遗忘,本文方法与低秩适配加平均都没有达到低秩适配在强方言新任务上的低词错误率,说明保留与适配之间存在折中。代价二是弹性权重巩固基线在新任务间能平衡,但在初始任务上仍出现灾难性遗忘,尽管初始重要性只用英语估计却对西班牙语也有类似影响,说明该正则在语音上效果不稳定。未胜出项方面,普通低秩适配与结构化奇异值分解在两组实验中遗忘最严重,不能只看它们在新任务上的单点好结果就认为可用。

消融证明了什么,哪个部件最关键?

论文在实验一上做消融,以本文完整方法为参照,报告平均词错误率与后向迁移的变化。第一,保持初始头尾划分并用固定公式合并,与重算头尾加直接权重平均性能几乎相同,差异不显著。这支持重算实现是合理的简化,且在无奇异值交叉时与理论公式一致。

第二,跳过平均合并会显著增加遗忘与平均词错误率,但该变体仍优于表内所有基线。这说明只把适配限制在后 k 小奇异方向已经非常有益,平均是进一步增益而非唯一来源。把该变体与结构化奇异值分解对比,更能看出关键不在平均本身,而在动底部 k 还是顶部 k。第三,重新加入显式重缩放影响可忽略,证实近似旋转 alone 已足够,不必再学重缩放。

第四,把结构化奇异值分解直接加平均能显著减少其遗忘,但仍落后于本文方法且遗忘高约 50%,说明平均 alone 不够,子空间选择与变换形式同样重要。第五,把正交投影方法的 kOP 增大到与本文尾部可比,性能有所提升但仍不如本文方法,支持增益不仅来自限制在尾部,还来自尾部内允许的变换形式。综合看,限制在尾部是最关键部件,旋转形式次之,平均再次之,三者组合达到最佳。统计显著性用每句错误计数的 Wilcoxon 符号秩检验在 0.1% 水平评估,论文标注本文方法显著优于所有持续学习基线与全量微调。

哪些边界没有测,哪些结论不能推广?

首先,论文只在两组荷兰语系任务顺序上验证,初始任务固定为英语、德语、西班牙语,新任务为荷兰、佛兰芒与强方言。不同语种距离、更多任务步数或不同顺序下的稳定性尚未验证,总体趋势不等于每组每步都成立。其次,所有方法统一更新线性层权重矩阵且冻结输出层,若放开输出层或只更新编码器,结论可能变化,论文引用的已有工作曾指出只更新编码器可减少遗忘,但本文未在该条件下重测。

第三,方法对所有层统一分配尾部容量,没有按层 relevance 与干扰程度做选择性分配,论文在结尾明确把这列为未来方向。这意味着当前结果是在均匀预算下的表现,不能推广为每层最优。第四,训练资源、推理开销、输出帧率与实际延迟没有测量,参数量小不等于延迟低,奇异值分解的重算成本与推理时的合并权重是否带来额外开销需要单独测量,不能承诺这些量得到改善。

第五,弹性权重巩固基线用了英语数据估计重要性,与严格无旧数据假设不一致;学习率只按首个新任务验证集选择,对后续任务可能次优。这些信息条件差异限制了跨方法因果解释,缺失证据不是技术错误,但比较时必须保留这些条件,不能把相关性当成因果。

要复现应先做什么,需要哪些超参数与信息条件?

复现先做三件事。第一,按论文仓库准备 ESPnet2 环境与 OWSM v3.2 small 权重,确认 Common Voice 英语德语西班牙语作为初始任务已在预训练中见过,荷兰语料库与南荷兰方言语料按论文切分为荷兰荷兰语、佛兰芒语与强方言。不要自行更换切分或聚合口径,否则词错误率与后向迁移无法对齐。第二,锁定只更新线性层权重矩阵、冻结输出层的代码路径,对每层取 d 为输入输出维度较小值,论文中均为 768,以 p 为 0.40 得到 k。第三,实现 3 步循环:重算奇异值分解划分头尾、只训练 Gi+1、按 α 为 1/(i+1) 做权重平均。

关键超参数按原文保留:低秩类秩 r 为 20,正交投影基线 kOP 为 126,持续学习方法可训练量约 9.0M,全量微调同层参数约 244.8M 级,每方法跑 20 轮 Adam,学习率按首个新任务验证集选择。评价时用最终模型测所有任务词错误率并计算平均值,后向迁移按最终相对刚学完时的平均下降计算,显著性用每句错误计数的 Wilcoxon 符号秩检验。

代码层面仓库当前可用,可下载运行;权重下载与系统可运行是不同事项,论文只声明代码可用,没有给出权重分发与一键运行保证,复现前需确认权重获取与解码脚本。还需补的验证是记录重算奇异值分解的耗时、平均合并前后的各任务性能,以及去掉平均或改动顶部与尾部的对照,以确认三部件各自贡献。

何时值得尝试这种尾部旋转加平均?

当任务满足 3 个条件时值得尝试:已有大语音基础模型且初始任务数据不可用,推理时不能给任务编号只能用同一模型,新任务与旧任务共享声学与语言结构但存在口音或方言偏移。此时把适配限制在低能量尾部可以保护主成分,跨任务平均可以缓解尾部内的任务间覆盖。论文在两组基准上显示了更低的平均词错误率与更小的遗忘,支持在该条件下优先试尾部旋转而非顶部奇异方向微调。

当新任务需要大幅改变主成分或输出词表时要谨慎。实验二显示强方言下为保旧知识会牺牲新任务的部分适配幅度,若业务更看重新方言单点性能而非平均性能,可能需要增大尾部比例或放宽平均权重,但这会重新引入遗忘,需要按验证集权衡。常见误解是把参数少等同于又快又不忘,实际上不忘主要来自头尾划分与平均,参数少只保证高效;另一个误解是把独立模型的上界当成可部署收益,独立模型依赖任务 oracle,不能直接对比。

收束一句话:先固定头部、只在尾部学近似旋转、每步重算头尾并平均,是本文在证据范围内被支持的做法;是否适用于更多语种与更长任务流,仍待验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总