英文题目:Confidence-Gated Mean-Teacher Consistency Regularization for Low-Resource Multilingual ASR with Shared–Private Fusion-LoRA
会议身份:
conference:interspeech:2026:conference-paper-id:liu26h_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#LoRA #低资源 #多语言 #语音识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jie Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Liang He:机构信息未能从会议 PDF 纯文本可靠映射
- Longwei Li:机构信息未能从会议 PDF 纯文本可靠映射
- Qingyuan Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Xuejian Zhao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
低资源多语言自动语音识别需将多语言语音转写为对应文本,难点在于标注稀缺导致监督不足,而联合训练中高资源语言挤占低秩适配容量引发负迁移。所提框架冻结Whisper-small骨干并分结构与训练两路推进:共享私有融合低秩适配将每层增量分解为跨语言共享分支与语言私有分支,再以逐语言可学习系数融合两路输出以隔离干扰并保留迁移;均值教师对可训练适配参数做指数滑动平均,为双增强视图提供更平滑的一致性目标;基于教师最大词表概率的置信门控仅保留高置信词元的KL一致性损失,并经两阶段训练与阈值调度避免早期噪声。与全共享适配相比,机制差异在于结构解耦处理空间干扰而时序集成加可靠性过滤处理监督噪声。在Kathbath基准测试集下,whisper-small+SPF-LoRA+MT-CR的WER为19.85%,低于whisper-small+LoRA的WER 30.73%。该结论仅在 Kathbath 所选五种印度雅利安语及冻结 Whisper-small 设置下验证,未验证跨语系与大规模数据外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么低资源多语很难?
本文的输入是语音,目标是自动语音识别。研究对象是刚进入语音领域的研究生需要先建立的基本图景:模型听到一段读音,要输出对应的文字转写。对于资源充足的语言,大量配对语音文本可以同时训练声学建模与语言生成。但对于低资源语言,标注语音很少,模型既要学会听清音素,又要学会拼写与词汇,监督信号天然不足。
论文研究的多语低资源场景进一步把难度叠加。做法是把古吉拉特语、印地语、马拉地语、旁遮普语和乌尔都语等多个印度语言放在一起训练,希望高资源或相似语言的知识迁移到低资源语言。直观上这像是让几个学生共用一本笔记,通用发音规律可以共享。但论文指出,当可训练参数被压缩到低秩适配的小容量里,不同语言会被迫在同一个小子空间里竞争。高资源语言更容易主导优化,低资源语言的分布被迫去适应不匹配的声学与文本分布,于是出现负迁移。
第二个难点是弱监督下的自训练。标注少时,人们常希望利用增强后的一致性或伪标签挖掘更多信息。做法是把同一句话做两种扰动,要求模型 2 次输出一致。但在低资源下,模型本身的输出分布就不稳定,强增强又放大不确定性。如果直接把自己的预测当老师,就会把对齐噪声和错误不断强化,形成确认偏误。因此论文要解决的不是要不要共享和要不要一致性,而是如何让共享不互相踩踏,如何让一致性只学可靠的部分。
本解读的输入是论文原文证据与两张官方原图像素,目标是把方法讲到可核对、可复述。必须保留的信息包括结构如何分叉、教师如何更新、损失如何门控、实验条件如何控制。输出是一套按学习依赖展开的说明:先讲任务与相关路线,再讲全景与组件,再讲训练与实验,最后讲结果、边界与复现动作。
已有路线在同输入同目标下各自解决了什么,还缺什么?
在相同的输入与目标下,已有工作大致沿 3 条路线推进。第一条是多语联合训练与参数共享。它的动作是把多种语言的数据混在一起,用同一套参数学习通用表示。优点是能复用语音与文本的共性,缺点是在参数高效微调下容量更紧张,论文引用相关研究说明这会导致适配容量竞争和梯度冲突。
第二条是以 Whisper 为代表的大规模多语预训练加参数高效微调。动作是冻结主干,只训练低秩增量或提示等小参数。低秩适配把每层线性层的改变量写成两个小矩阵的乘积,用很小的秩控制参数量。这种做法节省显存与训练成本,在低资源下成为主流选择。但正因为可训练部分很小,多语共享同一低秩更新时更容易互相挤占,这是本文要做结构解耦的直接动机。
第 3 条是一致性学习与自训练。动作是对同一语音生成两个增强视图,要求输出分布接近,或用历史平均模型提供更平滑的目标。平均教师是其中一种时间集成做法,教师参数是学生参数的指数滑动平均。相关工作还包括对不确定性敏感的自训练。论文的判断是,这些方法在低资源下更脆弱,因为输出不稳定加增强扰动会带来噪声对齐。
已有思路提示需要构造可靠的教师信号,但如何与参数高效结构结合、如何过滤不可靠 token,仍需要具体设计。本文的增量正在于把结构解耦与带门控的时间集成放在同一个冻结主干框架里验证。
论文把多语干扰与不可靠监督拆成哪两个可操作问题?
论文把挑战拆成结构侧与训练侧两个可操作问题。结构侧问题是共享过度。标准低秩适配对每个线性层只学一个低秩增量,多语共用它时,不同语言的梯度在同一参数上拉扯。论文描述的结果是低资源语言去适应不匹配的分布,标注越少退化越明显。这不是简单的数据不平衡,而是容量与梯度层面的干扰。
训练侧问题是监督不可靠。标注少时,一致性约束本想利用无额外标注的信息,但教师预测本身不可靠。强增强下的两个视图可能对应不稳定的对齐,直接做分布对齐会引入噪声。如果不加过滤地强化自身预测,错误会被反复巩固。
低秩适配 × 负迁移: 低秩适配指冻结主干只训练低秩增量矩阵的参数高效微调,负迁移指多语联合训练反而拖累部分语言的现象,二者搭配讨论的理由是低秩把可训练容量压缩到很小的子空间,高资源语言更容易主导优化方向,组合意义在于说明结构上必须显式分配共享与专用容量,而不是只靠联合训练。
从复述角度,读者要先记住两个判断条件。第一,是否观察到联合训练后某些语言反而变差,特别是最难的语言掉得最多,这指向负迁移。第二,一致性损失打开后是否波动或没有增益,特别是去掉门控后增益消失,这指向不可靠监督。论文后续的结构消融与训练消融正是围绕这两个判断展开。
沿一个样本走完输入到损失:双分支与双视图如何配合?
先沿一个语音样本走完全流程。输入是一段梅尔谱。训练时对它做 2 次随机增强,得到两个视图。右侧学生看到第一个视图,左侧平均教师看到第二个视图。学生与教师共享同一个冻结的 Whisper 主干,区别只在于可训练的适配参数:学生持有当前正在优化的共享与私有低秩参数,教师持有这些参数的历史滑动平均。
在每个需要适配的线性层里,输入向量同时走 3 条路径。冻结路径保留原始权重的作用,共享路径输出跨语言通用增量,私有路径根据当前语言标识选择对应语言的低秩分支,再乘以该语言的可学习融合系数。三者相加得到该层的有效输出。这样,通用知识有地方放,语言特性也有地方放,融合系数负责在两者之间权衡。
在输出端,学生对第一个视图计算常规的交叉熵监督损失,需要真实转写作为目标。同时,教师对第二个视图给出分布预测,学生在教师高置信的位置上向教师分布靠拢,用门控后的散度作为一致性损失。总损失是监督损失加随时间 ramp 的一致性损失。训练分 2 个阶段:先只用监督损失把双分支训稳,再打开教师与一致性约束,并把阈值从宽松变严格,避免早期噪声干扰收敛。
下面这张总览图把上述路径画在了一起,阅读时重点看数据从下往上、损失从上往下、教师从右往左的 3 组箭头。
本段为图前导读,说明该图包含学生与教师双塔、底部双增强视图、顶部双损失汇合以及右侧 3 路径放大的完整训练管线,阅读应先分清可训练与冻结部分,再看门控与 EMA 的位置。
看图路径: 1. 先从底部梅尔谱沿两条增强箭头分别找到学生视图与教师视图;2. 再确认教师侧由学生侧经 EMA 虚线更新,且主干均为冻结图标;3. 然后观察顶部监督损失与置信门控 KL 损失如何汇入总损失;4. 最后看右侧放大部分三条路径如何相加得到融合输出
论文图 1。原论文 Figure 1:“Overall SPF-LoRA and MT-CR training pipeline.”。
该图显示底部同一梅尔谱经增强得到两个不同视图,分别送入学生与教师;两塔均由冻结主干加可训练适配组成,教师适配由学生适配经 EMA 更新;顶部学生预测产生监督损失,教师预测经置信门控后与学生预测形成一致性损失,两者加权为总损失;右侧放大显示冻结原始权重、共享低秩与按语言开关选择的私有低秩经融合系数相加。这种画法把结构解耦放在空间维度,把时间集成与可靠性过滤放在监督维度,两者在学生参数处交汇。
共享-私有融合低秩适配:容量如何分,融合系数如何学?
标准低秩适配的动作是把权重增量写成下投影与上投影两个小矩阵的乘积,并用缩放系数控制强度。论文把它显式拆成两项。有效权重等于原始冻结权重,加上所有语言共享的低秩增量,再加上当前语言私有低秩增量乘以该语言的融合系数。共享增量捕捉跨语言共性,私有增量捕捉该语言特有的声学与文本差异。
关键效果是梯度分流。语言特有梯度主要留在私有分支里,减少对共享表示的直接干扰,同时仍保留跨语言迁移的好处。训练时只有低秩参数与融合系数被优化,主干保持冻结。论文把该结构作用于编码器与解码器后部若干块的注意力投影与前馈线性层,用秩与缩放的具体取值控制容量。
融合系数的实现有两种参数化。默认做法是为每种语言维护一个标量,经 Sigmoid 映射到零到一之间;对照做法是直接使用无约束标量。训练中该系数自适应调整共享与私有的相对贡献。直观理解是,如果某语言与通用模式差异大,模型可以调高私有分支的权重;如果某语言数据更少、更依赖迁移,则可以更依靠共享分支。
共享分支 × 私有分支: 共享分支负责学习跨语言可复用的通用声学与文本表示,私有分支负责为每种语言保留特有的发音与分布差异,二者搭配的理由是单一共享低秩空间会被迫竞争而产生负迁移,组合意义在于用可学习融合权重让语言特有梯度主要留在私有分支,减轻对共享表示的干扰。
平均教师 × 一致性正则: 平均教师指用指数滑动平均维护的学生参数副本,提供更平滑的预测目标,一致性正则指要求同一语音在不同增强视图下输出分布接近,二者搭配的理由是低资源下单步预测不稳定而强增强会放大不确定性,组合意义在于用时间集成后的教师作为更可靠的一致性监督源。
需要提醒初学者:共享加私有不是简单相加。论文的结构消融显示,固定系数为一的直接相加反而退化,说明不受控的分支求和会引入竞争与噪声累积。可学习门控的意义在于让每种语言自己决定用多少专用容量,这是全文反复验证的核心结构假设。
置信门控平均教师:教师更稳在哪里,噪声如何被挡掉?
平均教师的更新动作只针对可训练部分。教师的低秩参数与融合系数是学生对应参数的指数滑动平均,动量接近于一,冻结主干由双方共享。这样教师相当于对学生近期轨迹做时间平均,预测更平滑,不需要额外维护一套主干,因此保持参数高效。
数据动作是双视图。同一语音经两种随机增强得到两个输入,学生预测第一个视图,教师预测第二个视图,且在相同的教师强制条件下比较。增强包括一定概率的加噪、变速与音量扰动,目的是考验模型在扰动下的输出稳定性。
可靠性过滤的动作在解码的每个步骤上进行。教师在该步的最大类别概率被当作置信度,只有超过阈值才保留该步的一致性约束。一致性损失是被门控加权的教师与学生分布之间的散度,再按有效步数归一化。为数值稳定,分母加了很小的常数。阈值本身从较低值逐渐升到较高值,体现先宽松后严格的思路。
置信门控 × 确认偏误: 置信门控指只在教师最大类别概率超过阈值时才施加一致性损失,确认偏误指把自身错误预测当作监督而不断强化错误,二者搭配的理由是一致性学习在低资源下容易引入不可靠自目标,组合意义在于用可靠性过滤抑制噪声一致性信号,只保留高置信 token 的约束。
从计算目标看,监督损失负责把学生拉向真实转写,一致性损失负责把学生在高置信位置拉向教师的平滑预测。权重系数随训练 ramp 上升,避免早期教师还不稳时施加过强约束。消融中去掉门控后增益消失,而加上门控后宏平均与最差语言同时明显改善,支持门控本身是关键,而不是平均教师或双视图 alone 带来的偶然增益。
两阶段训练与调度:先训什么,再打开什么,阈值如何变?
训练协议分为两个阶段。阶段一是只优化监督损失,训练双分支结构与融合系数。这一步让共享与私有分支先学会基本的转写能力,避免教师与一致性信号在模型还很弱时引入噪声。阶段二是启用平均教师与一致性项,同时对一致性权重做 ramp 调度,对置信阈值做从宽松到严格的调度。
具体调度按原文交代是,一致性权重经过一段预热与更长的 ramp 后上升到设定值,置信阈值在数千步内从较低值升到较高值。增强在两个视图上随机施加,加噪、变速与音量扰动各有概率与范围。优化时有效批量由单卡批量与梯度累积相乘得到,学习率与预热步数、记录与验证间隔都有明确设置。
梯度路径需要准确理解。学生侧的低秩参数与融合系数接收监督损失与一致性损失的梯度,教师侧不直接接收梯度,而是通过滑动平均跟随学生。冻结主干不更新,也不参与平均带来的额外开销。论文未报告优化器类型与权重衰减等细节,这部分属于缺项,复现时需要按常用配置补齐并记录,不能从模型名称推定实现。
另一个缺项是阈值调度的精确函数形状与一致性权重的 ramp 曲线。原文只给出起点、终点与步数区间,没有给出每步公式。教学上应把这理解为单调上升的调度,而不是某个特定曲线。复现时应先实现线性 ramp 与线性阈值,再通过验证集观察早期波动是否被抑制。
数据、划分、模型与指标:比较在什么条件下成立?
数据是 Kathbath,包含多个印度语言的朗读语音文本对,转写来自维基与新闻等公开文本,主题与词汇多样,也是 IndicSUPERB 的重要组成部分。论文聚焦识别任务,严格遵循官方训练验证测试划分以保证可比性与可复现性。所选 5 个目标语言是古吉拉特语、印地语、马拉地语、旁遮普语和乌尔都语,覆盖不同书写系统、语音特点与形态变化,在低资源下呈现不同数据规模与难度。
模型条件是 Whisper-small,主干冻结,只训练注入到后部编码器与解码器块的适配结构。注意力投影与前馈线性层都被纳入注入范围,秩、缩放与丢弃率有明确取值。训练在一张特定型号显卡的服务器上进行,训练轮数、批量、学习率与验证间隔都有记录。基线包括零样本的小模型与中模型、加普通低秩适配的小模型与中模型,以及混合专家低秩方法,比较时保持相同数据划分。
指标方向需要先讲清。主比较用词错误率,越低越好,并用五语宏平均汇总整体水平。论文还报告字符错误率,因为它受分词影响更小,更能反映跨语言干扰。负迁移分析用本方法相对普通低秩的字符错误率差值,负值表示改进。聚合对象是语言级别先算错误率再平均,而不是把所有句子混在一起算,这对理解最差语言指标很重要。统计显著性与多次随机种子在原文中没有报告,这是明确的缺项,不能把单次运行的差距解读为必然显著。
主结果:整体下降多少,最难语言改善多少,代价是什么?
比较的问题是,在相同五语与相同划分下,结构解耦加门控一致性是否同时改善整体与最难语言。公平条件是都基于 Whisper 主干与低秩类适配,指标方向是词错误率越低越好。零样本直接迁移的误差很高,说明预训练不能直接解决这些低资源语言。普通低秩与混合专家低秩能大幅降低误差,但多语干扰仍然存在。
下表把原文连续句子中实际出现的关键数字整理成可核对的形式,重点看宏平均与古吉拉特语两列,表中单位保留原文的百分比写法,数值精度与原文一致。
| 方法 | 宏平均 WER | 古吉拉特语 WER | 对照含义 | 适用条件 |
|---|---|---|---|---|
| 零样本 Whisper-small | 84.70% | 未在同句报告 | 直接迁移 | Kathbath 五语宏平均 |
| Whisper-small 加 LoRA | 30.73% | 未在同句报告 | 参数高效基线 | 相同划分 |
| MAS-LoRA | 29.47% | 未在同句报告 | 混合专家对照 | 相同划分 |
| SPF-LoRA 不加一致性 | 23.93% | 38.86% | 结构解耦 | 相同划分 |
| SPF-LoRA 加 MT-CR | 19.85% | 25.04% | 结构加门控教师 | 相同划分 |
上表的主要收益是宏平均从零样本的很高水平逐步下降,结构解耦带来明显下降,门控一致性进一步下降到最低值。古吉拉特语作为最具挑战的语言,从结构阶段的高位降到门控阶段的低位,说明稳定监督对难语言帮助更大。具体代价是结构与训练复杂度上升,需要维护私有分支、融合系数、教师副本与 2 阶段调度。未胜出项也要说明: Hindi 在完整方法下相对结构阶段略有回升, Urdu 改善幅度较小,说明总体趋势不等于每种语言单调变好。原文还报告用更小的骨干超过了中模型加低秩的宏平均,这是值得尝试的信号,但受限于单次运行与特定划分,待更多种子验证。
下面这张柱状图从字符错误率角度补充负迁移分析,阅读时注意纵轴是差值而不是原始误差。
本段为图前导读,说明该图展示 5 种语言上本方法相对普通低秩的字符错误率差值,横轴为语言代码,纵轴为差值百分比,负方向表示本方法更好,需要逐柱比较改善幅度。
看图路径: 1. 先确认纵轴是本方法减去 LoRA 的 CER 差值,负值表示改进;2. 再比较五个语言柱的向下长度,找出最长与最短的语言;3. 最后核对柱下标注的具体差值数字与正文描述是否一致
论文图 2。原论文 Figure 2:“Per-language ∆CER(%) relative to LoRA baseline”。
该图可见 5 个语言的柱全部在零线以下,说明字符级别上五语相对普通低秩都有改善。其中古吉拉特语柱最长,对应差值约为负 13.82%,旁遮普语与乌尔都语次之,印地语居中,马拉地语最短,仅约负 1.22%。这种不均匀改善支持论文的判断,即方法对最困难的尾部语言效果更明显,但也不能把最长柱推广为所有语言都有同等增益,马拉地语的小幅改善就是具体的反例边界。
拿掉结构或门控会发生什么,哪部分是真正关键?
消融围绕两个问题组织。第一,共享与私有如何分才有效。第二,平均教师与置信门控各自贡献多少。条件是固定其他部分,只改被测组件,指标仍看宏平均与最差语言词错误率,越低越好。
结构侧,纯私有最差,说明只靠语言特有分支会削弱可迁移知识的共享。纯共享的宏平均尚可,但最差语言误差很高,说明纯共享仍易受跨语言干扰。固定系数为一的直接相加反而退化,说明不受控的求和会带来竞争与噪声。可学习融合的版本在整体与最差语言之间取得最好平衡,这是结构解耦加自适应权衡有效的证据。
训练侧,以固定结构为基础,不加一致性时宏平均与最差语言处于高位。同模型双视图自一致性只有适度改善,去掉门控的平均教师没有进一步好处,可能是不可靠教师目标引入噪声。加上 token 级置信门控后达到最低的宏平均与最差语言误差,固定阈值与调度阈值结果相近,说明主要增益来自门控本身,而不是调度形状。
注入范围的消融显示,从较小的注意力子集扩大到包含更多投影与前馈层的范围时,性能持续提升,最宽范围达到最好结果,并在宏平均与最差语言上相对最小范围有大幅绝对下降。论文的表述限定在当前共享私有设置下更宽覆盖经验性更好,这是一种有限解释,不能推广为注入越多永远越好,因为未测量参数量与推理开销的变化。
下表用原文明确报告字符错误率差值的连续原句整理五语细节,单位保留原文百分比写法,用于支撑负迁移是否被缓解的判断。
| 对比 | gu | hi | mr | pa | ur |
|---|---|---|---|---|---|
| 本方法减 LoRA 的 CER 差值 | -13.82% | -4.25% | -1.22% | -6.40% | -5.88% |
上表说明五语差值均为负,即五语都有改善,但幅度差异很大。最大增益在古吉拉特语,最小在马拉地语。这种分布提示,尾部语言获益更多,但马拉地语的小幅改善也提醒不能把平均增益当作每语承诺。未评测边界包括噪声环境、口音与自发语音,原文没有覆盖,不能外推。
哪些结论还不稳,哪些成本没有被测量?
首先是证据强度。论文直接报告的是词错误率与字符错误率在特定划分上的数值,支持结构解耦与门控一致性有效。但这属于单数据集、五语、单骨干与有限轮数的证据,没有报告多种子方差与显著性检验,因此只能说报告显示改善,不能说在所有低资源多语上必然成立。
其次是成本缺项。训练资源只交代了显卡型号与批量轮数,没有报告总时长、显存峰值与教师维护带来的额外开销。推理开销、输出帧率与实际延迟没有测量,不能承诺这些量得到改善。私有分支按语言增加参数,融合系数按语言增加标量,注入范围扩大也会增加可训练量,这些都是具体代价,但在原文中没有折算成可部署成本。
第三是超参数与调度的可迁移性。一致性权重、阈值起点终点、增强概率与范围都是在当前数据与骨干上验证的,换语言组合或换骨干时是否仍适用待验证。阈值调度形状、优化器细节与随机种子影响属于未报告项,复现时应明确记录。
第四是资源可用性。资源状态是正文开源声明的唯一依据,本次没有发现来源绑定且完成验证的资源,因此不得声称代码模型或数据已公开。Kathbath 本身是公开基准,但本方法的具体实现是否可运行本次未能确认,复现应先按论文文字重写,再补验证。
最后是误解澄清。更宽注入更好只是在当前设置下的经验结果,不是结构定理。门控有效不等于阈值越高越好,过严会丢掉太多监督。平均教师更稳不等于教师永远正确,低置信部分被丢掉恰恰是因为教师也可能错。
要复现这套方法,先做什么,再补哪项验证?
复现的第一步是准备数据与划分。获取 Kathbath 的 5 个目标语言,按官方训练验证测试划分组织,保证与论文可比。检查转写来源与词汇多样性,记录每种语言的时长与句数,因为数据规模差异会影响对负迁移的判断。指标先实现词错误率与字符错误率,宏平均按语言先算再平均,最差语言单独记录。
第二步是实现冻结主干加双分支。用 Whisper-small 并冻结全部主干参数,只在后部若干块的注意力与前馈线性层注入共享低秩与语言私有低秩。为每种语言维护融合系数,默认经 Sigmoid 限制在零到一之间。先跑阶段一,只用监督损失训练,观察宏平均是否从普通低秩基线下降,以及最差语言是否同步改善。
第三步是加入双视图与教师。实现加噪、变速与音量扰动,生成两个增强视图。维护可训练参数的滑动平均作为教师,动量取接近于一的值。一致性权重先做预热与 ramp,阈值从宽松升到严格,只在教师高置信步上计算散度。阶段二打开后,重点观察最难语言是否继续下降,以及去掉门控后增益是否消失,以此验证门控的必要性。
还需补的验证包括多种子重复、不同语言组合、不同骨干规模,以及训练时长与显存记录。如果要部署,还要测量推理延迟与私有分支带来的参数增量。所有补齐的配置都要与论文已报告的批量、学习率、秩与注入范围分开标注,区分直接复现与新增验证。
何时值得尝试这套组合,记住哪两条可执行规则?
当你的任务同时满足 3 个条件时,这套组合值得尝试。第一,多语放在一起微调,且观察到某些语言被拖累,特别是难语言掉得最多。第二,标注很少,想用增强一致性挖掘信息,但直接加一致性波动或无效。第三,可以接受冻结主干,只增加少量可训练参数与 2 阶段调度。
记住两条可执行规则。第一,先分容量再谈共享。为每层保留共享与私有两条低秩路径,用可学习系数让语言自己决定专用比例,不要用固定求和代替门控。第二,只学可靠的一致性。用滑动平均教师提供平滑目标,用置信阈值挡掉低置信步,先宽松后严格,并保留去掉门控的对照。
回到全文证据,结构解耦把宏平均降到二十 23.93% 附近,门控一致性进一步降到 19.85 附近,且五语字符差值均为负。这支持解耦加过滤在当前五语上有效,但 Hindi 的小幅回升、马拉地语的小幅改善以及缺失的成本与显著性证据,决定了它仍是待更多验证的实用选择,而不是通用保证。研究生复述时应能画出 3 路径融合与双视图门控两张草图,并说清冻结了什么、平均了什么、过滤了什么,这就达到了可核对的标准。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

