英文题目:Adaptation de domaine de Whisper à l’aide de l’apprentissage auto-supervisé

会议身份:conference:jep:2026:conference-paper-id:bagat26_jep

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #领域适应 #自监督学习 #语音识别

评分:7.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Raphaël Bagat:机构信息未能从会议 PDF 纯文本可靠映射
  • Irina Illina:机构信息未能从会议 PDF 纯文本可靠映射
  • Emmanuel Vincent:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

空中交通管制语音的自动语音识别以管制员与飞行员的噪声通话为输入并输出转写文本,难点集中在非母语口音、低信噪比与专用短语结构导致的域偏移。所提方法域适应编码器重训与蒸馏 BEST-RQ Encoder Adaptation with Re-training and Distillation (BEARD) 先复制冻结教师编码器并保留可训学生编码器,再对学生中间层施加随机投影量化预测以学习目标域声学表示,随后在未掩蔽区域用两路余弦蒸馏约束中间层与输出层贴近教师,最后将适配后编码器与原解码器用少量标注语音联合微调。与直接在编码器输出做自监督预训练不同,该方法刻意避开顶层并用双重蒸馏维持编码器解码器接口稳定,使声学适应不破坏语言解码。在空中交通管制语料 Air Traffic Control 2 (ATCO2) 四折交叉验证下,最优配置相对同量标注微调基线将词错误率 Word Error Rate (WER) 相对降低 12%。该结论目前仅在小型编码器解码器模型与单一噪声管制域内验证,对更大模型、多语言混合及其他噪声域的外推尚未证明。单轮大规模重训在 8 卡 V100 上耗时约 7 小时,推理沿用贪婪搜索而无额外开销。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要解决哪一个低资源矛盾?

本文的输入是两类语音。第一类是大量无转写的空中交通管制语音,论文使用的 ATCO2 无转写部分为 5381 小时。第二类是极少量有人工转写的同领域语音,每个交叉验证折中用 2 小时 24 分约 25000 词做微调,36 分约 5300 词做验证,1 小时约 10000 词做测试。目标是自动语音识别,也就是把语音波形对应的文字转写出来,评价指标是词错误率,越低越好。必须保留的关键信息是领域特点与数据配比:空管语音是非母语、语速快、噪声大,报告信噪比从负 10 分贝到 40 分贝,短语高度专门化。

有标注部分只有 4 小时,其中仅 1 小时可免费获得,而无标注部分有数千小时。输出是先用无标注数据改造编码器,再用少量标注把编码器加解码器一起微调,并在同一 ATCO2 划分上与直接微调比较。学习依赖上,读者需要先理解编码器解码器分工,再理解掩蔽预测如何从无文字数据造出训练信号,最后理解蒸馏如何防止新表示让旧解码器读不懂。

教学例子:可以把空管员说的一句带呼号和高度指令的英文想象成一个样本,它经过对数梅尔谱图进入编码器,编码器输出帧级表示,解码器再自回归生成词序列;本文不改变这个推理链,只改变编码器在重训阶段见过什么数据和受什么损失约束。

已有路线有哪些,同输入同目标下它们缺了哪一块?

论文把相关路线分成 3 条。第一条是有监督微调,直接用标注语音更新模型。证据中 XLS-R 在 132 小时多语料空管标注上微调后在 ATCO2 上报告 19.80%,Whisper-small 在 52 分 ATCO2 上微调报告 22.79%,作者自己用 2 小时 24 分微调得到 19.54%。这类方法的监督来源是人工转写,优点是目标直接,缺点是标注贵,在空管领域尤其稀缺。第二条是自学习加伪标签,先用标注训教师模型,再给无标注语音打伪标签训学生模型。

论文补了一个用 3500 小时 ATCO2 无转写做伪标签的实验,得到 25.97%,比直接微调更差,说明在大噪声和专门短语下教师错误会被放大,且对数千小时做解码打标签计算很重。第 3 条是自监督预训练,如 wav2vec2.0 用对比学习预测被掩蔽表示,HuBERT 用聚类量化标签做类 BERT 预测,BEST-RQ 用固定随机投影量化器产生离散标签。这类方法传统上是从零训练编码器,之后再加解码器做识别,文中引用的近期工作也是从零学空管编码器。

缺的一块正是本文切入点:Whisper 已经是强有监督编码器加解码器配套系统,不能从零重来,也不能只动编码器而不管解码器是否还匹配。因此 BEARD 不是提出新的量化器,而是把 BEST-RQ 搬到已有 Whisper 编码器的中间层,并加上蒸馏守住配套关系。按同输入同目标比较,只有同样用 Whisper-small 加同样 2 小时 24 分微调的直接微调基线是公平对照,XLS-R 加外部语言模型的 19.80% 因模型和解码条件不同只能作文献参照,不能当同条件胜负。

为什么直接把 BEST-RQ 套在 Whisper 编码器上会失败?

问题可以拆成两步。第一步是表示漂移。BEST-RQ 的损失要求编码器去预测随机量化标签,这个目标与 Whisper 原来的人工转写目标不同。如果把该损失直接加在编码器输出层并更新编码器,编码器输出空间会被推向适合预测量化标签的方向。第二步是解码器失配。

Whisper 解码器在训练时只见过原来编码器的输出分布,它没有参与重训,也没有被 BEST-RQ 更新。当编码器输出变了而解码器没变,解码器读到的就是它没见过的表示,识别就会崩。论文的消融直接报告了这个后果:只用 BEST-RQ 损失而不用任何蒸馏时词错误率是 80.98%,比不微调的 63.32% 还差,说明编码器确实被推离了解码器。另一个常见的误解是以为只约束中间层就够了。论文显示只用第ℓ层蒸馏时词错误率仍是 37.28%,说明光守住中间一层不能保证最终送给解码器的末层表示仍然可用。

只有同时守住中间层和末层,才把上游学习到的新声学特征一路护送到解码器入口。因此本文要解决的不是有没有无标注数据,而是如何在利用无标注数据的同时维持编码器解码器配套。

BEARD 的全景是什么,一个样本走完哪条路?

BEARD 的全景分两个阶段。第一阶段叫重训,不用解码器,不用文字。准备两个 Whisper 编码器拷贝:学生编码器记为 S,可更新;教师编码器记为 T,冻结。同一段无标注语音做成两个版本:完整版送给 T 和量化器,掩蔽版送给 S。

S 的第ℓ层输出接一个可训练投影头去预测被掩蔽帧的离散标签,同时 S 的第ℓ层和末层在未掩蔽帧上向 T 的对应层看齐。第二阶段是微调,把 S 与原来的 Whisper 解码器重新拼接,用同领域少量标注一起更新,不再用 BEARD 损失。组合机制的白话解释是:BEST-RQ 是油门,负责往新领域走;知识蒸馏是方向盘和安全带,负责不偏离解码器能理解的路线。

BEST-RQ × 知识蒸馏: BEST-RQ 负责从无标注语音学新领域声学模式,它用固定随机投影量化器给被掩蔽帧生成离散标签并训练编码器去预测;知识蒸馏负责守住与预训练解码器的兼容,它让学生编码器在未掩蔽帧上靠近冻结教师编码器;二者搭配的原因是只有前者会推开表示,只有后者能拉回表示,组合后才能既适应又可用。

下面先看整体结构图,理解左右两条损失分别从哪里取表示、送到哪里比较。图前导读已经说明观察顺序,读者应先确认输入分叉,再确认左侧分类头与右侧相似度比较的位置,这样后文讲第ℓ层选择和权重时才有落点。

看图路径: 1. 先从底部两张频谱图看起:下面是原始输入,上面是带灰色遮挡的掩蔽输入,确认掩蔽分支只进红色学生编码器;2. 再看左侧蓝色链路:随机投影加码本产生离散标签,投影头从第ℓ层输出预测这些标签,对应损失 Lq;3. 再看右侧两条黑色箭头:学生第ℓ层与绿色冻结教师第ℓ层比较得到 Ll_d,学生末层与教师末层比较得到 Ln_d;4. 最后看右下图例:火焰图标表示可训练模块,雪花图标表示冻结模块,核对教师与量化器是冻结的

原论文 Figure 1:Architecture de l’approche BEARD proposée.

论文图 1。原论文 Figure 1:“Architecture de l’approche BEARD proposée.”。

该图左侧显示离散标签如 250、254、365、1688、34、1017、492,其中 1688 与 1017 旁有绿色对号表示预测正确,254 预测成 365 旁有红色叉号表示预测错误,这些标签来自左下固定随机投影加码本,投影头从学生第ℓ层输出做预测。中间红色块是可训练学生编码器,右侧绿色块是冻结教师编码器,顶部两条线分别对应末层蒸馏损失与第ℓ层蒸馏损失。底部紫橙色块是语谱图,灰色块是被掩蔽区域,箭头表明掩蔽版只进学生,完整版进教师和量化器。看懂这个分叉,就能理解为何蒸馏只在未掩蔽帧计算:被掩蔽帧在学生端没有真实声学输入,若强行与教师比较会引入噪声。

三个损失各自算什么,冻结与更新边界在哪里?

先讲术语。编码器是把谱图变成帧表示的 Transformer 堆叠,Whisper-small 是 12 层。解码器是根据编码器表示生成文字的自回归 Transformer。BEST-RQ 损失记为 Lq,它是分类损失,输入是第ℓ层表示经投影头得到的 logits,目标是随机量化器给每帧定的码本编号,只在被掩蔽帧上计算。第ℓ层蒸馏损失和末层蒸馏损失都用余弦相似度,目标是最大化学生与教师在对应层、对应未掩蔽帧上的方向一致。白话说,分类损失教模型认出被遮住的声音大概属于哪个随机桶,蒸馏损失要求没被遮住的部分不要走样。

Whisper 编码器 × Whisper 解码器: Whisper 编码器负责把对数梅尔谱图变成声学表示,Whisper 解码器负责把该表示变成文字序列,二者是联合训练好的配套关系;BEARD 只改编码器会破坏这种配套,所以必须用蒸馏把编码器输出拴在原来解码器能读懂的表示空间里,搭配的意义是让声学适应新领域的同时语言端不脱钩。

冻结与更新边界按原文是:教师编码器整体冻结,随机投影量化器与码本冻结;学生编码器整体可更新,新增的投影头可更新,解码器在重训阶段不参与。学习率分开设置,编码器用 1e-5,投影头用 5e-4。归一化细节是原文明确给了理由的:在随机投影输入端和投影头输入端做层归一化,把向量变成均值 0 标准差 1,防止随机投影只塌缩到少数码字。掩蔽细节是掩蔽间隔 4 帧,掩蔽概率从 0.15 降到 0.10,理由是留出足够多未掩蔽帧给蒸馏用。

码本大小用 2048,这是预实验中最好的取值。权重上总目标是 L 等于 Lq 加 λ 乘中间蒸馏再加 β 乘 λ 乘末层蒸馏,其中 β 固定为 0.1,更大的值在预实验中更差,λ 主要比较 0.5 和 1.0。

掩蔽预测 × 余弦相似度蒸馏: 掩蔽预测负责制造学习信号,它遮住输入谱图的部分帧并要求中间层投影头预测对应的随机量化标签;余弦相似度蒸馏负责约束学习方向,它只在未被掩蔽的帧上比较学生与教师的第ℓ层和最后一层表示的方向;用余弦而不用 L1 或 L2 的原因是原文明确说不想惩罚向量范数,要给编码器留下适应新领域的自由度。

沿一个样本走一遍:一段空管语音先算对数梅尔谱图;完整谱图进教师得到每层表示,同时进随机投影得到每帧离散编号;掩蔽谱图进学生得到第ℓ层表示与末层表示;投影头拿第ℓ层表示预测被掩蔽帧编号产生分类梯度;未掩蔽帧上学生第ℓ层向教师第ℓ层看齐,学生末层向教师末层看齐产生蒸馏梯度。

3 路梯度加权后只更新学生与投影头。这样上层仍能变化,但变化被末层蒸馏拽住,不会完全脱离解码器。

重训和微调各跑什么数据、跑多久、怎么停?

重训阶段用 ATCO2 无转写部分的 5381 小时,只跑一个轮次,批量大小 32,在 8 块英伟达 V100 上约 7 小时。只跑一个轮次的理由是数据量已经很大,论文强调这比给数千小时打伪标签便宜得多。优化器细节原文没有给出具体类型与衰减策略,这是缺项,复现时不能从模型名推定,只能先按常用配置起步并记录。微调阶段用同领域有标注语音,每个折 2 小时 24 分,批量大小 16,学习率 1e-5,一直训到收敛,用验证集词错误率做早停,解码用贪心搜索以省计算。验证是四折交叉验证,每折的训练验证测试划分互不重叠,测试每折 1 小时约 10000 词。统计显著性用 SCTK 的配对语句段检验,显著性水平 p 等于 0.001。

重训 × 微调: 重训指在 5381 小时无转写 ATCO2 语音上同时用 BEST-RQ 损失和蒸馏损失更新学生编码器,此时不用解码器也不用文字标签;微调指把解码器接回重训后的编码器,再用 2 小时 24 分有转写语音做有监督训练;搭配理由是先用大量无标注数据铺好领域声学底座,再用少量标注把声学到底层文字的映射对齐,分工不同不能合并为一步。

需要纠正的误解是重训不是微调的前半段超参数搜索,它没有用任何文字标签,也没有用解码器,目标也不是直接降词错误率,而是造一个更适合空管声学的编码器起点。另一个误解是以为重训轮次越多越好,原文只验证了一个轮次,没有报告多轮次曲线,因此不能断言多轮一定更好,待验证。计算代价上,重训是一次性大吞吐小步更新,微调是小数据多轮次早停,二者预算要分开记,不能把 7 小时重训时间当成每次微调都要付的成本。

数据、模型、基线与指标的比较条件是否一致?

数据条件是 ATCO2,采样率 16 千赫,与 Whisper 输入要求一致。无转写 5381 小时用于重训,有转写 4 小时用于微调与评测,其中划分已在训练节说明。没有说话人数与母语信息,原文明确说未知,这是复现时必须接受的缺项,不能自行编造说话人无关或相关的结论。模型条件是 Whisper-small,共 244M 参数,12 层编码器,论文选择它的理由是体积适合部署且参数量与 XLS-R 的 300M 可比,都是多语言端到端系统。

基线条件分两类:文献基线是 XLS-R 在 132 小时空管标注上微调加外部语言模型得到 19.80%,以及 Whisper-small 在 52 分 ATCO2 上微调得到 22.79%,二者数据量与解码器配置与本文不同,只能作背景参照;同条件基线是作者自己跑的不微调 63.32% 与用 2 小时 24 分微调的 19.54%,它们与 BEARD 加微调共享同一四折划分与贪心解码,是判断 BEARD 是否有效的公平对照。指标是词错误率,越低越好,聚合方式是交叉验证折上的平均,显著性用 SCTK 检验。代码方面,论文给出可公开的仓库地址,资源状态显示可用,意味着当前可访问。

评分工具 SCTK 的第三方仓库状态也显示可用。部署含义是 Whisper-small 加贪心解码是可运行策略,而文献中最优超参数事后选择不能代替可部署收益,本文报告的最好ℓ等于 6 与 λ 等于 0.5 是在多组中选出的,应用时要留出验证集做选择,不能直接默认该组在新机场数据上仍最优。

主结果测了什么,谁赢了,代价与反例是什么?

要回答的比较问题是:在同样用 2 小时 24 分标注微调的前提下,先做 5381 小时 BEARD 重训是否显著优于直接微调,以及与文献基线相比处于什么位置。公平条件是同一 Whisper-small、同一四折 ATCO2 划分、同一贪心解码与同一词错误率方向。表中第一组是直接可比的同条件对照,第二组是 BEARD 在不同中间层与蒸馏权重下的结果,指标都是词错误率百分比,数值越低越好。

方法与数据条件微调标注量无标注用量指标比较对象
Whisper-small 不微调0 分0 小时词错误率最弱下界
XLS-R 微调加语言模型文献值0 分 ATCO20 小时词错误率跨模型参照
Whisper-small 微调文献值52 分0 小时词错误率小标注参照
Whisper-small 直接微调2 小时 24 分0 小时词错误率公平基线
BEARD 加微调最好配置2 小时 24 分5381 小时词错误率本文最优

表后解释需要同时讲收益与代价。收益是最好配置ℓ等于 6、λ 等于 0.5 达到 17.17%,相对直接微调的 19.54% 下降约 12%,且论文报告在 SCTK 配对检验下显著;把层换到 4、5、8 且 λ 等于 0.5 时也显著优于基线,说明中间层选择有一定宽容度。代价一是数据与算力,需要一次性消化 5381 小时无标注语音;代价二是超参数敏感,当ℓ等于 7 且 λ 等于 1.0 时结果变差到 19.68%,不再显著优于基线,当ℓ等于 9 时进一步退到 18.64%,说明越靠近输出层做 BEST-RQ 越容易干扰解码器。

未胜出项也要保留:伪标签微调的 25.97% 明显输给直接微调,说明在该噪声与短语条件下伪标签不是可运行的替代方案;文献 XLS-R 的 19.80% 与直接微调的 19.54% 相当,说明本文基线本身已不弱,BEARD 是在强基线上的进一步改进。总体趋势不等于每组都赢,λ 等于 1.0 在 5、6、7 层上都显著差于 λ 等于 0.5,因此蒸馏权重过大时自监督会被压住或失衡,需要按验证集选择。

拿掉蒸馏会怎样,双层蒸馏缺一层会怎样?

要回答的反证问题是:BEST-RQ 损失单独是否足以改造 Whisper 编码器,以及两个蒸馏损失各自承担什么。比较条件固定为ℓ等于 6、λ 等于 0.5,只开关蒸馏,微调标注量与评测划分不变,指标仍是词错误率越低越好。表中四行都是实际可运行的训练策略,不是事后最优拼凑,区别只在重训时是否计算中间层蒸馏与末层蒸馏。

重训配置是否用中间层蒸馏是否用末层蒸馏指标相对直接微调
只用 BEST-RQ 无蒸馏否否词错误率严重退化
加中间层蒸馏是否词错误率仍退化
加末层蒸馏否是词错误率与基线相当
双层蒸馏完整 BEARD是是词错误率显著最优

表后解释要讲机制。无蒸馏的 80.98% 报告显示表示已漂离解码器,支持论文判断即 BEST-RQ 不应单独用于 Whisper 编码器。只加中间层蒸馏的 37.28% 说明守住中间一层不够,因为上层到末层的映射仍可漂移,送给解码器的最终表示依然失配。只加末层蒸馏的 20.44% 回到与直接微调相当,说明守住出口能保住可用性,但中间层缺乏约束时新声学特征学得不充分,提升有限。双层同时用的 17.17% 最好,支持中间约束帮助蒸馏过程、末层约束守住解码器入口的分工解释。

限制是该消融只在ℓ等于 6、λ 等于 0.5 下做过,没有报告其他层的双层缺一表现,因此不能把双层缺一的排序推广到所有层;同时蒸馏只在未掩蔽帧计算,若掩蔽比例变化,最优权重可能变化,这属于未评测边界。

哪些结论有边界,哪些量本文没有测量?

第一类边界是层与权重的外推。论文只系统比较了ℓ为 4 到 8 加 λ 为 0.5 与 1.0,补了一个ℓ等于 9 的结果,没有报告ℓ为 1 到 3 或 10 到 12,也没有报告 λ 连续取值的曲线。因此只能说中间层 4 到 6 在当前设置下略好于 7 到 8,不能断言第 6 层在所有空管子集或更大 Whisper 上仍最优,这是待验证。第二类边界是数据与模型规模。重训只用了 ATCO2 的 5381 小时,微调只用了 2 小时 24 分,模型只用了 Whisper-small。

论文结论中说方法可推广到任意编码器解码器与更大 Whisper,这属于未验证推测,应表述为可能而非已证明。第三类是未测量量。论文没有报告误判率分解、延迟、实时因子、推理显存与功耗,也没有报告伪标签与 BEARD 在相同 3500 小时与 5381 小时下的等数据量对比,因此不能承诺 BEARD 改善了延迟或在任意数据量下都优于伪标签。相关性不等于因果,例如中间层更好可能与空管噪声主要影响中层声学抽象有关,但本文没有做层表示探针来证明因果,只能说结果支持该假设。

最后是可复现性缺项:优化器类型、学习率衰减、随机种子、码本初始化种子、四折具体文件划分都没有在证据中给出,复现时需要先补这些记录才能谈严格对齐。

要复现 BEARD,先做什么、按什么顺序检查?

第一步是准备数据与环境。下载 ATCO2 无转写 5381 小时与有转写 4 小时,按论文做四折划分,每折保证 2 小时 24 分训练、36 分验证、1 小时测试互不重叠,音频重采样到 16 千赫。准备 Whisper-small 与 SCTK 评分工具,论文给出的代码仓库当前可用,评分工具仓库当前可用,复现时应先记录提交哈希与依赖版本。第二步是实现重训。复制两份预训练编码器,一份冻结为教师,一份为学生。

实现固定随机投影量化器,码本大小 2048,输入端加层归一化;实现掩蔽逻辑,间隔 4 帧,概率 0.10;学生第ℓ层后加可训练投影头并加层归一化;损失按总目标加权,β 固定 0.1,先跑 λ 等于 0.5 与 1.0 在ℓ等于 6 上的对照。只跑一个轮次,批量 32,编码器学习率 1e-5,投影头 5e-4,记录 8 卡耗时是否接近 7 小时量级。

第三步是微调与评测。把重训后学生编码器与原解码器拼接,用折内 2 小时 24 分微调到验证词错误率早停,贪心解码,在折内 1 小时测试上用 SCTK 配对检验与直接微调基线比较。先复现直接微调 19.54% 量级,再看 BEARD 是否降到 17.17% 附近。若先复现消融,应先跑无蒸馏是否出现 80% 量级的崩溃,以此验证蒸馏链路是否接对;若没有崩溃,说明损失开关或掩蔽帧掩码大概率接错。

何时值得尝试:当你有大量同领域无标注语音、只有一两小时标注,且已有强编码器解码器配套模型不想从零重训时,BEARD 是值得试的路线;若无标注与目标领域不匹配或算力只够微调,则应先做小规模试点并检查验证集是否稳定提升。

一句话收束:该记住的方法、数字与下一步验证是什么?

该记住的方法是一个 2 阶段动作:先用 BEST-RQ 在中间层学领域声学,同时用中间层加末层余弦蒸馏拴住解码器兼容,再用少量标注把编码器加解码器一起微调。该记住的数字是同条件直接微调 19.54%,BEARD 最好 17.17% 相对改善 12%,无蒸馏 80.98% 证明不能单用自监督,单用中间蒸馏 37.28% 与单用末层蒸馏 20.44% 证明双层缺一不可,伪标签 25.97% 证明在该领域伪标签不是省事替代。

下一步验证应补三项:换更大 Whisper 与多层自监督是否仍有增益,用等数据量对比 BEARD 与伪标签与过滤后无标注数据的性价比,以及在新机场与新信噪比区间上检验第 6 层与 λ 等于 0.5 是否稳定。教学上最容易犯的错误是把词错误率相对改善 12% 读成绝对下降 12 个百分点,或把一折最优当成可部署保证;正确读法是相对下降约 12 个百分点中的 12%,且部署前必须在自己的验证集上重选层与权重,并用配对检验确认显著。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

原文数学表达区域 1,PDF 第 5 页

区域 1 · 查看论文原页

原文数学表达区域 2,PDF 第 6 页

区域 2 · 查看论文原页

另有 9 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 jep-2026 论文汇总