英文题目:Two-stage semi-supervised learning with pseudo-labels: A case study on Northern Sámi ASR

会议身份:conference:interspeech:2026:conference-paper-id:pal26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#知识蒸馏 #半监督学习 #低资源 #语音识别

评分:6.3/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Priyanshi Pal:机构信息未能从会议 PDF 纯文本可靠映射
  • Yaroslav Getman:机构信息未能从会议 PDF 纯文本可靠映射
  • Kristiina Ojala:机构信息未能从会议 PDF 纯文本可靠映射
  • Tamás Grósz:机构信息未能从会议 PDF 纯文本可靠映射
  • Mikko Kurimo:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

北萨米语自动语音识别(Automatic Speech Recognition,ASR)需将议会录音与播客等声学输入转写为文本,黏着形态、复合词切分、方言变体与挪威语、瑞典语、英语代码切换使词错误率(Word Error Rate,WER)失真且标注稀缺。作者先用317M参数大教师模型为75小时无标注议会语音生成硬伪标签(Pseudo-Labeling,PL),再让95M参数小学生模型在伪标签上预微调,最后在20小时人工标注(Human-Labeled,HL)数据上校准,形成伪预训练到真值校准的方法链。该链条与混合训练的关键机制差异在于隔离冲突监督,避免伪分布与真值分布在同一批次内相互干扰。相比20小时人工基线,两阶段全量伪标签方案在282utt测试集上将字符错误率(Character Error Rate,CER)从10.09%降至6.73%,方向为显著下降,在1小时YLE播客集上从11.40%降至8.89%。结论限于单轮无语言模型(Language Model,LM)的北萨米语议会及播客域,罕见字符与跨语言借词仍恶化且未验证多轮迭代外推。训练成本方面论文披露单卡NVIDIA V100 32GB上每轮约18小时至20小时,推理与部署成本未披露。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要解决哪个瓶颈?

本文输入是语音波形,目标是输出北萨米语文字。北萨米语在文中被介绍为芬兰乌戈尔语系语言,约有 20000 使用者,分布在挪威、瑞典和芬兰,具有丰富的屈折、派生和能产性复合,论文将其定性为资源匮乏且被联合国教科文组织列为明确濒危的语言。初学者先要建立白话理解:自监督学习指先用大量无文字音频让模型学会语音表示,再用少量带文字音频做微调;伪标签指用已训练好的模型给无标注音频自动生成文字,再把这些自动文字当作训练目标;教师学生指大模型生成标签、小模型学习标签的知识蒸馏关系。

本文的目标读者是刚进入语音领域的研究生,输出是 1 篇能复述方法的解读。必须保留的信息包括数据量、模型规模、过滤阈值、训练顺序、评测集合与指标方向。论文研究的是北萨米语自动语音识别,基座是 wav2vec2 架构的两个萨米语预训练模型。论文报告大教师能把小模型的域外字符错误率相对降低 3.8 到 33.3%,且在可比数据量下伪标签与人工标注收益相当,但 2 阶段顺序至关重要。解读按学习依赖展开,先讲任务与路线,再讲方法全景与组件计算,然后讲训练与实验条件,最后讲结果、反证与复现。教学中举的例子会明确标为例子,不引入无源数值。

伪标签有哪些已知路线,本文站在哪一条上?

论文把伪标签放在半监督学习的自训练传统里回顾。白话说,自训练就是先用有标注数据训练一个模型,再让它给无标注数据打标签,然后扩充训练集。文中引用了迭代伪标签做法,即多轮动态重新生成最可能标签,尤其适用于基于联结时序分类的低资源语音识别。为了避免错误标签在多轮中传播,可以用语言模型缓解,但引用的研究也指出带语言模型的迭代伪标签可能让声学模型过拟合到语言模型的文本域,因此伪标签不一定依赖语言模型。

第二条路线是过滤。常见做法是基于置信度过滤,先生成硬标签再按置信度分数筛掉低置信样本,低置信样本在迭代中被修正。论文指出这种做法并非总是有益,有研究显示它可能无改善甚至恶化词错误率。另一条是基于模型一致性的过滤,只保留多个模型高度一致的样本。第三条是大小模型蒸馏,即大模型生成伪标签训练小模型,有研究称强教师生成的伪标签训练出的学生甚至优于人工标注训练的学生。

本文站在后两条的交叉点上:只做单轮伪标签生成,不用语言模型,比较大教师全部伪标签与大小模型词错误率一致过滤,并重点比较人工标注与伪标签的混合与 2 阶段结合方式。单轮与不用语言模型的选择在文中明确与泛化目标绑定,因为萨米语文本数据有限且体裁偏置,作者要评估向会话语音等域外任务的泛化。

为什么小模型在同等监督下跟不上,大模型又不能直接部署?

论文提出的问题是:在标注受限的北萨米语下,参数更少的小模型在给定同等监督数据时落后于大模型。直观例子是:同样只看 20 小时议会转写,小模型在新播客或朗读加自发混合测试上错误更多,而大模型更稳。但大模型有 317M 参数,小模型只有 95M 参数,从部署成本看小模型更轻。问题于是变成能否在不增加人工标注的前提下,用无标注议会音频和大教师的输出把小模型带到接近大模型的水平。

这里有两个难点。第一是无标注音频本身有方言变体和挪威语、瑞典语、英语的代码切换,论文明确说没有为此做费力的预处理过滤,直接保留在原始语料里。这意味着伪标签天然带噪。第二是北萨米语形态丰富,词错误率不可靠,因为复合词切分不同或一个小拼写差异就会让整个词算错,论文因此更看重字符错误率。初学者容易误以为词错误率下降才算进步,本文要纠正这个直觉:在黏着语里要先看字符错误率分布是否收紧,再看词错误率是否同步改善。

两条伪标签路线与两种结合方式如何组织成实验?

方法全景可以沿一个样本走一遍。取一段无标注议会语音,先送入大教师和小模型各自解码得到两份转写,计算二者之间的词错误率,如果低于 10% 阈值就保留该片段,并采用大模型的转写作为该片段的伪标签,这就是一致过滤分支;另 1 分支不对 75 小时做任何筛选,全部采用大模型转写,这就是全部伪标签分支。随后小模型在这些伪标签上微调,再按不同顺序引入 20 小时人工标注。

论文评估的训练方法包括人工标注基线、过滤伪标签、全部伪标签、等量随机采样的全部伪标签截断版、人工加过滤伪标签的混合版、人工先伪标签后的 2 阶段版、伪标签先人工后的 2 阶段版,以及全部伪标签先人工后的 2 阶段版。教师本身也作为参照。关键设计是单轮生成以隔离伪标签本身的影响,以及全程不用语言模型以检验声学泛化。表示层面小模型与大模型共享萨米语预训练起点,区别在于微调阶段的监督来源是人工文字还是教师文字,以及人工与伪标签是混在同一批次还是分先后两段呈现。

教师生成与一致过滤各自做了什么计算?

教师生成这一步的分工很具体:教师是已在 20 小时人工标注上微调好的大模型,对 75 小时无标注议会语音做 1 次前向解码,输出硬伪标签,即每个 utterance 最可能的标签预测。学生随后把音频与该硬标签配对,按常规语音识别微调目标学习。原文没有给出联结时序分类以外的额外损失公式,也没有报告解码束宽或温度等细节,这部分属于缺项,解读不从模型名推定实现。

一致过滤的分工是质量代理:计算小模型预测与大模型预测之间的词错误率,低于 10% 才保留,阈值经初步实验确定,最终得到约 28 小时语音,对这些保留片段仍使用大模型的伪标签。其假设是小模型与大模型相似时大模型的标签更可靠。全部伪标签分支则跳过这一步,直接使用 75 小时。

自监督学习 × 伪标签半监督学习: 自监督学习负责用 22.4k 小时无标注萨米语广播语音预训练 wav2vec2 得到通用声学表示,伪标签半监督学习负责用已微调的大模型给 75 小时议会语音自动转写出训练目标,二者搭配的理由是前者解决表示起点弱的问题,后者解决有标注只有 20 小时而不敢直接微调小模型的问题,组合后小模型先学大模型的输出分布再被人工标注校准。

从数据量看,一致过滤把数据压缩到不足一半,目的是提纯;全部伪标签保留多样性,代价是噪声。论文还设置了一个等量对照,即从全部伪标签中随机采样约 20 小时的截断版,用于检验收益究竟来自数据量还是来自筛选,这为后文讨论多样性与纯净度的 trade-off 埋下对照。

混合训练与两阶段微调的监督顺序有何不同?

混合训练指把人工标注与伪标签放在同一批次内联合训练,模型在一步梯度中同时看到两种监督。2 阶段微调指顺序训练,先在一类数据上训练到某个停止点,再在另一类数据上继续微调。论文测试了两种顺序:先人工后伪标签,以及先伪标签后人工。初学者可以这样记:混合是一起吃,2 阶段是分两餐吃,先吃哪一餐结果不同。

教师模型 × 学生模型: 教师模型指用 20 小时人工标注微调后的 317M 大模型,负责产生伪标签,学生模型指待优化的 95M 小模型,负责学习这些伪标签,搭配理由是教师容量大、域外泛化更好,组合意义在于不增加人工标注也能把大模型的识别偏好蒸馏给轻量模型,但同时会继承教师的系统性字符错误。

一致性过滤 × 全部伪标签: 一致性过滤负责只保留大小模型词错误率差异低于 10% 的约 28 小时高一致片段,全部伪标签负责保留 75 小时完整集合且直接采用大模型输出,一致性过滤求准但丢掉困难样本,全部伪标签求全但引入噪声,对比二者才能检验在低资源下数据多样性与标签纯净度谁更重要。

混合训练 × 2 阶段微调: 混合训练负责把人工标注与伪标签放在同一批次里联合优化,2 阶段微调负责先在一类数据上训练再在另一类数据上继续微调,搭配比较的理由是两类数据分布不一致可能在同一批次内给出冲突监督,组合实验显示先伪标签后人工标注的顺序能先学广后校准,而混在一起或先人工后伪标签都会削弱效果。

词错误率 × 字符错误率: 词错误率负责统计词级别替换删除插入,字符错误率负责统计字符级别错误,在北萨米语这种黏着语里词错误率会因复合词切分或可接受拼写变体被不成比例放大,字符错误率更稳定,因此论文以字符错误率为主指标判断域外泛化,用词错误率辅助观察删除与插入的 trade-off。

论文的假设是混合批次内两种分布冲突会阻碍一致表示学习,而先伪标签后人工的顺序能先学更广的表示再用人工标注校准。顺序敏感性是本文的核心机制判断之一,后文结果会显示反向顺序与混合都更差。

模型、优化器与早停如何执行,哪些细节未报告?

训练执行层面,论文使用两个萨米语基础模型,均在 KAVI 广播电视的无标注语音上预训练。优化统一用 AdamW,学习率为 5e-4,预热比例 0.25 后线性衰减,批次大小为 16,在单张 32 GB 显存的 NVIDIA V100 上运行,通常每轮运行 18 到 20 小时。模型选择先用 10% 伪标签数据做 held-out 验证,训练中观察到损失与指标出现两个局部极小,一个靠前一个靠后,在 1 小时议会验证集上比较后发现靠前的极小泛化更好,因此后续采用早停在早期极小处停止,最初多数模型训练 60 轮,后续运行轮数减少。该行为在两个小模型变体与每个变体 2 到 3 个随机种子上得到确认。

未报告的缺项需要明确指出:论文没有说明冻结哪些层、梯度是否截断、伪标签是否加权、学习率在第二阶段是否重置、2 阶段各自训练多少轮。解读不猜这些实现,只能说监督来源与顺序是明确的,参数更新细节缺失,复现时需按常规微调流程补齐并记录。下表把模型规模与训练配置整理为可核对的一览,数值与单位保留原文写法,指标单位在表头交代,表内为原文裸值加单位原文。

数据划分、评测集与指标如何保证公平?

数据方面,无标注为约 75 小时萨米议会录音,含方言与代码切换且未过滤;有标注为 20 小时萨米议会转写,用于训练大教师与小基线;验证与域内测试为预定义的 1 小时集合。一致过滤得到约 28 小时。域外测试有 3 套:约 85 分钟的 282 条朗读加自发混合语音,平均每条 9 秒且音频质量可变。

1 小时 YLE 萨米播客自发语音,每段平均 11.7 分钟,由母语者转写;约 8 小时 UIT-SME 语料,原为语音合成开发录制,含男声 4.7 小时与女声 3.3 小时。指标用词错误率与字符错误率,论文明确在形态丰富语言中更看重字符错误率。

数据集时长一规模与时长二平均时长三补充说明四
无标注萨米议会录音approximately 75 hours——未过滤方言与代码切换
有标注与验证集20 hourspredefined 1-hour set—用于训练大教师与小基线
一致过滤后语音approximately 28 hours——大模型伪标签中高一致部分

该表逐行汇总了无标注、有标注、过滤后与 3 套域外测试的时长与规模,同一格内保留原文数值与单位的组合写法,用于支撑后文对数据量、领域偏移与评估指标选择的论证,并说明字符错误率在形态丰富语言中更受重视的原因。

全部伪标签与过滤伪标签谁带来更稳的改善?

主结果按问题组织:测的是小模型在域内验证与 3 套域外上的词与字符错误率,与谁比是 20 小时人工基线与 20 小时教师,条件一致指共享验证测试与单轮无语言模型设置。论文报告过滤伪标签的词错误率与基线相当甚至略高,但字符错误率有明显改善;全部伪标签在两类指标上更一致地改善,尤其在 282 条混合集与 YLE 播客上。等量随机截断的全部伪标签在任何评测集上都没有改善,说明收益不是仅靠 20 小时伪标签量,而是靠更大更多样的数据。摘要中的 3.8 到 33.3% 相对字符错误率改善指大教师带小模型在域外的总体区间,具体每集数值见原表。

导读:下图把 9 种条件按替换、删除、插入 3 类错误拆开,能直接看到过滤与全量在删除与插入上的反转,这是理解字符错误率与词错误率分歧的关键。

看图路径: 1. 先看横轴九种训练条件,再纵向比较三个子图的上中下分别为替换、删除、插入;2. 对比 PL-Filtered 与 PL-Full 在删除子图与插入子图上的高低反转;3. 检查 HL 加 PL-Filtered 混合条件在替换子图是否为三套测试中偏高的一组;4. 观察 Teacher 在 UIT-SME 绿色柱上替换与删除是否同时偏低

原论文 Figure 1:1

论文图 1。原论文 Figure 1:“1”。

解释:像素显示上排替换百分比中混合条件在 3 套颜色上都偏高,中排删除百分比中过滤条件在 3 套测试上偏高而全量偏低,下排插入百分比中全量在 282 条与播客上偏高而过滤偏低。论文据此提出机制解释:过滤丢掉困难样本使模型在不确定时倾向少吐词,删除多插入少;全量见过更多噪声多样性,在不确定时倾向多吐词,删除少插入多。这支持了多样性比纯净度更重要的判断,但代价是插入增加。结合字符错误率看,全量的 trade-off 总体更优。

下面两张整理表分别对应证据中的引用句,数字只做原文搬运,不做换算与补列,阅读时以后解释段中的适用边界为准。

来源证据量化值一量化值二量化值三量化值四
来源句一13141—
来源句二282———
来源句四1202549264935;2;19

第一张表交代数据与引用的出处边界,第二张表交代模型与训练配置的出处边界,两张都不承载主结果比较,主结果比较仍以正文对过滤与全量的机制解释为准,不能把引用编号当性能值读。

来源证据量化值一量化值二量化值三量化值四
来源句一912——
来源句三22———
来源句四201720191526;89;99;20;3

该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据,过滤偏少吐词而全量偏多吐词的取舍仍需结合字符错误率与词错误率一起看。

顺序与混合方式改变时,分布稳定性如何变化?

消融围绕顺序展开。先人工后伪标签的 2 阶段比混合好,但不如先伪标签后人工的 2 个阶段。论文认为先伪标签能学更广表示,后用人工校准;而混合在同一批次内遇到冲突监督,难以学一致表示。先人工后伪标签的 2 阶段在小提琴图上几乎与基线无异,说明伪标签收益是顺序敏感的。

导读:下图展示 YLE 播客上每条语音的词与字符错误率分布,小提琴越窄越矮表示跨语音越稳定,这是判断 2 阶段是否只降均值还是同时降方差的直接证据。

看图路径: 1. 先确认纵轴为 Error 百分比,上排绿色为词错误率分布,下排蓝色为字符错误率分布;2. 比较基线与 PL-Full 加 HL 两阶段在下排蓝色小提琴的宽度与中线位置;3. 观察 HL 加 PL-Filtered 混合与 HL 加 PL-Filtered 两阶段的上排绿色分布是否更宽更高;4. 注意 Teacher 的下排分布是否最窄且中线最低

原论文 Figure 2:WER and CER distributions for YLE Sámi podcast.

论文图 2。原论文 Figure 2:“WER and CER distributions for YLE Sámi podcast.”。

解释:像素显示下排蓝色字符错误率中,先全量伪标签后人工的 2 阶段与过滤先人工后的 2 阶段都比基线更窄且中线更低,而先人工后伪标签的 2 阶段与基线宽度接近;上排绿色词错误率中混合与先人工后伪标签的分布更宽更高,教师分布最窄最低。论文据此判断伪标签与人工微调互补但顺序敏感,有效排序能同时降错误率与波动。该图只覆盖播客,不能推广到 3 套测试都同样收紧,需回到主表核对每集均值。

字符级错误如何传播,哪些字符始终学不会?

局限分析看字符混淆矩阵。论文报告对角线上半部分 a 到 v 等常见字符在微调后维持或改善,更高频的带锐音 a 与 s 下加软音符受益;低频字符如带分音符 a 与 o、带斜线 o、带抑扬符 c、中间点与大写 N 识别不可靠,可能因在伪标签与人工中都少见。系统性错误包括 w 恒与 v 混淆且被微调继承,ä与æ被误为 a 或 a 与 e 组合,å本已困难又被主要映射到 o,z 在基线中比大模型更好但微调后跟随大模型变差。许多错误字符不在北萨米字母表内,主要出现在借词或代码切换中,频率低且难学;部分混淆反映北欧语音相似性,如芬兰语 o 带分音与挪威语 o 带斜线都对应国际音标的闭口音。

导读:下图并排给出基线与先全量后人工 2 阶段在合并测试上的字符混淆矩阵,对角线越深越好,非对角亮格即系统混淆,可检验伪标签是纠错还是固化错误。

看图路径: 1. 先确认上下两幅分别为基线与 PL-Full 加 HL 两阶段,横轴为预测字符,纵轴为参考字符;2. 沿对角线检查 a 到 v 等高频字符的深色格是否在下图维持或加深;3. 找到 w 行与 v 列、ä与 a 列、å与 o 列等非对角亮格,比较上下图是否持续存在;4. 观察 z、N、带抑扬符 c 等稀有字符行在下图是否仍偏离对角线

原论文 Figure 3:Confusion matrices for HL \\[Baseline\\] and PL-Full + HL (2 stage) computed on the combined test sets.

论文图 3。原论文 Figure 3:“Confusion matrices for HL [Baseline] and PL-Full + HL (2 stage) computed on the combined test sets.”。

解释:像素显示两幅图对角线在高频区保持深色,下图部分格略加深,但 w 行 v 列、ä行 a 列、å行 o 列等非对角亮格在上下两图持续存在,z 行在下图偏离对角线更明显。论文据此提出伪标签的局限:初始模型的系统错误没有纠正机制,训练中会被强化并传递。这意味着轻量模型接近大模型的同时也继承其偏置,稀有字符与代码切换字符仍是未评测充分的边界,论文未探索数据增强、噪声学生或置信过滤等缓解手段。

要复现这条路线,先做什么,需要补哪些验证?

复现先做三件事。第一是按原文重建数据管线:准备 75 小时无标注议会音频不做代码切换过滤,准备 20 小时人工议会转写与 1 小时预定义验证,另备 282 条混合、1 小时播客与约 8 小时 UIT-SME 3 套域外测试,注意播客转写需母语者质量,UIT-SME 非公开需向提供方申请。第二是重建模型起点:获取 95M 小模型与 317M 大模型并确认均为 22.4k 小时 KAVI 预训练,复现时记录本次链接暂时不可达的状态,不要假设权重可直接下载。第三是重建单轮流程:用 20 小时微调大教师,对 75 小时解码生成伪标签,计算大小模型间词错误率并按 10% 阈值筛出约 28 小时子集,同时保留 75 小时全量与 20 小时随机截断对照。

训练时采用 AdamW、学习率 5e-4、预热 0.25 线性衰减、批次 16、单卡 V100,并用 10% 伪标签 held-out 加 1 小时议会验证做早停,优先选择早期极小。必须补的验证包括记录冻结层与第二阶段学习率是否重置、报告每个种子与每个测试集的词与字符错误率均值与分布、单独报告删除插入替换 3 类错误,以及在播客外补充其他集的分布图。缺失的解码与加权细节要在复现报告中明确标为待验证,不把单轮结论推广为多轮必然更优。

何时值得尝试这套两阶段做法,何时不值得?

值得尝试的条件很具体:已有较强大教师但标注只有十几到 20 小时,无标注与目标域部分同源且能容忍噪声,部署要求轻量模型,且评测接受字符错误率为主指标。此时优先尝试先全量伪标签后人工的 2 个阶段,而不是先过滤或先混合,因为原文显示多样性带来的字符级稳定性超过提纯,且顺序决定校准是否发生。操作上先跑全量单轮,再视插入增加情况决定是否加过滤或置信门限。

不值得或需谨慎的情况包括:无标注与目标域差异极大且代码切换密集,稀有字符与借词是关键应用,教师本身在这些字符上系统错误严重,因为伪标签会固化这些错误;以及只能负担小量伪标签而无法扩大多样性,因为等量截断对照显示无改善。此外混合训练在本文明确退化,不应作为默认基线;先人工后伪标签的顺序改善有限,不应替代先伪后人工。总体上本文用单轮实验证明轻量模型可在无新增标注下接近大模型,但接近不等于纠错,稀有字符、跨域口语与多轮稳定性仍是待验证项。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总