英文题目:Apprentissage de modèles frugaux pour les langues peu dotées à partir de larges modèles d’ASR
会议身份:
conference:jep:2026:conference-paper-id:mohammadamini26_jep
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#知识蒸馏 #高效推理 #低资源 #语音 #语音识别
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Mohammad Mohammadamini:机构信息未能从会议 PDF 纯文本可靠映射
- Marie Tahon:机构信息未能从会议 PDF 纯文本可靠映射
- Aghilas Sini:机构信息未能从会议 PDF 纯文本可靠映射
- Antoine Laurent:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理中库尔德语(Central Kurdish)语音识别(Automatic Speech Recognition, ASR)的输入为连续语音、输出为规范化文本,难点在于人工标注仅177小时且仅1.91万独特句、重复严重,而大模型推理又超出本地算力。方法链分为三步:先用能量检波语音活动检测(Voice Activity Detection, VAD)将4300小时有声书切分为短句,再将多语言大模型Seamless v2在人工标注上微调后生成伪标签(Pseudo-Label, PL),最后经语速与置信度等多重过滤得到3300小时数据以训练轻量Transformer。与直接在小标注上训练轻量模型相比,该链条的关键差异是用已适配大模型同时解决语言覆盖与标注质量问题,而非单纯做数据增广。在Asosoft测试集上微调大模型词错误率(Word Error Rate, WER)为8.18%,31M参数轻量模型伪标签预训练再人工微调后达到7.67%,在Fleurs测试集上则为20.31%对22.46%,基本持平且体积缩小约75倍。摘要中另写Fleurs大模型20.01%与轻量7.57%,与正文表格20.31%不一致,应以正文表格为准。结论仅在中库尔德语有声书域内验证,对噪声、方言偏移与其它低资源语言尚未验证。轻量模型在CPU上数十秒完成推理而大模型无法实时运行,原文未披露训练、推理或部署成本的完整量化。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
低资源语言缺的不只是标注,还有能跑起来的机器
这篇论文研究的是中库尔德语的自动语音识别。输入是一段语音波形,目标是输出对应的库尔德语文字。论文反复强调的矛盾是:低资源语言同时缺两样东西,一是可用的标注语音,二是可用的计算资源。多语言大模型缓解了第一缺,但加重了第二缺。
对刚入门的读者,先把白话和术语对齐。自动语音识别就是英文缩写 ASR,指把语音转成文字的技术。低资源语言指人工转写数据少、商业系统也不支持的语言,本文例子是中库尔德语。节俭模型指本文要训练的小模型,参数量远小于大模型,目标是在普通中央处理器上也能推理。伪标签指用大模型给无标注音频自动生成的转写,后续当作训练目标使用。
本文的输入条件必须保留:人工标注只有 177 小时,来自 Common Voice 18 和 Asosoft 训练集;无标注是有声书,总量 4300 小时;评测只在 Asosoft 测试集和 Fleurs 库尔德语测试集上做。输出是两类模型在两套评测上的词错误率,以及推理耗时。词错误率是英文缩写 WER,指识别错的词占总词数的比例,越低越好。字符错误率是英文缩写 CER,指字符级别的错误比例,越低越好。
学习这篇论文的正确顺序是:先理解为什么直接用大模型不够,再看 3 段式流水线如何组织,然后逐个核对切分、大模型微调、小模型训练的计算细节,最后回到实验条件和代价。只有先固定数据集和指标口径,后面的数字比较才有意义。
伪标签研究大多在富资源语言上做,本文换了目标
在进入方法前,需要把本文与已有伪标签路线放在同一输入、同一目标、同一监督下对照。论文引用的 Hwang 等人工作是用教师模型生成伪标签再按置信度过滤训练学生模型,Khurana 等人是用多次丢弃预测的一致性来选样本,Lugosch 等人是先多语言训练再单语微调再回标,Higuchi 等人是用在线与离线模型互相改进。这些工作的共同输入是已有较强基线模型的语言,共同目标多是扩充训练数据或做领域自适应。
本文的不同在于运行阶段和资源约束。论文明确指出,上述多数工作在高资源语言上验证,而低资源语言的动机不只是增加数据,还要同时解决推理时的计算约束。也就是说,本文不是单纯追求用更多数据把大模型再推高一点,而是把大模型当作一次性数据工厂,最终交付的是能在弱算力下运行的小模型。
另一个对照是库尔德语本身的基线。论文提到 Veisi 等人的传统系统和 Abdullah 等人的 XLS-R 加语言模型系统,在 Asosoft 上的词错误率分别是 13.9 和 11.8。理解这一点很重要:后文大模型微调到 8.18、小模型到 7.57 左右,是在同一 Asosoft 测试集上的直接可比数字,而不是跨数据集的泛泛提升。
初学者容易误解为伪标签一定需要人工再校验。本文的路线是不做逐句人工校验,而是靠一系列自动过滤规则控制质量。这个选择带来可复现性,但也留下误差传播的风险,论文在讨论混合训练变差时回到了这一点。
任务是什么:给定有声书和少量标注,交付可部署的小模型
把任务形式化一下。训练阶段允许使用的有两部分:一是约 163.5k 条人工转写,对应 177 小时,但独立句子只有 19.1k 个,语言多样性受限;二是 1026 本有声书对应的 4300 小时原始音频,无转写,质量较好但含音乐、失真和方言混杂。测试阶段固定为 Asosoft 测试集的 800 条、100 个独立句子、75 分钟,以及 Fleurs 测试集的 921 条、351 个独立句子、约 3 小时。
模型要解决的具体困难有 3 个。第一,大模型直接用不够好,Seamless 基线在 Asosoft 上词错误率 24.04,在 Fleurs 上 38.33,必须先做库尔德语适配。第二,有声书是长音频,不能直接送入识别器,必须先切成句子级片段。第三,伪标签有噪声,包含截断转写、超长超短句、低置信输出和重复幻觉,必须过滤。
举一个教学用的例子,不代表论文数据:假设一段 30 分钟的有声书章节被切成约 150 个片段,大模型给每个片段生成一句转写和置信度,过滤器去掉语速异常、过短过长、低置信和重复的片段,剩下的才进入小模型训练。例子只是帮助理解流程,论文真实的过滤是从 230 万降到 1,770,000 条。
评价标准是词错误率和字符错误率,方向都是越低越好。论文没有报告人工主观评分,也没有报告统计显著性检验,因此所有好坏判断只在自动指标和给定划分下成立。
三段流水线如何组织:微调大模型,过滤伪标签,训练小模型
论文的方法全景可以沿一个样本走一遍。拿一段有声书原始波形来说,先经过基于能量的语音活动检测切成短句,再送入已用人工数据微调过的 Seamless 大模型得到伪转写,再经过 4 类过滤器筛选,最后作为小 Transformer 的训练目标。小模型训练完成后,在 Asosoft 和 Fleurs 测试集上与大模型直接比较。
下图是论文给出的整体流程,左侧是两种数据源,中间是大模型与过滤,右侧是小模型与评测,建议先看主路径再看微调虚线。
看图路径: 1. 先从左下红色 Audio bruts 经 VAD 到中间大模型的箭头看主数据流;2. 再看左上人工转写数据指向大模型的 Fine-tuning 箭头;3. 接着看中间 Filtrage 到红色伪标签库再到右侧小模型的 Apprentissage 箭头;4. 最后对比左右两侧参数标注 2.3B 与 31M 的数量级差异
论文图 1。原论文 Figure 1:“Approche proposée pour l’apprentissage d’un modèle d’ASR frugal.”。
从像素可见,流程图左侧上方是浅紫色人工转写库,标注训练 177 小时,用实线箭头指向中间大模型并标 Fine-tuning;左下方是红色原始音频库,标注 4300 小时,先经 VAD 方框再进入中间大模型。中间大模型框内并排画出编码器与解码器,分别标注 W2V-BERT 2.0 和 NLLB-200,下方标注 ASR large Seamless 2.3B。中间向右经 Filtrage 方框进入红色伪标签库,标注 3.3k 小时,再以 Apprentissage 箭头指向右侧小模型。右侧小模型框内同样是编码器加解码器结构,下方标注 ASR frugal 31M,上方另有一条从顶部虚线下来的 Fine-tuning 箭头和右侧人工测试数据箭头,分别对应小模型也可用人工数据微调和评测的路径。全图统一做了 Unicode、标点和数字的文本归一化,这是复现时不可省略的预处理。
这个全景回答了为什么小模型能接近大模型:小模型看到的不是 177 小时的重复小文本,而是 3300 小时经大模型转写的多主题连续语音,语言覆盖和声学覆盖都被放大了。但它也预告了风险:如果大模型的系统性错误未被过滤,小模型会原样学去。
切分与大模型各管什么:鲁棒切句与库尔德语适配
先讲切分组件。白话说,语音活动检测就是英文缩写 VAD,负责区分语音帧和静音帧。本文实现非常简单:基于能量判断,每 10 毫秒 1 帧,如果连续 30 帧以上是静音就判定为一个切分边界,并在每段首尾各保留 10 帧静音以保证前后静音一致。论文给出的安排理由是:在高质量音频下,VAD 比依赖语言的神经切分模型更稳健。这个判断只针对本文的有声书条件,不意味着 VAD 在噪声下普遍更好。
再讲大模型组件。Seamless 在本研究中只用其语音识别部分,结构是语音编码器加文本解码器。编码器是 24 层 Conformer 结构的 Wav2Vec-BERT 2.0,在 4,500,000 小时、143 种语言上预训练,输入是 80 维梅尔滤波器组特征;解码器是原来为翻译训练的 NLLB-200。最终 Seamless 包含 2,300,000,000 参数。论文报告在库尔德语上的初始基线不够好,因此必须用 177 小时人工数据对编码器和解码器联合微调,微调后的模型才用于生成伪标签。
多语言大模型 × 伪标签: 多语言大模型负责提供跨语言声学与解码先验并经库尔德语微调后输出可用的转写,伪标签负责把大量无标注音频变成带监督信号的训练对,二者搭配的理由是前者弥补标注不足、后者把大模型能力沉淀为可大规模使用的数据,组合后新增的作用是让小模型不再依赖稀缺的人工标注也能学到足够的语言变体。
语音活动检测 × 切分: 语音活动检测负责判断每 1 帧是语音还是静音,切分负责按静音边界把长音频书切成短句,二者搭配是因为大模型需要长度适中的完整语句输入,组合后新增的作用是得到前后留有稳定静音、时长在 1 秒到 20 秒之间的可识别片段。
需要保留的实现细节是:微调前后大模型在同一两套评测上比较,基线 24.04 和 38.33,微调后 8.18 和 20.31,说明适配是生成高质量伪标签的前提。论文没有给出微调的学习率、轮数和冻结策略等超参数,这是复现时的缺项,不能从模型名称推定训练实现。
小模型长什么样:12 层编码器加 6 层解码器的 Transformer
小模型是为库尔德语从零训练的 Transformer。标准配置是编码器 12 层、解码器 6 层,共 31,000,000 参数,约为大模型的七十五分之一。输入是 log-Mel 滤波器组特征。论文还测试了 1500 万、7600 万和 268,000,000 参数的变体,用于分析尺寸与性能的折中。
分词器是容易被忽略但论文专门研究的部分。白话说,分词器负责把文字切成模型词表的最小单元。SentencePiece 单字元分词器是基于统计的子词切分,需要在伪标签文本上训练,论文试了 2k、5k、10k 3 种词表;字符分词器是按单字符切分,不需要大学习文本。论文假设分词器质量会影响识别泛化,因此把分词器训练文本固定为大模型生成的转写,而不是外部大文本。
沿样本继续走:一个已过滤的伪标签对包含一段 1 秒到 20 秒的音频和一句 3 到 50 个词元的转写,音频变成 log-Mel 特征,文本按所选分词器切成编号序列,编码器读声学特征,解码器自回归预测编号序列,损失来自伪标签监督而非人工标注。这个路径说明小模型的语言知识上限基本由伪标签的词汇分布决定。
论文没有报告小模型训练的优化器、批量大小和学习率调度,这些是复现必须补记的缺项。能确定的是训练数据组织有 5 种:只用人工标注、只用伪标签、两者混合、先伪标签后人工微调、混合后再人工微调,其中后两种微调都是 5 个轮次。
伪标签怎样过滤和怎样使用:四道规则加五种数据组合
过滤是训练前的关键计算。论文按顺序应用 4 类规则。第一是语速过滤,每分钟词数限制在 90 到 200 之间,依据是人大声朗读平均每分钟 117 到 239 词,留出宽裕区间以去掉截断转写。第二是长短过滤,去掉短于 1 秒或长于 20 秒的音频,以及少于 3 个词元或多于 50 个词元的文本。第三是置信度过滤,对每个位置的输出对数做 Softmax 取最大概率再对整句平均,低于 0.9 去掉。第四是重复过滤,若出现一元、二元或三元连续重复超过 2 次则去掉,这类输出常对应音乐、语码切换或方言导致的幻觉。
过滤的效果是数量从 2,300,000 条降到 1,770,000 条,对应 3300 小时音频和 22,300,000 词元。保留这个比例很重要:约 23% 的候选被丢掉,说明原始伪标签噪声不可忽略,直接全量训练会引入较多坏样本。
SentencePiece 分词器 × 字符分词器: SentencePiece 分词器负责把伪标签文本切成 2k 到 10k 词表的子词单元,字符分词器负责按单字符切分以降低对词表覆盖的依赖,二者搭配的理由是检验分词粒度是否影响小模型泛化,组合意义在于论文发现人工标注极少时字符切分更稳,而有大量伪标签后子词切分与字符切分差距缩小。
伪标签训练 × 人工标注微调: 伪标签训练负责用 3.3k 小时过滤后数据先学出通用库尔德语识别能力,人工标注微调负责再用 177 小时人工数据纠正伪标签中的系统性错误,二者搭配的理由是前者解决数据量、后者解决数据准,组合后 PL 到 HA 的 2 阶段流程比直接混合训练更有效。
数据使用上有反直觉的发现。只用人工标注训练的小模型在 Fleurs 上词错误率高达 61.79 到 91.87 之间,说明 19.1k 独立句子的语言覆盖撑不起泛化;只用伪标签就能把 Asosoft 做到 8.54 到 9.44 之间,把 Fleurs 做到 22.67 到 24.51 之间。把人工和伪标签直接混合反而略差于只用伪标签,论文解释为人工数据中 700 句重复录制导致词分布失衡。先伪标签训练再用人工微调 5 轮则最好,Asosoft 最优到 7.67,Fleurs 最优到 22.46。混合后再微调反而变差,说明训练顺序和分布匹配比单纯增加数据更重要。
数据、划分和指标口径:先固定比较条件再看数字
实验条件必须逐项核对。人工训练数据是 Common Voice 18 的 117k 条、18.4k 独立句子、134 小时,加上 Asosoft 训练集的 42.5k 条、700 独立句子、43 小时,合计 163.5k 条、19.1k 独立句子、177 小时。评测是 Asosoft 测试集 800 条、100 独立句子、75 分钟,以及 Fleurs 测试集 921 条、351 独立句子、约 3 小时,合计 1721 条、451 独立句子、4 小时 15 分钟。无标注是有声书 1026 本、4300 小时,覆盖小说、历史、宗教、诗歌等主题。
下表整理论文报告的数据规模,第三张正文表,阅读时注意训练与评测的划分不可混用,伪标签时长是过滤后的 3300 小时而非原始 4300 小时。
| 数据用途 | 数据来源 | 音频条数 | 独立句子数 | 时长 |
|---|---|---|---|---|
| 人工训练 | Common Voice 18 | 117k | 18.4k | 134h |
| 人工训练 | Asosoft 训练集 | 42.5k | 700 | 43h |
| 过滤后训练 | 伪标签库 | 1.77 million | 未报告 | 3,3k 小时 |
| 评测 | Asosoft 测试集 | 800 | 100 | 75 分钟 |
| 评测 | Fleurs 测试集 | 921 | 351 | 3 小时 |
上表把人工数据的重复录制问题暴露得很清楚:Asosoft 训练集 42.5k 条音频只对应 700 个句子,平均每个句子被读了约 60 遍,这正是论文解释混合训练变差的依据。表中伪标签的词元总量 2230 万来自正文,独立句子数未报告,不能自行估算。评测侧 Asosoft 是受控录音、Fleurs 是多语言平行句,两者难度不同,因此同一模型在 Asosoft 上 8 左右、在 Fleurs 上 22 左右是正常现象,不能直接跨集比好坏。
指标口径是词错误率和字符错误率,越低越好。硬件是 6 核 Xeon E5-2696 中央处理器和 2 核 RTX 8000 图形处理器,批量大小固定为 6。论文未说明解码束宽、是否用语言模型重打分以及多次运行的方差,这是比较时需注意的边界。
大模型微调到多强,小模型追到多近
结果按问题组织。第一个问题是大模型经库尔德语适配后有多强,与谁比,条件是否一致。比较的问题是:在同一 Asosoft 和 Fleurs 测试集上,微调前后差多少,是否超过已发表的库尔德语系统。公平条件是同一测试划分和同一词错误率指标,方向越低越好。
| 模型条件 | 评测集 | 指标方向 | 词错误率 | 已发表对照 |
|---|---|---|---|---|
| Seamless 微调前基线 | Asosoft | 越低越好 | 24.04 | 无 |
| Seamless 微调前基线 | Fleurs | 越低越好 | 38.33 | 无 |
| Seamless 人工微调后 | Asosoft | 越低越好 | 8.18 | 优于 11.8 和 13.9 |
| Seamless 人工微调后 | Fleurs | 越低越好 | 20.31 | 未报告对照 |
| XLS-R 加语言模型 | Asosoft | 越低越好 | 11.8 | 已发表 |
上表显示的主要收益是微调带来大幅下降,Asosoft 从 24.04 降到 8.18,Fleurs 从 38.33 降到 20.31,且在 Asosoft 上超过 11.8 和 13.9 的已发表结果。代价是这种微调依赖 177 小时人工数据,且论文未说明 Seamless 预训练中库尔德语占比,因此提升中有多少来自原有多语言能力无法分解。需要标注一个数字冲突:摘要英文写 Fleurs 大模型为 20.01,正文表格与正文写 20.31,本文表格采用正文的 20.31 并在此说明冲突,不自行调和。
第二个问题是小模型能否接近大模型。比较的问题是:在同一两套评测上,31M 小模型与 23 亿大模型的差距,以及推理代价差多少。
| 模型 | 参数量 | Asosoft 词错误率 | Fleurs 词错误率 | 推理特点 |
|---|---|---|---|---|
| Seamless 大模型 | 2,3 milliards | 8.18 | 20.01 | 图形处理器慢,中央处理器不可实时 |
| 节俭小模型 PL 微调后 | 31M | 7.67 | 22.46 | 与上行同架构不同训练 |
| 参数缩小倍数 | 75x | 未适用 | 未适用 | 小模型为大模型七十五分之一 |
| 推理加速 | 18 fois | 未适用 | 未适用 | 给定批量 6 下的报告值 |
上表后需要解释收益与代价。小模型在 Asosoft 上 7.57 到 7.67 反而略优于大模型的 8.18,在 Fleurs 上 22.46 则比大模型的 20.01 到 20.31 差约 2 点,说明接近但未全面超越。代价之外的未胜出项是 Fleurs 差距稳定存在,论文认为与伪标签误差传播和评测领域差异有关。推理上小模型在中央处理器上 36 秒跑完 75 分钟 Asosoft、136 秒跑完 Fleurs,而大模型中央处理器不可实时,图形处理器上小模型快 18 倍,但该加速只在给定批量和给定机器下测得,不能推广为任意部署的延迟承诺。
词错误率 × 字符错误率: 词错误率负责衡量整词是否识别正确,是论文主指标,字符错误率负责衡量字符级偏差,对形态丰富的库尔德语更敏感,二者搭配的理由是同时看粗粒度和细粒度错误,组合意义在于判断改进是真正减少词错还是只减少了字符拼写偏差。
词表和尺寸消融:哪里敏感,哪里很快饱和
消融按两个变量组织。第一个变量是分词词表。论文在 2k、5k、10k 和字符级 4 种下比较,指标同时看字符错误率和词错误率。只用人工标注时,子词词表在 Fleurs 上词错误率 87 到 91,字符切分降到 61.79,在 Asosoft 上子词 50 到 90,字符切分降到 25.39,说明小数据下字符切分明显更稳。只用伪标签时,差距大幅缩小,Fleurs 上 22.67 到 24.51 之间,Asosoft 上 8.54 到 9.44 之间,5k 到 10k 的差异不到 1 点,说明伪标签同时改善了声学模型和分词器训练文本。
第二个变量是模型尺寸,固定只用伪标签和 5k 词表。15,000,000 参数的最小模型在 Asosoft 上 13.20、在 Fleurs 上 31.70,明显落后;31,000,000 参数跳到 8.81 和 22.83;76,000,000 参数到 7.93 和 21.81;268,000,000 参数到 7.51 和 21.20。可见从 15M 到 31M 收益最大,之后继续增大趋于饱和,且 7600 万和 2.68 亿在 Asosoft 上已达到或超过大模型的 8.18。
这里要强调一个负结果:人工加伪标签直接混合不如只用伪标签,混合后再微调也不如伪标签后直接微调。这个反例支持论文的分布失衡解释,也提醒复现时不要想当然地把所有数据堆在一起。另一个边界是论文没有测试噪声更大的原始音频,若有声书质量下降,四道过滤阈值是否仍然适用尚未验证。
从部署角度看,31M 是论文主推的折中点:比 15M 好得多,比 76M 和 268M 小得多,而性能已接近大模型。若算力允许,76M 是 Asosoft 上超越大模型的更小代价选择,但 Fleurs 上仍需接受与大模型的差距。
哪些结论有限:数字冲突、未测项和未验证推测
先明确论文直接报告的内容:大模型微调显著降低词错误率,伪标签训练的小模型在 Asosoft 上接近或略超大模型、在 Fleurs 上差约 2 点,小模型参数为大模型七十五分之一且在给定硬件上更快。这些是有数字支持的判断。
再明确有限解释。论文把混合训练变差归因于人工数据重复导致的词分布失衡,这是有数据结构支持但未经对照实验证实的解释,应表述为支持而非证明。把重复过滤能去掉语码切换和方言的说法也是基于观察的总结,没有给出误滤率和漏滤率。
未验证的推测必须用可能和待验证表达。例如,更大伪标签量是否继续提升、其他低资源语言是否同样有效、误差如何在伪标签链条中传播,论文在结论中明确列为未来工作,目前不能承诺。同样,训练资源、输出帧率与实际交互延迟是不同概念,论文只测了批量为 6 的离线推理耗时,没有测流式延迟和内存占用,不能把 18 倍快推广为实时可用。
还有两处证据冲突需要保留。一是 Fleurs 大模型词错误率在摘要为 20.01、在正文为 20.31;二是摘要小模型 Asosoft 为 7.57 而正文最优行为 7.67,两者对应不同训练组合,比较时必须注明组合名称,不能只取最优值当作可部署收益。论文未提供代码、模型和数据的可达性验证,本次也没有收到来源绑定且完成验证的资源,因此不得声称代码或模型已公开。
要复现先做什么:按依赖顺序准备数据与阈值
复现的第一步是准备数据与评测。按原文收集 Common Voice 18 验证集中的 117k 条和 Asosoft 训练集 42.5k 条作为人工训练,Asosoft 测试集 800 条和 Fleurs 库尔德语 921 条作为评测,保持划分不交叉。收集有声书时记录主题分布和音频质量,因为过滤阈值是在高质量音频下选择的。文本全程做同样的归一化,包括 Unicode 修正、标点和数字处理,引用 Mahmudi 等人的库尔德语归一化方法。
第二步是切分与微调。实现基于能量的语音活动检测,按连续 30 帧 10 毫秒静音切分并首尾各留 10 帧静音,得到 1 秒到 20 秒的片段。用人工数据微调 Seamless 的编码器和解码器,先复现基线 24.04 和 38.33 再复现微调后 8.18 和 20.31,确认伪标签发生器已达标再往下走。论文未报告微调超参数,复现时需从小学习率和早停开始试,并记录随机种子和轮数。
第三步是生成、过滤与训练。用微调后大模型转写切分片段,按每分钟 90 到 200 词、时长与词元长度、置信度 0.9、重复规则四道过滤,目标是复现从 230 万到 177 万、3300 小时、22,300,000 词元的数量级。用过滤后文本训练 SentencePiece 分词器,再从零训练 31M 的 12 层编码器加 6 层解码器,比较只用人工、只用伪标签、混合、先伪标签后微调 5 轮等组合。
何时值得尝试这种路线:当目标语言人工标注少但有大量高质量无标注语音,且部署端只有中央处理器或小显存时值得尝试;当无标注音频噪声大或与评测领域差异极大时,应先小规模验证伪标签质量再扩大。还需补的验证是过滤阈值的敏感性、多次运行的方差以及在第二种低资源语言上的重复实验。
收束:大模型当老师傅,小模型当交付品
回到中心矛盾:低资源社区既缺标注又缺算力,单纯发布更大的多语言模型并不能直接解决问题。本文的解法是把大模型定位为一次性老师傅,只在数据准备阶段使用,把小模型定位为最终交付品,承担日常推理。这种分工在中库尔德语上得到了具体数字:在 Asosoft 受控测试上小模型与大模型相当,在 Fleurs 平行句测试上小模型落后约 2 点,但参数缩小 75 倍且能在中央处理器上分钟级跑完评测。
对研究生的启示有三点。第一,数据分布比数据堆量更重要,42.5k 条只含 700 句的人工数据会扭曲词频,直接混合反而有害,先伪标签后微调的顺序利用了两者的优点。第二,分词器不是小事,小数据下字符切分救了泛化,大数据下子词切分才稳定,复现时要把分词器训练文本来源固定。第三,报告数字时要带条件,批量、硬件、训练组合和评测集任何一项变化都会改变结论,取最优值代替可部署值会误导。
未解决的问题也很清晰:伪标签误差如何传播、阈值如何迁移到噪声数据、方法能否推广到其他语言,都还需要新的对照实验。在补上这些验证之前,最稳妥的表述是:该方法在本文的两个库尔德语评测和给定硬件下显示出节俭部署的潜力,而不是对所有低资源语言的通用保证。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
另有 2 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
