英文题目:Which Data Matter? Embedding-Based Data Selection for Speech Recognition

会议身份:conference:interspeech:2026:conference-paper-id:aldeneh26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#领域适应 #鲁棒性 #语音 #语音识别

评分:7.1/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zakaria Aldeneh:机构信息未能从会议 PDF 纯文本可靠映射
  • Skyler Seto:机构信息未能从会议 PDF 纯文本可靠映射
  • Maureen de Seyssel:机构信息未能从会议 PDF 纯文本可靠映射
  • Jie Chi:机构信息未能从会议 PDF 纯文本可靠映射
  • Zijin Gu:机构信息未能从会议 PDF 纯文本可靠映射
  • Takuya Higuchi:机构信息未能从会议 PDF 纯文本可靠映射
  • Jee-weon Jung:机构信息未能从会议 PDF 纯文本可靠映射
  • Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
  • David Grangier:机构信息未能从会议 PDF 纯文本可靠映射
  • Barry-John Theobald:机构信息未能从会议 PDF 纯文本可靠映射
  • Tatiana Likhomanenko:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

自动语音识别在本工作中面对输入为野外伪标签长语音、输出为文本转写、难点为源域异构分布与目标专用域失配且小模型无法吸收102458小时全量变异的矛盾。方法链分4步推进:先用说话人、语音自监督WavLM与句嵌入SBERT三类嵌入将变长语音映射为定长向量,再以到目标验证集的最大余弦相似度度量相关性,接着用最大边际相关以λ平衡相关与已选集冗余做分批贪心选择,最后将选出的5%子集用于训练联结时序分类的Conformer模型。相比单一声学相似度或置信度筛选,晚融合多嵌入同时约束说话声学、音素覆盖与语义词汇相关性并显式去冗余,实际意义是以极小数据量 bridging 域失配。在LibriSpeech clean测试集下,Fusion选择的WER为7.9%,低于随机5%选择的WER 12.5%。结论仅适用于以LibriSpeech、CommonVoice、TED-LIUM为目标且源为Granary英文的专用模型场景,多目标平均与最大聚合均弱于单目标选择。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么?为什么大而杂的数据反而让小模型难受?

这篇论文的输入是超过 100,000 小时的野外伪标签英语语音,来源是 Granary 英语部分,它基于 YODAS 收集,覆盖多种说话人、口音和录音条件,转写由机器生成所以带噪声。目标是为特定领域训练专才语音识别模型,论文用两档 Conformer 做载体:小模型约 9M 参数,大模型约 107M 参数,都属于生产尺寸。输出是识别词错误率,越低越好。

初学者容易以为数据越多越好,但这里的矛盾是容量与异构的矛盾。大模型能同时记住多种条件,小模型记不住全部细节,如果训练集里大量样本与目标域的说话人、发音或话题都离得很远,小模型会被拉偏。论文在引言里举了两个经典失配:主要用朗读训练的模型在自发语音上变差,主要用本地口音训练的模型在非本地口音上变差。也就是说失配可以发生在语音变化的任一轴上,单一相似度不够用。

因此论文把问题定义为目标化数据选择:给定很大的源池和很小的目标域验证集,例如 1 小时量级、只够做选择不够从零训练,从源池里挑出远小于全量的子集来训练,让目标测试集效果最好。后续所有方法都是围绕如何度量相关和如何保持多样展开的。

专才模型 × 通才模型: 通才模型指参数量大、能吸收大规模异构数据的模型,分工是靠容量覆盖多种声学条件;专才模型指部署受限的 10-100M 小模型,分工是在特定目标域上做准做稳。两者搭配的原因是野外数据虽大但与目标域失配,小模型装不下全部细节,所以论文不追求更大模型,而是为专才模型挑出既相关又不重复的子集,组合意义是用选择代替扩容来弥合训练与测试失配。

本解读的输入是论文正文证据与本次收到的官方原图像素,目标是让研究生能复述方法、条件和证据边界,输出是按学习依赖组织的技术解读,不做超出证据的效果承诺。

同样想省数据的前人走了哪几条路?本文站在哪里?

按同输入、同目标、同监督来对照,前人至少有 4 条路线。第一是为提速而减量,用子模优化或覆盖语言单元来均匀覆盖词或音素;第二是主动学习,按置信度或不确定性挑样本去标注;第三是半监督下的置信度过滤,用预训练识别模型的序列置信度筛域适应数据;第四是分布匹配,用 i 向量、低层信号统计或自监督离散单元度量候选与目标的相似。

论文明确与第三、4 条最接近,但指出只按置信度选对下游不最优,必须显式处理域失配。它的 3 个差异点写得很清楚:规模上用 100,000 小时以上 Granary 训练生产级专才模型,而前人多用 Switchboard 或 LibriSpeech 小数据;表示上同时比较说话人、语音、语义三轴并研究融合,而不是只用单一方面;目标上还研究同时面向多个目标域的统一选择,而不是 1 次只为一个域选。

理解这个定位能避免误读:本文不是提出新嵌入,也不是提出新识别架构,而是把现成嵌入放进同一个最大边缘相关选择框架,控制变量地回答哪一轴重要、融合是否有加成、多域聚合是否可行。

要解决的到底是哪个可运行的问题?

形式化地说,记源集为 Dsource,目标验证集为 Dtarget,目标是选出子集 S 远小于全集,且用 S 训练的识别模型在目标测试集上好。关键约束是 Dtarget 很小,只能用于指导选择,不能直接训练出好模型;测试集全程不动,只用验证集做选择。

举个教学例子:假设目标是 LibriSpeech 有声书域,源池是混杂的网络音频。例子只是帮助理解流程,不代表论文用过该具体数值。流程是先把每条语音变成固定维向量,再算它与目标验证集里最像的那条有多像,最后在像目标和彼此不重复之间折中。论文的全部实验都是这个问题的实例化,区别只在用什么向量算像,以及 1 次面向一个域还是多个域。

方法全景:一个样本如何走完输入到被选中?

沿一条样本走一遍最清楚。输入是一条变长语音,有时附带伪标签文本。表示阶段用嵌入函数把它变成定长向量,论文试了 3 种:说话人嵌入、WavLM 嵌入、SBERT 嵌入。组件阶段先算相关分,即该向量与目标集所有向量的最大相似;再算多样惩罚,即它与已选集合里最像的那个的相似。

目标阶段用最大边缘相关打分把两者相减加权,贪心一批批挑,直到累计时长达到预算,例如全量时长的 5%。输出是被选中的音频加伪标签集合,直接拿去训练 Conformer。

多嵌入时,每个样本有 K 个向量,相关和多样各自在每个空间算完再加权求和,这就是晚融合。多目标域时,目标侧有多个数据集,相关分用最大聚合或平均聚合:前者只要像其中一个域就算相关,后者要求对多个域平均都像。论文后面证明后者并不总能保住单域精度,这是重要的反证。

三种嵌入各管什么?相关与多样怎么算?

说话人嵌入来自 MFA-Conformer 说话人识别模型,取 3072 维倒数第二层再随机投影到 256 维,白话说就是听起来像谁、在什么房间说的。它原本想对内容不变,但论文引用的探针研究说明它还混入会话、环境、增强和转写痕迹,所以用它选会偏向说话人和声学条件像目标的源样本。

WavLM 嵌入来自 WavLM Base+ 的 768 维帧表示,均值池化到句级再投影到 256 维,白话说就是发了哪些音、口音和发音习惯。它对说话人和噪声相对不变,用它选会偏向音素覆盖和发音模式像目标的样本。SBERT 嵌入来自 all-MiniLM-L12-v2 的 384 维句向量,直接对转写文本编码,白话说就是讲了什么话题、用了什么词和句式。用它选会偏向语义分布像目标的样本,但前提是要有转写。

相关性 × 多样性: 相关性指候选样本与目标域验证集嵌入的最大余弦相似,分工是把选择拉向目标条件;多样性指候选样本与已选集合的最大相似的惩罚项,分工是避免挑出一堆互相重复的句子。搭配理由是只按相关性取前 k 会导致信息重叠,组合意义是最大边缘相关用 λ 加权两者,迭代选出既贴近目标又内部互补的子集。

说话人嵌入 × WavLM 嵌入: 说话人嵌入分工是刻画声道、口音、录音环境等说话人和通道特性,对语言内容相对不变;WavLM 嵌入分工是刻画音素和发音模式,对说话人身份相对不变。搭配原因是语音失配可能同时来自谁在说和说了什么音,两者互补,组合意义是在同一选择框架下比较哪一轴更决定识别效果,并可用加权求和做晚融合同时满足多轴接近。

SBERT 嵌入 × WavLM 嵌入: SBERT 嵌入分工是从转写文本抽取语义、词汇和句式分布,需要转写文本;WavLM 嵌入分工是从声学帧抽取音素覆盖,直接作用于音频。搭配原因是目标域可能有独特话题词分布,也可能有独特发音分布,组合意义是检验对齐语义分布是否能像对齐语音分布一样改善识别,以及两者融合后是否在平均词错误率上再获益。

晚融合 × 最大边缘相关: 最大边缘相关分工是给出相关减去多样惩罚的迭代贪心准则;晚融合分工是把每种嵌入的相关分和多样分分别算好再按权重求和。搭配原因是不同嵌入维度不同不宜直接拼接,组合意义是保留每种表示的可解释权重,让同时在多空间接近目标且远离已选样本的候选获得高分。

实现上为扩展到大数据做了三处加速:批量贪心 1 次选 B 个、按相关分预过滤只留前 ρ 比例候选、对目标嵌入做 k 均值聚类到 200 个再算最大相似。主实验取折中参数 λ 为 0.7,后面消融再扫 0.0 到 1.0。随机投影的几何保持在论文脚注里给了验证:在 10 万随机对上投影前后余弦相似的相关系数为 0.96 和 0.98,说明降维没有打乱相对远近。

选择之后怎么训练?模型和优化到底怎么配?

选择本身没有可训练参数,训练指的是用选出的子集训练识别模型。音频统一为 80 维对数梅尔滤波器组,25 毫秒窗、10 毫秒步长,转写用 Whisper 规范器归一化并用 8k 词片段分词器。模型是 CTC 损失的 Conformer:小模型卷积编码器加 16 个 Conformer 块,嵌入 144 维、4 头、576 维前馈;大模型同结构放大到 1536 卷积通道、512 嵌入维、2048 前馈。

优化器是 AdamW,在 8 卡 A100 上训 500,000 步,每卡每批最多 500 秒语音,梯度裁剪 0.5,学习率 10,000 步线性暖机到 0.002,200,000 步起每 50,000 步做余弦衰减,10,000 步后开 SpecAugment,频率掩膜两个、时间掩膜 10 个。论文没有报告冻结某层或分阶段解冻,监督全部来自 Granary 伪标签加目标选择,没有用目标训练集做联合训练。

需要补的缺项是伪标签噪声的具体比例和过滤阈值原文未给出,所以不能把增益归因于去噪,只能说在该噪声水平下相对比较成立。微调实验是另一条路径:先用随机 5% 或融合 5% 训好,再在目标验证集上继续调,论文报告多数域变差,只有 CommonVoice 变好,提示小验证集微调容易过拟合。

在什么数据和协议下比?指标方向是什么?

源数据是 Granary 英语 102458 小时,目标是 3 个公开集:LibriSpeech 约 961 小时训练、验证 10.5 小时、测试 10.7 小时,含干净和其他;CommonVoice 英语约 1594 小时训练、验证 27.1 小时、测试 26.9 小时,口音和设备杂;TED-LIUM 约 452 小时训练、验证 1.6 小时、测试 2.6 小时,自发演讲多。只有验证集参与选择,测试集只做评测。指标是词错误率,越低越好,相对降低越大越好。

比较的公平条件是同一模型结构、同一训练步数和同一分词,只换训练子集。基线包括直接用目标域训练集训练、全量 Granary 训练、随机 5% 训练、按时长分布匹配的时长基线,以及单嵌入选择和三嵌入融合选择。论文还做了随机比例从 1% 到 100% 的规模扫描、λ 扫描、多域最大与平均聚合、跨嵌入可预测性探针。

下表先交代数据版图,帮助后面理解为什么同一选择在不同域效果不同。表前的问题是:源与目标在规模和风格上差多少?公平条件是都按原文小时数呈现,指标方向是规模越大选择空间越大但失配也越大。

数据角色数据集规模与风格选择中的用途评测方式
源池Granary 英语102458 小时野外伪标签被选择对象不直接评测
目标一LibriSpeech961 小时有声书,验证 10.5 小时验证集指导选择测试集报词错误率
目标二CommonVoice 英语1594 小时众包,验证 27.1 小时验证集指导选择测试集报词错误率
目标三TED-LIUM452 小时演讲,验证 1.6 小时验证集指导选择测试集报词错误率

上表说明源远大于目标且风格杂,目标验证集都很小。代价是选择必须依赖小验证集的代表性,CommonVoice 验证相对大而 TED 验证很小,这为后面微调只在 CommonVoice 获益埋下伏笔。未胜出项是时长基线,它只对齐时长分布,整体不如嵌入选择,说明失配不只是语速长短问题。

5% 能超过 100% 吗?哪种嵌入在哪个域赢?

先看全量与跨域的底座。大模型直接用 LibriSpeech 训在自身干净集最好,但换到其他域明显变差;直接用 TED 训则连 Granary 全量都不如。Granary 全量提供了跨域鲁棒性,但仍有失配缺口,这正是要选子集的原因。随机 5% 与全量接近,说明源池冗余大,小模型也吃不下全部变化。

下表聚焦小模型在 Granary 上的核心比较,问题是:在同一 5% 预算下,随机、单嵌入、多嵌入融合谁更好?公平条件是同为 Conformer-Small、同为 5% 时长,指标是 4 个测试集词错误率越低越好。

条件LS-cleanLS-otherCVTED-LIUM
Full 全量12.523.236.611.0
Random 随机 5%12.523.537.110.7
Fusion 融合 5%7.917.234.09.4

上表显示融合 5% 全面低于全量和随机 5%,相对随机 5% 的降低为干净集 36.8%、其他集 26.8%、CommonVoice8.4%、TED12.1%。主要收益在 LibriSpeech 两套测试,代价是 CommonVoice 提升小,且 SBERT 单用时在 CommonVoice 反而弱于语音类嵌入。未胜出项是时长基线和纯微调:时长基线整体略逊于随机,微调随机 5% 模型在 LibriSpeech 和 TED 上词错误率上升到 14.1% 和 17.8% 量级,只有 CommonVoice 从 37.1% 降到 33.6%,融合再微调到 31.8%,说明验证集微调不是万能。

为理解训练动态,看下面验证损失曲线。图前导读如下:该图横轴是 0 到 5e5 训练步,纵轴是 LibriSpeech 干净验证集上的验证损失,共 6 条曲线区分大小模型与全量、随机 5%、最大边缘相关 5%,需要沿步数比较 3 组训练条件的相对高低,并注意 2e5 步附近学习率衰减带来的台阶。

看图路径: 1. 先看横轴训练步数到 5e5 与纵轴验证损失,确认六条曲线的分组含义;2. 对比深蓝色大模型 MMR5% 曲线是否全程低于浅蓝全量与随机 5% 曲线;3. 观察棕色小模型 MMR5% 虚线在 2e5 步附近的下降位置与最终收敛高度;4. 检查小模型 MMR 最终损失是否接近大模型全量,验证以小博大的主张

原论文 Figure 1:1

论文图 1。原论文 Figure 1:“1”。

从像素可见,深蓝色大模型最大边缘相关 5% 曲线全程最低,终点明显低于浅蓝全量和中蓝随机 5%;棕色小模型最大边缘相关虚线起点约 34 附近,早期就低于橙色全量与随机虚线,在 2e5 步后快速下降并贴近大模型全量,最终约 12 附近,而橙色两条停在约 20 附近。这支持论文的判断:选择子集降低了验证损失,且小模型用选择后能接近大模型全量的损失水平。但这只是验证损失,不能直接等同于所有测试集词错误率,仍需结合上表看域差异。

增益来自哪里?λ、多域聚合和表示互补说什么?

先看相关与多样的折中。下表问题是:λ 取 0 只重多样、取 1 只重相关、取 0.7 折中时谁更好?公平条件是同嵌入、同 5% 预算,指标仍是词错误率越低越好。

嵌入与 λLS-cleanLS-otherCVTED-LIUM
Speaker λ0.710.820.934.49.6
WavLM λ0.710.320.633.69.2
SBERT λ0.78.918.435.79.9

上表在 λ0.7 处三者都明显好于 λ0.0 的纯多样,论文报告 λ 大于 0 普遍最强,但最优点随嵌入和域漂移:说话人和 WavLM 更偏好大 λ,语义嵌入在 λ1.0 时在部分域回落,说明过分强调语义相关会牺牲多样。反例是 λ0.0 时说话人干净集到 14.0%、WavLM 到 12.9%,证明不要相关只保多样是不够的。

多域统一选择的反证也很关键。用最大聚合或平均聚合 1 次选出服务三域的 5%,在 LibriSpeech 上普遍弱于单域单独选,说话人和 WavLM 的两种聚合都让干净集词错误率回升,SBERT 的两种聚合在全部测试集都不如单域。偶有最大聚合在 CommonVoice 上追回一点,但以牺牲 LibriSpeech 为代价。论文的解释是不同域要的特征冲突,统一空间会稀释针对性。

表示互补用逻辑回归探针验证:把一种嵌入聚成 100 类,用另一种嵌入预测类标,随机基线约 1%。同嵌入自预测最高,跨预测中 WavLM 预测说话人约 21.3%、预测语义约 5.9%,说话人与语义互预测都很低。这支持三者 largely 互补,不是同一个信息的 3 种写法,也为融合有效提供了侧证,但相关性不等于因果,仍需以上表实际增益为准。

哪些还没测?什么条件下结论可能不成立?

论文自己点出两个局限。第一是贪心最大边缘相关的计算贵,即使做了批量、预过滤和目标聚类,在 100,000 小时规模上仍是重操作,原文没有给出端到端耗时和内存,无法判断在算力紧张时是否划算。第二是依赖伪标签 Granary,标签噪声比例未量化,选择可能同时选到了干净且相关的数据,也可能只是避开了噪声,机制没有拆开。

未评测边界包括:只报了词错误率,没有报误接受、延迟、推理开销和实际部署成本;只用 CTC Conformer 两档,没有验证其他架构或流式模型;只用英语,没有验证多语;微调只在小验证集上试了简单续训,没有早停和正则的系统搜索。总体趋势不等于每组都成立,例如融合的平均最好主要由 LibriSpeech 驱动,CommonVoice 上 WavLM 单用反而更强,选型时要按目标域重做验证。

要复现先做什么?关键超参数和信息条件是什么?

复现的第一步是拿到数据划分:Granary 英语全量做源池,3 个目标集只取验证集做选择,测试集锁死。音频提 80 维滤波器组,分词用 8k 词片段并做 Whisper 文本归一化,保证与原文一致,否则词错误率不可比。

第二步是复刻嵌入:说话人用 MFA-Conformer 倒数第二层投影到 256 维,WavLM Base+ 帧向量均值池化再投影到 256 维,SBERT 用 all-MiniLM-L12-v2 保持 384 维,余弦相似前确认是否归一化。选择时目标侧聚类到 200 类,λ 先用 0.7,预算按时长 5% 累计,批量大小和预过滤比例按算力调整但要记录,因为它们改变贪心轨迹。

第三步是训练:Conformer 小与大两档、AdamW、500,000 步、暖机 10,000 步到 0.002、200,000 步后余弦衰减、SpecAugment 在 10,000 步后开启。资源状态方面,本次未发现来源绑定且完成验证的开源链接,不得声称代码、模型或数据已公开,复现时应以论文描述为准自行实现选择流程,并补测耗时、内存和多次随机的方差。

何时值得试?一句话行动指南是什么?

当你有海量野外伪标签数据、部署模型小、目标域清晰且验证集很小时,值得试目标化选择:先用 WavLM 或说话人嵌入做单轴选择看收益,再试三轴晚融合,不要一开始就做多域统一选择。LibriSpeech 类朗读域对语义对齐敏感,CommonVoice 类杂口音域更吃语音和说话人轴,要按域选嵌入和 λ。

行动顺序是:固定模型和训练步数,先复现随机 5% 接近全量的冗余基线,再上最大边缘相关 5% 并扫 λ,最后才考虑验证集微调且只在验证量稍大的域尝试。记住论文的边界:5% 超全量是在该数据、该模型、该指标下的报告结果,换域、换架构、换损失都要重测选择和训练成本,才能决定是否上线。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总