英文题目:Dissecting ASR Failures in Low-Resource South Asian Languages

会议身份:conference:interspeech:2026:conference-paper-id:azeemi26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#评测协议 #模型评估 #低资源 #多语言 #语音识别

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Abdul Hameed Azeemi:机构信息未能从会议 PDF 纯文本可靠映射
  • Ihsan Ayyub Qazi:机构信息未能从会议 PDF 纯文本可靠映射
  • Maryam Mustafa:机构信息未能从会议 PDF 纯文本可靠映射
  • Agha Ali Raza:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理乌尔都语、旁遮普语、普什图语和辛迪语4种南亚语言的语音到文本转写,难点在于波斯阿拉伯文字变体混淆、拼写非标准化、跨文字命名实体与极端资源不均。方法链分3步推进:第一步在通用语音22.0与FLEURS上对5个多语言模型做零样本解码,输出原始转写文本以暴露跨文字输出问题。第二步用jiwer计算词错率并按11类错误分类法分解编辑操作、命名实体与长度效应,其分类结果进入下一步作为可修复性判断依据。第三步对波斯阿拉伯统一码归一化与规则转写后处理做消融,量化其在不重训条件下可恢复的文字层伪误差。与仅报总体词错率的已有评测相比,该框架区分了声学失败与文字层伪误差,具有诊断意义。在Common Voice旁遮普语评测下,经规则转写后处理的Whisper-medium的WER为79.7%,低于转写前Whisper-medium的WER104.7%。结论限于朗读式短语音与零样本推理,未验证微调与自发代码混合场景。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 第三方资源:https://github.com/jitsi/jiwer — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么 350 万人使用的语言仍算低资源语音任务?

输入是乌尔都语、旁遮普语、普什图语和信德语的朗读语音,目标是输出对应语言正确文字的转写文本,必须保留的信息是语言、文字、资源等级和评测基准。乌尔都语使用阿拉伯文字变体,资源相对中等;旁遮普语使用古木基文但与印地语共享词汇;普什图语和信德语使用不同的阿拉伯文字变体,资源分别低和极低。论文报告 4 种语言合计超过 350,000,000 人使用,但训练语音只有从数百小时到数十小时的不等规模,信德语在 Common Voice 训练转写中只有 271 句。

这种不平衡不是简单的量少,而是带来文字接近、拼写不统一、混合文字命名实体和统一码视觉相同但码点不同等问题。初学者容易把低资源理解为录音少,论文实际强调的是文字系统、拼写规范和跨语言干扰共同造成的结构性困难。输出是可复述的评测结论:总词错率一个数字会把听错、写错文字、拼写合法变体和码点差异混在一起,因此需要拆解后再谈改进。

同输入同目标的前人工作提供了什么对照?

在同输入、同目标、同运行阶段下,论文对照了 3 类工作。第一类是乌尔都语基准工作,报告 Whisper、MMS 和 SeamlessM4T 的总词错率并指出文本归一化是重要混杂因素,本文把该发现量化扩展到 4 种语言。第二类是针对普什图语、旁遮普语和乌尔都语的 Whisper 少样本提示评测,只报告总量,本文增加更多模型和语言并首次系统分解失败原因。第 3 类是单语高资源语言的误差分析和跨书写系统的词错率不可靠性研究,本文保留编辑操作和未登录词等标准维度,同时新增多文字低资源特有维度。

非洲语言基准工作也被引用为平行证据:同样观察到无单一模型主导全部资源等级,以及 Whisper 在班巴拉语上超过 100% 词错率的灾难模式,与本文在 Whisper 上的观察一致。这些对照不支持跨语系直接比大小,只支持失败形态是否复现的判断。

总词错率一个数字掩盖了哪些失败?

论文要回答的问题是模型在该语系上为什么失败,而不是失败多少分。操作是固定模型和测试集,先用 jiwer 计算基线词错率和字错率,再按 11 维误差分类做事后分析,覆盖文字混淆、编辑操作构成、重复循环、数字处理、正字法变体、字符混淆、命名实体、拉丁词、低频词、 utterance 长度和跨语言污染。教学例子是把 1 次评测想象成批改听写:学生可能听对了读音但写成了别种文字,老师若只数词错个数就会判全错。

论文明确指出标准词错率把识别错误与正字法和统一码差异混在一起,最多可虚高 3.1 个百分点。另一个关键操作是区分可运行策略与事后解释:转写后处理和统一码归一化都是不重训的字符串处理,可以实际运行;而去掉文字混淆输出后再算词错率只是诊断上限,不能当作可部署收益。问题定义因此包括适用条件:所有结论针对零样本推理和朗读语音,自发对话和代码混合语音会更差。

40 组评测与 11 维分类如何组织成全景?

沿一个样本走完流程有助于建立全景。输入是一段旁遮普语语音和目标文字为古木基文的参考文本,表示是模型输出的假设文本,组件是 5 种模型中的某一个加上 jiwer 对齐打分,目标是得到词错率和字错率,输出是总分加上 11 个维度的分解标签。具体安排是 5 种模型跨越 3 种架构,乘以 4 种语言再乘以两个基准,共 40 组配置。模型包括 Whisper-medium 和 Whisper-large-v3,属于自回归编码器解码器;MMS-1b 属于连接时序分类模型。

SeamlessM4T-Medium 和 Large 属于带语言适配器的编码器解码器。数据集是 Common Voice 22.0 和 FLEURS,测试量从信德语 Common Voice 的 40 句到乌尔都语 Common Voice 的 5082 句。命名实体用大语言模型管线标注 4 类实体,词频用 Common Voice 训练转写统计,话题域用大语言模型分类器分成 10 类。白话先说指标:词错率是按词算错了多少,英文为 word error rate,缩写为 WER;字错率是按字符算错了多少,英文为 character error rate,缩写为 CER。

后文固定用词错率和字错率指代。

词错率 × 字错率: 词错率负责按词统计替换、删除和插入 3 类编辑操作的总体代价,字错率负责按字符统计细粒度偏离,二者搭配的理由是词错率对波斯阿拉伯文字的拼写和码点差异过于敏感,字错率能显示语音内容是否其实正确,组合意义是用双指标把识别失败与书写评价假象分开。

论文选择该全景的理由在原文中明确写出:架构差异决定幻觉能力,连接时序分类不能生成超过输入长度的词,自回归可以自由幻觉,语言适配器提供文字层面的指引。只有同时改变架构、语言和基准,才能看出资源等级改变的是失败性质而不只是频率。

架构、文字和词汇组件各自负责什么?

组件按分工理解更清楚。声学识别组件负责把语音变成音素或词序列,文字选择组件负责决定用哪套字符输出,评价对齐组件负责把假设文本与参考文本对齐并计数。Whisper 的弱点集中在文字选择,MMS 的弱点集中在声学替换,SeamlessM4T 的语言适配器则在两者之间提供约束。白话先说架构:连接时序分类英文为 connectionist temporal classification,缩写为 CTC,指逐帧输出且长度受限的建模方式;自回归解码英文为 autoregressive decoding,指逐词依赖历史生成的建模方式。

后文固定用这两个简称。数字处理是独立的组件行为:在 FLEURS 上 SeamlessM4T 把 87% 到 89% 的数字拼写成词,MMS 尝试数字形式,Whisper 直接丢掉 21% 到 27% 的数字,说明没有模型可靠处理数字,且每种架构失败方式不同。拉丁借词处理也是组件行为:27% 到 62% 被删除,9% 到 54% 被转写为本地文字,只有 1% 到 11% 原样保留,SeamlessM4T 偏好转写而 MMS 偏好删除。

连接时序分类 × 自回归解码: 连接时序分类负责在输入帧长度约束内逐帧输出不可超出长度的符号序列,自回归解码负责逐词依赖已生成历史继续生成,二者搭配的理由是论文要对比架构如何塑造错误形态,组合意义是解释了为何前者以替换为主且无循环,后者会出现插入和重复循环。

词汇侧的两个概念需要并排理解。白话先说命名实体英文为 named entity,指人名地名等专名;低频词英文为 rare word,指训练中极少出现的词。后文固定用这两个简称。

命名实体 × 低频词: 命名实体负责人名地名机构名等指称性词汇的准确转写,低频词负责训练文本中出现次数极少的一般词汇,二者搭配的理由是它们都考验模型对未充分见过词形的泛化,组合意义是共同揭示资源量如何改变失败性质而不只是失败频率。

论文报告实体准确率为大语言模型标注的参考实体词在对齐下的精确匹配率,SeamlessM4T-Large 达到 65% 到 80%,MMS 为 30% 到 70%,Whisper-large-v3 为 0% 到 72% 且除乌尔都语外接近零。

本研究训练了什么,没有训练什么?

本研究没有训练任何声学模型,没有更新参数,没有报告梯度路径、优化器、学习率或重置时机,因此不能从模型名称推定训练实现,也不能把无训练等同于确定性求解。真实计算过程是零样本推理加事后字符串计算。第一步调用已有权重对测试语音做推理,得到假设文本;第二步用 jiwer 计算词错率和字错率;第三步做 3 类可重放的字符串处理。

转写处理用 aksharamukha 把天城文转写为古木基文,用 indo-arabic-transliteration 把天城文转写为信德阿拉伯文;归一化处理统一波斯阿拉伯文中的 Yeh、Kaf、Heh、Hamza 和 Alef 变体后再重算误差;标注处理用 Claude Haiku 管线标命名实体并用训练转写计词频。资源状态依据本次收到的校验信息:第三方 jiwer 链接当前可用,已公开可用于复现基线打分。缺项需要明确指出:原文未报告解码温度、束宽、语言提示设置和推理硬件开销,未测量延迟和成本,因此不能承诺这些量得到改善。

数据、划分、指标和公平条件是什么?

数据来自两个公开基准的测试划分,论文未自建训练集。Common Voice 依赖可选自报口音元数据且覆盖稀疏,FLEURS 未提供任何语言子集的方言范围信息,因此方言构成基本未知。测试规模差异本身就是实验条件:极低资源的信德语只有 40 句,统计可靠性有限。比较的公平条件是同一语言同一基准下比较 5 个模型,指标方向是词错率和字错率越低越好,实体准确率和词准确率越高越好。

聚合对象需要分清:总表按语言数据集聚合,编辑构成图按语言平均,长度效应按词数分箱,话题分析只在乌尔都语上做以隔离内容难度与文字混淆。百分点与相对百分比不同,论文统一用百分点报告改进,避免把 25 个百分点说成 25%。不同指标的差值不能混放,字符级改善大于词级改善是正常现象,不能直接对比大小。原文表头或图注若与正文算术冲突应标注冲突,本文未发现需要编造划分来弥合的冲突,但需记住信德语小样本带来的不确定性。

主结果显示谁最好,代价和反例是什么?

先提出比较问题:在相同语言和基准下,哪个模型总词错率最低,是否达到可用水平。公平条件是零样本直接推理,指标方向是词错率越低越好。论文报告 SeamlessM4T-Large 在 8 组语言数据集对中的 6 组最优,MMS-1b 赢下两组信德语。以下整理表聚焦 FLEURS 最佳值及其含义,数字来自原文连续报告句,不做四舍五入和单位改写。

语言与基准指标最优模型最优值可用性对照
乌尔都语 FLEURS词错率SeamlessM4T-Large16.3%高于 10%
旁遮普语 FLEURS词错率SeamlessM4T-Large22.1%高于 10%
信德语 FLEURS词错率MMS-1b23.5%高于 10%
普什图语 FLEURS词错率SeamlessM4T-Large43.8%高于 10%

表后解释需要同时讲收益与代价。收益是 SeamlessM4T 在多文字语系上最稳健,乌尔都语 16.3% 和旁遮普语 22.1% 是全文最强的可运行结果。代价是全部最佳结果仍高于生产级常用的 10% 以下目标,且都是朗读语音,自发和代码混合语音会更高。反例是信德语:MMS-1b 反超说明没有单一模型通吃全部资源等级。未胜出项也要保留:Whisper 在 3 种语言上因文字混淆出现超过 100% 的词错率,这不是识别差一个数量级,而是整句用了错误文字。

以下导读针对编辑操作构成图,帮初学者把架构与错误形态联系起来。该图左右分开两个基准,纵轴是替换、删除和插入在总误差中的占比,不是词错率本身。

看图路径: 1. 先看左右两块面板分别对应 Common Voice 和 FLEURS,再看横轴五个模型;2. 比较红色替换段占比,确认 MMS 是否始终最高;3. 比较 Whisper-M 蓝色插入段在两块面板中的高度变化;4. 核对纵轴是误差构成百分比而不是词错率本身

原论文 Figure 1:Error type composition by model, averaged across languages.

论文图 1。原论文 Figure 1:“Error type composition by model, averaged across languages.”。

图中可见内容支持论文判断:MMS-1B 的红色替换段在两块面板上都最高,符合连接时序分类不能超长插入的约束;Whisper-M 的蓝色插入段明显更高,在 Common Voice 上尤其突出,反映自回归幻觉内容;SeamlessM4T 居中。按语言拆分后还有细节:Whisper 在普什图语上的插入率接近 27%,在乌尔都语上降到约 13%,MMS 在普什图语上的删除率接近 19% 而在乌尔都语上约 10%,说明低资源语言在同一架构内也会触发不同失败形态。重复循环进一步区分架构:MMS 为零例,自回归模型偶发超过 200% 词错率的解码循环。

拿掉文字混淆和码点差异后还剩多少误差?

本节按可运行的干预组织:测什么、与谁比、条件是否一致。第一个干预是转写后处理,比较对象是同一 Whisper 输出在转写前后的词错率和字错率,条件一致且不重训。第二个干预是统一码归一化,比较对象是同一假设文本在归一化前后的误差,条件一致。以下整理表只收录原文明确给出干预前后数字的策略,不收录事后最优的诊断值。

干预与对象指标干预前干预后变化
旁遮普语 Whisper-medium 转写字错率干预前基线干预后结果62.5 pp
信德语 Whisper 转写词错率干预前基线干预后结果7.6 pp
信德语 Whisper 转写字错率干预前基线干预后结果33.4 pp

表前已说明比较问题和公平条件,表后解释收益与限制。收益是旁遮普语转写减少 25.0 个百分点词错率和 62.5 个百分点字错率,证实语音识别主体完好,损失主要在文字层;信德语也有 7.6 个百分点词错率和 33.4 个百分点字错率的恢复。限制是 Whisper-large-v3 增益较小,且转写不能解决最低资源语言更深的不确定性。另一个诊断值另行标明:去掉文字混淆输出后 Whisper-medium 普什图语从 165.3% 降到约 97%,约 68 个百分点的膨胀只是诊断上限,不能当作可部署收益。

文字混淆 × 转写后处理: 文字混淆负责描述模型整句输出到错误书写系统的现象,转写后处理负责用规则把错误文字映射回目标文字而不改声学识别结果,二者搭配的理由是错误输出在语音上仍大致正确,组合意义是建立了不重训即可回收的准确率下界。

统一码与拼写问题需要单独处理。论文报告普什图语中阿拉伯 Yeh 与波斯 Yeh 的视觉相同码点不同共 11547 例,类似问题涉及 Hamza、Kaf 与 Keheh、Heh 变体。旁遮普语有叠音符和送气变体等合法拼写,普什图语和乌尔都语中阿富汗等词也有多种有效拼写,词错率都会判错。

统一码归一化 × 正字法变体: 统一码归一化负责把视觉相同但码点不同的字符统一后再算误差,正字法变体负责描述同一词存在多种合法拼写的现象,二者搭配的理由是两者都不反映声学听错却都会被词错率记为错误,组合意义是区分预处理可修复部分与评价本身需要容忍的部分。

以下导读针对命名实体与非实体准确率图,重点看实体是否系统更难。该图按 4 种语言分组,每组内比较深色实体柱与浅色非实体柱。

看图路径: 1. 先按图例区分深色命名实体与浅色非实体,再按语言分组看四组柱子;2. 对比同一模型在乌尔都语和信德语上的实体柱高度差异;3. 观察普什图语和信德语上 Whisper 两根柱子是否接近消失

原论文 Figure 2:Named entity vs. non-entity accuracy by model and language.

论文图 2。原论文 Figure 2:“Named entity vs. non-entity accuracy by model and language. Entities are consistently harder for lower-resource languages.”。

图中可见内容显示实体柱普遍低于非实体柱,差距多在 5 到 20 个百分点;Whisper 在信德语和旁遮普语上的实体准确率接近零,原因是整句文字错误导致实体必然错;SeamlessM4T-Large 的绿色实体柱在多数语言上最高,但仍不是满分。这支持论文判断:实体难不只是词频问题,还叠加了跨文字和跨语言干扰。

资源越少失败性质如何变化,边界在哪里?

先看资源梯度特有的 4 类细节,数字来自原文连续报告句。第一是词频梯度,稀有词准确率 20% 到 62%,常见词 49% 到 94%,乌尔都语差距 30 到 45 个百分点,普什图语差距 30 到 40 个百分点。第二是反转的长度效应,1 到 5 词短句平均词错率约 76%,21 词以上长句约 46%,与高资源语言长句更难的模式相反,机制是单字句中 1 次替换即得 100% 词错率。第三是跨语言污染,信德语输出含 12% 到 35% 其他语言字符,主要来自乌尔都语,而乌尔都语污染接近零,污染率与资源量负相关。

第四是统一码归一化收益,普什图语平均减少 3.1 个百分点,旁遮普语、信德语和乌尔都语分别减少约 1.6、0.8 和 0.4 个百分点。以下整理表把这些不可互相替代的指标并置,列数满足对照需要但不混放不同指标的差值。

现象与对象指标低资源端高资源端差距
词频效应全语言词准确率20–62%49–94%30–45 pp
长度效应全语言平均词错率76%46%短句更高
信德语污染异语字符占比12–35%接近零资源负相关
普什图语归一化词错率变化3.1 pp基线11547 例

表后解释代价与反证。代价是低资源不仅错得多,而且错法不同:借用高资源亲属语言、删除拉丁词、实体全灭。反例是话题域分析显示即使在全对文字的乌尔都语上,教育和政治最易而历史文化和体育最难,跨域差距 8 到 14 个百分点,且最难域随模型而异,说明预训练数据构成仍是混杂因素。边界必须写清:信德语 Common Voice 只有 40 句,统计可靠性有限;只评测零样本,微调可能缩小多种失败;方言信息缺失使结论不能推广到所有口音。

以下导读针对乌尔都语话题域热力图,帮读者看到内容难度本身的变化。该热力图行是 5 个模型,列是 10 个话题域,颜色越红词错率越高。

看图路径: 1. 先确认下方面板横轴是十个乌尔都语话题域,纵轴是五个模型;2. 沿颜色条从绿到红读数,找出每个模型最红的格子是否在同一列;3. 对比 Seamless-L 整行与 Whisper-M 整行的绿色覆盖范围

原论文 Figure 4:WER (%) by domain and model for Urdu.

论文图 3。原论文 Figure 4:“WER (%) by domain and model for Urdu. Domain difficulty varies by 8–14 pp; the hardest domains differ by model.”。

图中可见内容显示 Seamless-L 整行最绿,Whisper-M 整行最红;MMS-1B 和 Whisper-M 在历史和体育格更红,而教育和政治相对更绿;同一列内不同模型的最难点并不完全相同。这支持论文判断:在排除文字混淆后,剩余差距来自专业词汇是否出现在训练中,而不是统一的领域排序。

要复现关键数字先做什么,需要补哪些验证?

复现先做三件事。第一,用同一测试划分和 jiwer 重算基线词错率和字错率,保留原始输出不要先归一化,以便同时报告原始值和归一化值。第二,对 Whisper 的旁遮普语和信德语输出运行论文指明的规则转写工具,再重算误差,核对 25.0、7.6 和 13.3 等百分点变化是否复现,注意区分词错率与字错率的不同降幅。第三,实现波斯阿拉伯文字符归一化,统一 Yeh、Kaf、Heh、Hamza 和 Alef 变体后再算 1 次,核对普什图语约 3.1 个百分点的下降。

关键超参数和信息条件是原文未给出解码参数,因此复现时必须记录自己使用的语言提示、温度和束宽,否则数字无法对齐。还需补的验证包括扩大信德语测试集、报告多次运行的波动范围、测量推理延迟和计算成本,以及在自发语音和代码混合语音上重测,因为原文只覆盖朗读语音。代码层面 jiwer 当前可用,权重下载不等于系统可运行,仍需按模型仓库的运行环境配置语言适配器和解码器。

何时值得尝试这些方法,何时不应套用?

当评测对象是多文字亲属语言、总词错率动辄超过 100%、输出肉眼可见是别种文字时,值得先尝试转写后处理和统一码归一化,因为它们不重训且能区分语音正确与文字错误。当任务涉及大量命名实体、低频词和短指令时,应同时报告实体准确率和按长度分箱的词错率,而不是只看总量,因为总量会被一词一句的高惩罚主导。当部署目标是医疗等高风险场景时,不应把 FLEURS 上乌尔都语 16.3%、旁遮普语 22.1%、信德语 23.5% 和普什图语 43.8% 当作可用证据,它们仍高于可用阈值且来自朗读语音。

常见误解是把超过 100% 的词错率理解为完全没听懂,论文特有的澄清是这往往是整句文字选错的信号;另一个误解是把归一化后的下降理解为模型变强,实际只是评价更接近用户体验,索引等场景仍需保留原始值以暴露预处理问题。对于社区工作,论文指向众包补数据可能帮助信德语和普什图语,但这属于待验证的建议,不是已测量的因果结论。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总