英文题目:AfriVox: Probing Multilingual and Accent Robustness of Speech LLMs
会议身份:
conference:eacl:2026:conference-paper-id:2026.eacl-long.122
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准设计 #鲁棒性 #多语言 #语音识别 #语音翻译
评分:7.2/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Busayo Awobade:机构信息未能从会议 PDF 纯文本可靠映射
- Mardhiyah Sanni:机构信息未能从会议 PDF 纯文本可靠映射
- Tassallah Abdullahi:机构信息未能从会议 PDF 纯文本可靠映射
- Chibuzor Okocha:机构信息未能从会议 PDF 纯文本可靠映射
- Kelechi Ezema:机构信息未能从会议 PDF 纯文本可靠映射
- Devendra Deepak Kayande:机构信息未能从会议 PDF 纯文本可靠映射
- Lukman Enegi Ismaila:机构信息未能从会议 PDF 纯文本可靠映射
- Tobi Olatunji:机构信息未能从会议 PDF 纯文本可靠映射
- Gloria Ashiya Katuka:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为非洲20种语言及非洲口音英语、法语、阿拉伯语语音,输出为母语逐字转写与译为英语的文本,难点在于口音与方言高度多样、自发议会语音存在环境噪声与说话人重叠、低资源语言覆盖不足且旧公开集可能因预训练污染而高估性能。方法链第一步聚合NCHLT、Common Voice 17、FLEURS、OpenSLR、BibleTTS、NaijaVoices等开源转写翻译语料以覆盖多语言多口音基座,其输出统一为待测基准池。第二步新建4国议会实录与19语医疗平行朗读并经母语者听写加研究生抽检质控,其输出作为噪声真实与域内新集补充进基准。第三步用固定零样本与少样本提示驱动单模态识别翻译模型与多模态语音大模型做转写与翻译对比,其输出进入WER、BLEU、chrF与AfriCOMET-STL统一评测。与以高资源朗读为主的旧基准相比,关键机制差异在于显式区分旧集与新集并引入真实噪声、自发重叠与医疗术语,实际意义是暴露清洁集上的虚高泛化并检验多模态模型在长上下文翻译上的语义保真优势。在NaijaVoices豪萨语转写任务评测下,微调后Qwen2.5-Omni的WER为50.54,低于微调前基线的126.81。结论适用边界限于所覆盖语言与音频到英语翻译任务,议会噪声外的对抗噪声、语码混合、对话问答等多模态能力尚未验证,微调硬件受限于四块NVIDIA 3090 GPU的计算量且全量推理开销未系统披露。
🔗 开源与复现资源
- 第三方资源:https://speech.intron.health/ → https://speech.intron.health/login — 链接可访问(HTTP 200)
- 第三方资源:https://www.intron.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要回答哪两个部署问题?
本文的输入是真实非洲场景语音,目标是可核对的基准与选型建议。输入包括两类,一类是非洲口音英语,来自南非语料、泛非口音朗读、非洲口音过滤后的公共语音以及新整理的四国议会实录;另一类是 20 种非洲语言语音,覆盖南非荷兰语、阿坎语、阿姆哈拉语、埃及阿拉伯语、法语、富拉语、加语、豪萨语、伊博语、卢旺达语、卢干达语、北索托语、绍纳语、南索托语、斯瓦希里语、茨瓦纳语、契维语、科萨语、约鲁巴语、祖鲁语,领域包含医疗模拟对话与通用朗读。
输出是每个模型在每种语言上的转写文本与到英语的翻译文本,以及用词错率、BLEU、字符级分数与面向非洲语言的语义分数度量的成绩单。必须保留的信息是数据规模与口音数量、模型清单、提示与归一化方式、单次运行声明以及新旧数据集对照。目标读者是刚进入语音领域的研究生,学习依赖是先理解任务定义,再看数据如何构造,再看评测条件是否公平,最后才读结论。
论文要回答的两个问题是,哪些语音大模型在哪些非洲语言上真正可靠,以及多模态大模型与传统单模态识别翻译模型相比是否值得切换。作者还做了问答式的误差分析与三门尼日利亚语言的微调验证,给出医疗与法律等需逐字记录场景和对话翻译场景的不同选型。资源状态依据本次收到的校验,两个第三方链接当前可用,但正文是否开源以仓库状态为准,本文不代为断言长期可达。
已有基准与模型各解决了什么,为什么还缺一块非洲真实语音?
已有路线分三支。第一支是多语言语音基准,例如多语言 LibriSpeech、大规模多语言评测与 ML-SUPERB 2.0,做法多是朗读或合成语音,非洲语言很少,缺少口音与领域多样性。第二支是单模态大语音模型,例如 Whisper、MMS 与 Parakeet,在高资源语言上稳健,但在非洲语言上的可靠性多为零散说法。第三支是多模态语音大模型,例如 AudioPaLM、SeamlessM4T、Qwen-Audio 与 Gemini,统一语音文本与翻译,但此前没有在非洲数据上系统对比。参数高效微调路线如 LoRA 与 QLoRA 已在高资源与部分亚洲语言验证省算力,但对非洲语音大模型的影响未知。
非洲语料方面,NCHLT、Common Voice、FLEURS 提供了起点,AfriSpeech 与 NaijaVoices 开始补口音与规模,但仍缺议会噪声与医疗对话这类真实领域。本文的增量是统一聚合旧集并新增两类数据,同时把单模态与多模态放在同一提示与归一化下对比,且区分新旧数据以检验污染。同输入同目标的对照是同为非洲语言转写与到英语翻译,同监督是都有参考文本,同运行阶段都是预训练开箱即用加 1 次微调验证,不把类别差异直接当胜负。
为什么宣称支持非洲语言,实际仍可能不可用?
问题在于支持名单与可用质量脱节。一个模型文档写支持某语言,可能只是能生成该语言文本或做过少量训练,不代表能听懂带口音的自发语音。举例说,学习者可以把支持理解为能上课点名,可用理解为能在嘈杂走廊听清每个名字并拼对,二者标准不同。论文用例子说明风险,多模态模型常把转写做成概括,把议会发言的立法拨款内容改写为讨论立法大意,这在留档场景是错误的。
另一个例子是模型在静音或噪声段填充无关重复,或把约鲁巴语音频直接用英语或法语回答无法识别说话人,这属于幻觉与语言错配。教学例子仅用于帮助理解失败形态,不附加论文之外的数值。真正的判断必须回到受控评测,看同一音频、同一指标下不同模型的逐字错误与语义保真,并看新采集的议会与医疗数据是否比旧集更难,以排除训练时见过旧集带来的虚高。
AfriVox 基准的全景:数据、模型、任务如何组织?
AfriVox 分两大子集。非洲口音英语子集汇总南非语料、AfriSpeech-200、过滤后的 Common Voice 非洲口音部分与新整理的议会实录,总量 60 小时以上,2000 多名说话人,来自 12 个国家,108 种非洲英语口音。议会实录来自加纳、肯尼亚、尼日利亚与南非的公开程序,由母语者转写,质检沿用公共语音的方式,抽查每位贡献者一到两成音频文本对,语言不匹配、内容错误或不可懂即拒收,只有验证准确率超 80% 的贡献者被保留。
多语言子集汇总南非语料、Common Voice 非洲语言部分、FLEURS、OpenSLR、BibleTTS、金融包容语音集、NaijaVoices 与新建的医疗集,覆盖 20 个语言、3000 多名说话人、81.5 小时音频。新建医疗集的做法是,从公开的英文医患对话文本抽取 4 万多句,由双语母语者译成本地语言并朗读,形成英语文本、本地文本、本地语音三平行,既可测转写也可测翻译。所有音频统一为单声道 16 kHz 波形。模型侧对比单模态识别、单模态翻译与多模态大模型,任务只有两项,转写是音频到本族语文本,翻译是本地语音到英语文本。
提示统一为零样本与少样本,输出做标点大小写与变音符号归一化,结果为单次运行。
朗读语音 × 自发议会语音: 朗读语音是照稿念出的干净语音,分工是提供可控基准;自发议会语音是带环境噪声重叠与口音的真实发言,分工是暴露泛化缺口。二者搭配的原因是旧公开集可能已被预训练见过,组合意义在于用新旧对照分离记忆与真正鲁棒性。
组件如何分工:从一段音频到转写与翻译经历了什么?
沿一个样本走完全程有助于固定概念。假设输入是一段豪萨语医疗语音,采样 16 kHz 单声道。首先语音编码器把波形变为声学表示,单模态模型直接解码为豪萨语文本或英语译文,多模态模型则把声学表示与文本提示一起送入大语言模型,再生成转写或译文。转写分支要求与参考文本逐词对齐,删除插入替换都计错;翻译分支允许换词但要求保义,因此同时看字面分数与语义分数。
提示设计有 3 种,转写用直接转写、带语言名的转写与带两个音频转写示例的少样本,翻译用直接译到英语、先转写再翻译与各自的少样本变体,论文报告先转写再翻译的零样本效果最好,理由是让模型先稳定听清再组织译文。语言支持的判定来自文档、先前工作或人工用本地语言聊天验证,覆盖语言定义并不统一,这是后文解读支持名单时必须记住的条件差异。
自动语音识别 × 自动语音翻译: 自动语音识别负责把本族语语音逐字转写为本族语文本,强调逐字对应;自动语音翻译负责把本族语语音直接转成英语文本,允许语义等价而不要求逐字对应。二者搭配的原因是同一段非洲语言音频在部署中可能既要留档又要跨语言理解,组合意义在于论文能分开判断模型是听不清还是听懂但译不准。
单模态模型 × 多模态语音大模型: 单模态模型只做语音到文本的转写或翻译,分工是声学建模加解码;多模态语音大模型同时处理语音与文本生成,分工是语音编码后接大语言模型做理解与生成。搭配比较的原因是部署者要在准确逐字记录与更广语言覆盖之间选择,组合意义在于揭示转写与翻译的最优路线并不相同。
有没有训练?微调了什么,冻结了什么,监督从哪里来?
基准对比部分没有训练,所有模型均为预训练开箱即用,这是理解污染对照的前提。唯一的训练是针对 Qwen2.5-Omni 的参数高效微调验证,目的是证明中等规模本地数据能否让原本不支持的语言可用。对象是 10B 级多模态多语言大模型,选择理由是开源、多语言且相对较小,受限于算力。数据是 NaijaVoices,1800 小时、5000 多名说话人、性别年龄均衡,覆盖豪萨语、伊博语、约鲁巴语,实际微调每语言约 280 小时。实现是 LoRA 秩 8、缩放 32,作用于全部线性层,冻结视觉编码器,训练 3 轮,学习率 1e-4,预热比 0.05,半精度 bfloat16,批量 256,在 4 张 NVIDIA 3090 上完成。
监督来源是 NaijaVoices 的音频转写对与附带的翻译对,提示格式见附录。原文未报告梯度是否经过语音编码器全路径、是否重置优化器状态、是否做超参搜索,缺项即缺项,不从模型名推定。微调前后在同一 NaijaVoices 子集上测转写词错率与翻译语义分,构成可比的训练部署闭环。
参数高效微调 × 语言适配器: 参数高效微调用少量可训练参数调整大模型,分工是低成本获得新语言能力;语言适配器是为特定语言附加的小模块,分工是隔离语言知识。搭配原因是全量训练 10B 级语音大模型成本过高,组合意义在于论文只动线性层低秩部分就让原本不支持的三门语言可用。
实验条件:数据划分、指标方向、人工核验如何保证可比?
评测按问题组织。测转写时比较单模态与多模态在同一多语言集上的词错率,越低越好;测翻译时比较到英语的 BLEU、字符级分数与 AfriCOMET-STL,越高越好。条件一致性靠统一提示与统一文本归一化实现,但语言覆盖本身不一致,表中横线表示该模型不支持该语言,不能把缺测当零分。聚合对象是按语言平均还是按数据集子集分别报告,论文同时给出总体表与按 FLEURS、Common Voice、NCHLT、NaijaVoices 等子集的细分表,阅读时必须核对数据集、模型、阶段、指标与单位,数值相同不代表同一指标。
污染控制靠新旧对照,旧指南非语料与 Common Voice,新指 AfriSpeech-200 与议会实录,若新集系统性更难则提示旧集可能被见过。人工核验抽 50 条每语言的翻译打流利度与充分性,计算与自动指标的皮尔逊相关,假设中等以上正相关才认为自动语义分可靠。硬件预算只在微调部分交代,基准部分未报告推理延迟与成本,因此不能承诺切换路线能省钱或更快。
词错率 × AfriCOMET-STL: 词错率统计转写中替换删除插入相对参考文本的比例,越低越好,分工是衡量逐字 fidelity;AfriCOMET-STL 是面向非洲语言的语义翻译质量估计,分工是衡量译文是否保义。搭配原因是逐字错得多不一定语义全丢,组合意义在于论文同时用二者区分能用与好用的边界。
数据规模与微调成本如何复核?
本节用可运行的配置收敛复现条件。数据侧需核对医疗与非医疗时长、说话人数与样本数,不能只记总小时。微调侧需保留每语言约 280 小时、LoRA 秩与缩放、冻结视觉编码器、3 轮、学习率与预热、半精度与批量,以及 4 张 3090 的预算表达统一用阿拉伯数字。指标侧转写看词错率下降,翻译看语义分上升,且要区分相对百分比与百分点。
下表先看语言与领域分布,提出的问题是医疗数据是否足以支撑领域选型,公平条件是同为 16 kHz 单声道与母语者质检。
| (hrs) | Non-medical (hrs) | Total (hrs) Num |
|---|---|---|
| 2.27 | 4.05 | |
| 0.58 | 1.24 | |
| 0.26 | 0.62 | |
| 1.13 | 2.60 | |
| 0.21 | 0.51 |
表后解释是各语言医疗与非医疗时长不均衡,豪萨语斯瓦希里语祖鲁语较多,加语极少,小样本语言的结论不确定性更大,代价是不能把大语言的增益直接推广到极低资源语言。
下表看人工与自动指标的相关,问题是语义分是否可信,方向是相关越高越可信。
| Akan – – – – – | 2.44 | 5.15 |
|---|---|---|
| Ga – – – – – | 0.49 | 1.06 |
| Kinyarwanda – – – – – | 1.99 | 10.91 |
| Pedi – – – – – | 3.19 | 6.34 |
| Sesotho – – – – – | 4.11 | 11.23 |
表后解释是语义分在充分性上平均相关高于字面分,在流利度上各指标都弱,说明用语义分选翻译模型比用 BLEU 更稳,但不能把自动分当成人评。未胜出项是部分语言流利度相关接近零甚至为负,须保留人工抽查。
下表汇总基准与微调的规模与算力,均为原文连续句可重放的条件,不混入推测。
| 对比维度 | 规模指标 | 非洲口音英语子集 | 多语言子集 | 微调配置 |
|---|---|---|---|---|
| 数据量 | 总时长与说话人 | over 63 hours, 2,000+ speakers | 81.5 hours, 3,000+ speakers | approximately 280 hours of speech per language |
| 覆盖 | 语言口音与数据集 | from 12 countries, 108 distinct African English accents | 20 languages across 8 datasets | spanning 3 Nigerian languages |
| 计算 | 硬件与训练步 | 单次运行基准 | 单次运行基准 | four NVIDIA 3090 GPUs, three epochs, learning rate of 1e-4, warmup ratio of 0.05, batch size of 256, LoRA rank 8 alpha 32, bfloat16 precision, freezing the vision encoder |
表后解释是基准规模决定了结论的适用边界,微调成本决定了本地团队的可行性,收益是中等数据即可尝试,代价是 4 张 3090 与数百小时标注仍是门槛,极低资源场景待验证。表格数字与单位来自原文连续句,裸值不擅自加百分号,时长单位保留小时表述。
主结果:转写是谁更准,翻译是谁更强,新旧数据差多少?
先看比较问题与公平条件。转写比较的是同一非洲语言音频下谁的逐字错误更低,翻译比较的是同一音频到英语谁的语义保留更好,公平条件是统一提示与归一化,但支持语言不同导致可比条目不同,指标方向是词错率向下、翻译分向上。总体趋势是转写多为单模态占优,翻译多为多模态占优。论文报告非洲口音英语上最优单模态的词错率相对 LibriSpeech 干净集上升 10 到 15 倍,非洲语言上多语言词错率常超 50%,部分语言超 100%,意味着接近不可懂,即使名单写支持。
Gemini 在多模态中明显好于 GPT-4o,有时好 2 到 4 倍,Seamless 在南部与东部非洲语言较强,Sahara v2 与 Omni-ASR 在多语言转写上居前。翻译侧 Gemini 与 Seamless 明显高于单模态基线,尤其在长上下文上语义更完整。旧集成绩普遍好于新集,议会噪声下所有模型退化 7% 到 70%,MMS 退化最剧烈,提示对干净朗读过依赖。法语口音同样退化约 1 倍,说明问题不限于英语。
下面柱状图按语言展示 3 个最优模型的转写词错率,柱子越低越好,同一语言内可比,跨语言比较需注意各语言数据难度不同。
看图路径: 1. 先看横轴语言与三色图例对应的三个模型,再纵向比较同一语言下三根柱子的高低;2. 找出黄色柱子最低而红色柱子异常拔高的语言,判断单模态与多模态的优势区间;3. 观察斯瓦希里语附近的低柱群与塞索托语等高柱群,确认语言间差异远大于模型间差异

论文图 1。原论文 Figure 1:“WER for Best Performing Models on Multilingual African Speech Dataset”。
图中可见黄色单模态在多数语言柱子最低,红色多模态在塞索托语、绍纳语、契维语等出现异常高柱,在阿拉伯语、法语、斯瓦希里语则相对较低,蓝色居中波动。教学价值在于不要只看平均,要按语言选模型,名单支持不能代替分语言实测。未胜出项同样重要,例如 GPT 音频模型在非洲口音英语旧集上显著落后,多模态在逐字任务上普遍不如单模态,这些反例限定了大模型万能的说法。
| Akan – – – | 62.90 | 103.97 | 76.53 | 46.71 | 55.18 |
|---|---|---|---|---|---|
| Kinyarwanda – – – | 46.65 | 134.26 | 65.19 | 36.11 | 11.37 |
| Pedi – – – | 46.67 | 124.27 | 76.72 | 40.82 | 23.59 |
| Twi – – – | 50.55 | 102.58 | 80.66 | 39.83 | 12.46 |
| Xhosa – – – | 43.62 | 122.86 | 46.54 | 30.51 | 34.39 |
上表是 FLEURS 子集上每语言每模型的转写词错率,越低越好,加粗为每语言最优,横线为不支持。表后解释是单模态在该干净朗读子集仍占优,但最优者随语言变化,且部分语言所有模型都很高,说明干净不等于简单。代价是该子集不能代表议会噪声,须结合下表看真实分布。
| Language medium | large-v3 all Large | audio-preview | flash | flash | V2* |
|---|---|---|---|---|---|
| Pedi – – | 42.03 | 119.29 | 90.75 | 48.87 | 19.82 |
| Xhosa – – | 31.93 | 171.43 | 56.70 | 37.52 | 15.27 |
上表是 Common Voice 子集的同口径转写对照,条件与上表同为转写词错率,但说话人与录制条件不同。表后解释是同一模型换子集排名会变,例如某些模型在该子集退化明显,支持按子集分别选型而非只看总体平均。未评测边界是对话与问答等多模态能力不在本次主结果内。
微调带来多大可部署收益,有没有超过已有最优?
本节只讲三门尼日利亚语言的可运行策略,不把事后最优当部署收益。基线是微调前 Qwen2.5-Omni 在该三语言上不支持或极高错误,对照是同子集上的 MMS 与 Gemini 等已有最优。论文报告微调后词错率相对下降最高达 54%,翻译语义分翻倍以上,在伊博语上超过已有最优,这是核心的可部署证据。限制是数据为同域中等规模,换域与极低资源语言是否成立未测。教学例子是把微调理解为给模型补三门语言的听写课,补课后能听写但不代表能处理议会噪声,效果需分条件复测。重提结果时新增的对照是翻译增益与转写增益并不同步,选型时要按任务分别验收。
失败条件:释义、幻觉与语言错配长什么样?
本节承担的教学任务是把错误变成可复述的检查动作。论文把转写错误分为释义、振荡幻觉、词替换与语言错配,翻译错误分为同义替换与关键信息丢失。释义指模型用自己的话概括而非逐字记录,在议会长句中最典型。振荡指同一短语无意义重复,常出现在背景噪声与静音段。词替换是听错实词,语言错配是用错误语言回答或拒绝。翻译侧即使字面分不低,语义分也可能揭示充分性不足,因此论文强调语义分与人工充分性的相关更高。
先看释义的例子,导读是比较参考文本的立法拨款细节与模型输出的概括句,判断是否丢失了郡与病房等关键实体。
看图路径: 1. 对照参考文本与模型输出的第一句,确认是否逐字转写还是改写大意;2. 注意模型输出中表示讨论与分歧的概括性措辞,标记为释义而非逐字证据

论文图 4。原论文 Figure 4:“Examples of paraphrasing and audio descrip- tion.”。
上图显示模型把具体立法动作改写为讨论立法大意,保留了主题但丢失了逐字可执行信息,解释是法律医疗留档不能接受此类输出,选型时必须用词错率而非翻译分考核转写。
再看振荡与错配的例子,导读是先数第一例的重复次数,再看第二例的实词差异,最后看第三例的回答语言是否与输入一致。
看图路径: 1. 看第一个例子中同一短语的连续重复,判断为背景噪声下的振荡幻觉;2. 看第二个例子的词替换与第三个例子的整段法语拒绝回答,区分听错与语言错配

论文图 2。原论文 Figure 2:“Examples of oscillations, hallucination, word substitutions, and language mismatch in ASR outputs from unimodal and multimodal models.”。
上图第一个例子把斯瓦希里语句重复为大量同一短语,第二个例子把豪萨语数量与地点听错,第 3 个例子把约鲁巴语音频用法语拒绝回答,解释是单模态更易振荡,多模态更易给出看似有帮助但与音频无关的补全,二者都需要人工抽查而非只看平均分。
哪些边界没有测,读数时如何避免过度推广?
先看翻译改写含义的例子,导读是核对参考译文的因果与专名是否被保留,再判断语义分能否捕捉这种错误。
看图路径: 1. 比较参考译文与模型译文的名词与因果关系,定位被改写的关键含义;2. 观察第二个例子中日期与行动名称是否保留,判断专名与事件是否被改写

论文图 3。原论文 Figure 3:“Examples of altered meaning AST outputs from unimodal and multimodal models.”。
上图第一个例子把布料过热导致缩水或焦糊改写为过厚导致瘙痒或烧伤,第二个例子把盟军行动史实改写为国王命名,解释是字面流畅但事实改变,说明需要充分性人工抽查,自动分高不等于可用。论文自述局限包括 2000 多种非洲语言大多未覆盖、旧集可能污染、只测转写与到英语翻译、提示搜索不穷尽、微调仅三语言中等数据、噪声与码切换多说话人未穷尽。相关性不等于因果,名单支持不等于质量保证,总体趋势不等于每语言成立。未测量延迟与成本时不承诺更快更省,训练资源与推理开销分开讨论。
复现先做什么,需要保留哪些超参数与信息条件?
复现分 4 步。第一步按论文聚合旧集与新集,复刻 16 kHz 单声道、母语者 80% 质检线与标点大小写变音归一化,保留议会四国与医疗三平行的划分。第二步用统一零样本与少样本提示跑开箱模型,单次运行,先复刻转写词错率,再复刻翻译三分数,核对语言不支持的横线位置。第三步做新旧对照,若旧集好新集差则优先怀疑污染而非模型退步。第 4 步在 NaijaVoices 上复刻 LoRA 秩 8 缩放 32、全线性层、冻结视觉编码器、3 轮、学习率 1e-4、预热 0.05、bfloat16、批量 256 的微调,验收三语言的转写与语义分。
代码与新数据按原文称将开源,权重下载与系统可运行是两回事,需分别确认。还需补的验证是跨域测试、码切换、多说话人与延迟成本测量,缺项即为后续工作。
何时值得尝试,首选哪条路线?
综合判断是分任务选型。需逐字留档的法律医疗记录,优先在目标语言上有实测最优的单模态识别模型,不因多模态覆盖广而切换。对话理解与到英语翻译,优先语义分最高的近期多模态模型,但必须抽查充分性与专名。非洲口音英语与法语口音部署前必须用议会类噪声自测,不能用干净旧集成绩外推。
若目标是豪萨语伊博语约鲁巴语且有数百小时本域数据,复刻 Qwen2.5-Omni 的参数高效微调是值得尝试的路径,预期转写错误大幅下降且翻译语义明显改善,但需接受小样本语言与跨域的不确定性。最终收束是 AfriVox 的价值不在于给出唯一冠军,而在于给出分语言分条件可复述的成绩单与失败清单,让本地团队能按自己的领域与算力做可核对的选择。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses