英文题目:Fleurs-Badini: Translation and Recording Fleurs Dataset for Badini Variant of Northern Kurdish

会议身份:conference:iwslt:2026:conference-paper-id:2026.iwslt-1.14

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #低资源 #语音识别 #语音翻译

评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Mohammad Mohammadamini:机构信息未能从会议 PDF 纯文本可靠映射
  • Dilgash Mohammed Salih Tayib:机构信息未能从会议 PDF 纯文本可靠映射
  • Dezheen H. Abdulazeez:机构信息未能从会议 PDF 纯文本可靠映射
  • Barzan Hussein Mohammed:机构信息未能从会议 PDF 纯文本可靠映射
  • Imad Saeed Sadeeq:机构信息未能从会议 PDF 纯文本可靠映射
  • Aveen Jalal Mohammed:机构信息未能从会议 PDF 纯文本可靠映射
  • Amera Ismail Melhum:机构信息未能从会议 PDF 纯文本可靠映射
  • Abuobaida Abdullah Dheyab:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

巴迪尼语语音识别与语音翻译任务以巴迪尼语语音为输入,以同语转写或英语文本为输出,实际难点在于平行语音文本稀缺且发音词汇与书写偏离标准北库尔德语,常用改良阿拉伯字符进一步加剧建模困难。方法链首先由杜霍克大学50名英语与翻译专业母语学生将2000条Flores英语句直接译为巴迪尼语,经教师两阶段审校输出平行文本,该文本直接进入下一步充当朗读脚本。接着母语者经网页平台在安静环境下朗读录音并保留麦克风与口音等自然变异,随后人工逐条核对语音文本一致性并剔除1078条错配样本,形成对齐语料。最终语料共5224条约15小时40分钟,含45名说话人且训练开发测试说话人不重叠,可同时支撑识别与翻译双任务评测。相对已有库尔德语资源,该工作首次覆盖巴迪尼变体并坚持从英语直接翻译以保持与FLEURS多语平行,其实际意义在于提供可比基准与双任务基线。在FLEURS-Badini测试集条件下,W2V-BERT CTC的WER为55.07,低于Omnilingual LLM 1B的WER 60.20。该结论适用边界受限于朗读式短句与相对可控录音,尚未验证自发对话与强噪声跨域外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要补哪块数据?

本文的输入是论文原文证据与本次是否收到图像素的说明,目标是为刚进入语音音乐音频领域的研究生写 1 篇可核对、能复述方法的技术解读。必须保留的信息包括数据来源句数、说话人数、话语条数与时长、划分方式、验证剔除数、基线模型名与主结果数字、指标方向与实验条件。输出是 1 篇按学习依赖展开的中文解读,不做营销式判断,不补充证据之外的事实。

语音技术近年的进步高度依赖大规模多语言数据,自动语音识别要把声音转写成文字,英文名为 Automatic Speech Recognition,缩写为 ASR,语音到文本翻译要把一种语言的声音译成另一种语言的文字,英文名为 Speech-to-Text Translation,缩写为 S2TT。通用多语言语音基准 FLEURS 把文本翻译基准 FLORES 扩展到语音域,提供跨语言平行的语音文本对,支持 ASR、S2TT 与语音到语音翻译的可比评价。但覆盖不均,库尔德语内部差异大,中央库尔德语已有较多工作,北部库尔德语 Badini 变体此前缺同时提供准确译文与对齐录音的资源。

FLEURS × FLORES: FLORES 的分工是提供多语言平行的文本翻译句对,FLEURS 的分工是把这类文本扩展为多语言平行的语音录音,搭配理由是文本平行保证跨语言可比,语音平行保证跨语言声学任务可比,组合意义在于让 Badini 可以沿用原有英语句表接入已有多语言评价体系。

本文要补的就是这一块:构造 FLEURS-Badini,一个面向 Badini 的方言扩展。按原文报告,起点是从 Flores 取 2000 个英语句子,译成 Badini 文本,再组织母语者录音并做人工验证,最终得到 5224 条话语配对文本,总时长 15 小时 40 分钟,来自 45 名说话人。论文同时用当前模型做 ASR 与 S2TT 基线,报告识别仍困难、翻译分数有限。关于获取方式,原文正文提及许可与地址写法,但本次收到的资源状态为未发现完成验证的绑定资源,因此本文不声称数据当前已公开可下载,复现前需自行核对原文链接可达性。

已有路线做到哪里,Badini 为什么仍是空白?

先看同输入同目标的路线。众包录音转写路线以 Common Voice 为代表,通过志愿者录音与转写积累多语言语音,优点是规模扩张快,缺点是文本平行性弱,难以直接做跨语言翻译评价。FLEURS 路线以翻译句对齐录音为核心,从 FLORES 文本出发组织多语言录音,优点是 n 路平行、任务覆盖 ASR 与翻译,缺点是需要逐语言组织翻译录音验证,低资源方言进入门槛高。

再看库尔德语内部。同监督同阶段的工作多集中在中央库尔德语,例如 Asosoft 数据集提供大词汇量识别系统、语音语料与发音词典,FLEURS 本体包含中央库尔德语,Kuvost 把 Common Voice 英语扩展为中央库尔德语英语语音翻译数据。北部库尔德语方向近期有 FLEURS-Kobani 代表北部库尔德语进入 FLEURS,但原文指出 Badini 仍缺席。按原文判断,这是首个面向该变体的语音翻译资源工作。

类别差异不能当同条件胜负。中央库尔德语的经验不能直接搬到 Badini,因为 Badini 虽属北部库尔德语,却常用改良阿拉伯文字书写,而标准北部库尔德语常用拉丁文字,语音词汇句法与拼写均有区别。用其他方言训练的模型在发音词汇与文字映射上都会打折,拉丁与阿拉伯文字之间的转写还可能丢失语音信息。这解释了为什么需要单独建 Badini 平行语料,而不是复用现有库尔德语数据。

Badini 的难点具体卡在语言的哪几处?

第一个卡点是翻译不对等。许多英语术语在医学、技术、政治等专门领域没有直接的 Badini 对应词,译者需要用解释、借词、音译等策略保留含义。缩写与首字母缩略词也要按熟悉程度分别处理,有的保留原形,有的音译,有的展开为库尔德语解释。例子是教学用例子:若遇到不熟悉的机构缩写,保留原形可保可检索性,展开解释可保可读性,但原文未给出每类各占多少,本文不编造比例。

第二个卡点是结构重组。英语典型语序为主语动词宾语,库尔德语常为主语宾语动词,直译会生硬或歧义,需要调整语序并保持指代连贯。代词与上下文指代在两种语言中用法不同,跨句一致性需要人工斟酌。原文把总体策略概括为直译与适应性翻译结合,在忠实原文与目标语清晰之间平衡。

第三个卡点是语音与文字错位。Badini 口语形式与阿拉伯基书写形式之间存在差异,同一发音可能有不同拼写习惯,转写不一致会直接推高识别错误。录音侧还有设备、背景噪声、说话风格差异。数据集希望保留一定的真实条件 variability,而不是只收录音室干净语音,这对评价鲁棒性是好事,但也意味着基线数字会比干净集低,读结果时不能只看绝对值。

全景:一个样本如何从英语句子走到可训练语音对?

沿一个样本走完全程有助于建立全景。输入是一个英语句子,来自 Flores 的 2000 句集合。第一步由杜霍克大学英语与翻译系学生译成 Badini 文本,分 2 阶段完成,再由教师审校,译者与审校均为母语者,且直接从英语翻译而非从已有库尔德语版本转译,以保持与原 FLEURS 方法一致并便于做 Badini 到英语的语音翻译。第二步由 Badini 母语者在基于网页的平台上朗读译文录音,要求在安静环境清晰朗读,允许使用个人设备,保留麦克风与噪声差异。第三步人工核对每条录音与文本是否一致,剔除不可懂、强噪声、说不全、内容不匹配的样本,共剔除 1078 条。输出是一条音频加一条 Badini 转写翻译文本的对齐对,可同时用于 ASR 与 S2TT。

自动语音识别 × 语音到文本翻译: 自动语音识别的分工是把 Badini 语音转写为同语言文本,语音到文本翻译的分工是把 Badini 语音直接转为英语文本,二者搭配的理由是共用同一批平行语音文本对,前者检验声学与正字法建模,后者检验跨语言语义保持,组合意义在于用一套录音同时支撑 2 个任务的基准评价。

从任务视角看,ASR 的监督来源是录音到 Badini 文本的对齐,S2TT 的监督来源是录音到英语文本的对应关系,后者依赖最初英语到 Badini 翻译的可逆平行性。原文未给出逐句的录音时长分布与文本长度分布,也未报告录音采样率与文件格式等声学参数缺项,复现录音环节时需把这些记为待补验证项,不从平台名称推定实现。

翻译组件做了什么动作,谁来保证语言准确?

翻译组件的动作链是明确分工的。50 名学生承担初译,覆盖 2000 个英语句子,分 2 阶段进行,所有输出再由教师复核语言准确性与一致性。参与者均为母语者,这是原文明确的质量条件。直接从英语翻译的选择是有安排理由的:避免经由其他库尔德语版本引入 2 次偏差,并与原 FLEURS 数据创建方法保持一致。

操作细节上,译者面对 3 类问题有 3 类动作。无直接对应词时用解释、借用、音译保留含义,结构差异时重组语序保持清晰自然,缩写时按熟悉度保留原形、音译或展开。跨句代词与指代需要结合上下文调整。这些动作没有自动化公式,是人工规范动作,初学者复述时应说清谁做、做几遍、谁复核,而不是只说做了翻译。

该组件的局限也要说清。原文未报告译者间一致性分数、审校修改率、终稿与初稿差异统计,也未给出每种翻译策略的实例数量。教学例子明确标为例子:例如把技术术语音译后加括号解释,这只是说明策略形态,不代表本文数据采用该比例。因此翻译质量的证据目前是流程性保证加母语者审校,而非定量一致性指标。

录音与验证组件如何取舍真实性与干净度?

录音组件的动作是组织 Badini 母语者在相对受控条件下朗读已译句子。指令要求在安静环境清晰录制,使用个人设备经网页平台提交。同时保留自然 variability,包括麦克风差异、背景噪声、说话风格差异,目的是更接近真实场景。这种取舍意味着数据不是录音室纯净集,模型需要面对信道与环境变化。

验证组件的动作是逐条人工检查文本对齐与音频清晰度。检查标准是口语内容是否准确对应文本,凡不可懂、强背景噪声、语音不完整、内容不匹配均剔除。原文报告共剔除 1078 条录音。这是一个重要数字,说明原始采集量大于最终 5224 条,质量过滤比例不低。初学者应注意,剔除动作改变了数据分布,过于困难或 noisy 的样本被系统性去掉,留下的基线仍困难,说明任务本身难度高。

未报告的缺项包括验证者人数与分工、是否双人独立标注、麦克风型号分布、环境噪声等级、重录机制。原文只说全部录音被人工复核,未给出复核者一致性。因此不能把验证等同于确定性求解,也不能推定所有边界样本判断一致。复现时应先补双人抽检与分歧记录,再谈质量分数。

没有大模型预训练,本研究的计算过程是什么?

本节先明确训练含义。本研究没有报告从零预训练声学大模型的过程,其方法职责由数据构造流程与基线调用微调承担。数据构造的计算过程是翻译加录音加人工过滤,输出是划分好的平行语料。模型侧的计算过程是调用已有模型做零样本评价,以及在训练划分上微调 Whisper 做对照。

数据划分的动作是按说话人不重叠切分。训练集 2022 条,开发集 1165 条,测试集 2037 条,总计 5224 条,总时长 15 小时 40 分钟,来自 45 人,训练开发测试说话人数分别为 16、14、15,且说话人在划分间互不重叠。这保证了评价测的是对新说话人的泛化,而非记住特定音色。

模型微调的动作按原文交代如下。S2TT 用 Whisper V3 Large,在 FLEURS-Badini 训练划分上微调。ASR 对比多个模型,包括 Whisper Large V3、W2V-BERT CTC、Omnilingual LLM 的 1B 与 3B 版本,其中 W2V-BERT CTC 与 Whisper V3 Large 按引用的前期工作是在转写为阿拉伯文的北部库尔德语 Common Voice 加合成数据上训练的版本。另有一组基线 Whisper 在训练划分上微调 5 个轮次,因数据小在第二轮后收敛。原文未报告优化器、学习率、批量大小、冻结层数、梯度路径与早停阈值等关键超参数,这些是复现微调必须补的缺项,不从模型名称推定实现。

测什么、与谁比、指标方向如何定?

实验按两个问题组织。第一个问题是 Badini 语音能否被准确转写,测 ASR,对比 Omnilingual LLM 1B、Omnilingual LLM 3B、W2V-BERT CTC、Whisper Large V3 与微调后的基线 Whisper。第二个问题是 Badini 语音能否被译成英语文本,测 S2TT,用微调后的 Whisper V3 Large 报告开发集与测试集分数。比较条件是否一致方面,原文明确说话人划分不重叠,但未明确各模型解码参数、语言标识设置、文本归一化是否统一,这是读表时必须保留的公平性问号。

字错误率 × 词错误率: 字错误率的分工是按字符统计插入删除替换错误,词错误率的分工是按词统计同样 3 类错误,搭配理由是 Badini 用阿拉伯基文字书写且形态变化多,单看词级会放大粘连与拼写差异,组合意义在于同时报告字符级与词级才能区分是小范围拼写偏差还是整词听错。

BLEU × chrF++: BLEU 的分工是按词 n 元组精确率衡量译文与参考译文的重合,chrF++ 的分工是同时用字符与词 n 元组衡量重合,搭配理由是低资源翻译输出常词序对但字符片段对,组合意义在于避免只用词级指标低估部分正确的翻译。

指标方向需要先讲清。字符错误率与词错误率都是越低越好,分别记为 CER 与 WER,前者对拼写小差敏感,后者对整词错误敏感。BLEU 与 chrF++ 都是越高越好,前者重词级重合,后者兼顾字符级,对低资源翻译更宽容。聚合对象按原文是开发集与测试集分别报告,未报告置信区间与显著性检验,也未报告推理延迟与计算成本,因此不能从准确率趋势推定部署开销改善。硬件预算在证据中未出现,复现需另行记录。

识别结果:谁最好,好多少,代价是什么?

比较问题是 5 个 ASR 策略在相同开发测试划分上谁的转写错误最低,公平条件是说话人不重叠的固定划分,指标方向是 CER 与 WER 越低越好。下表整理原文报告的全部 5 个可运行策略,不删除不利基线,不混入不同任务分数。

模型条件开发集字符错误率开发集词错误率测试集字符错误率测试集词错误率
Omnilingual LLM 1B14.8160.0614.7560.20
Omnilingual LLM 3B20.9763.9722.3464.47
W2V-BERT CTC13.6954.4614.1155.07
Whisper Large V315.7160.1316.5062.02
微调基线 Whisper39.3370.8739.0572.16

表后解释需要同时说收益与代价。主要收益是 W2V-BERT CTC 最好,开发集字符错误率 13.69、词错误率 54.46,测试集字符错误率 14.11、词错误率 55.07。代价是绝对值仍高,测试集词错误率 55.07 说明 Badini 识别仍困难。未胜出项也要点名:更大的 Omnilingual 3B 反而比 1B 差,测试集词错误率(%) 64.47 高于 1B 的 60.20,直接反驳参数越大越好的直觉。原文给出的有限解释是语言标识错误与北部库尔德语内部方言差异,部分输出未用阿拉伯文转写 Badini。

在训练划分上微调 5 个轮次的基线 Whisper 最差,开发集词错误率 70.87,测试集 72.16,支持小数据直接微调不足以解决问题的判断。本文只转述原文报告的错误率数值,不换算相对提升。

W2V-BERT CTC × Whisper Large V3: W2V-BERT CTC 的分工是基于自监督语音表示加联结时序分类做转写,Whisper Large V3 的分工是基于大规模弱监督编码器解码器做识别与翻译,搭配理由是前者在本文沿用了转写为阿拉伯文的北部库尔德语数据加合成数据训练,后者是通用多语言大模型,组合意义在于对比专用声学路线与通用大模型路线在 Badini 上的差距。

翻译结果:语音到英语能得多少分?

比较问题是微调后的 Whisper V3 Large 在开发集与测试集上的翻译保持度,公平条件是同一微调模型在固定划分上评价,指标方向是 BLEU 与 chrF++ 越高越好。下表只放该可运行策略的实际分数,不加入识别指标混放。

评价集合BLEUchrF++
开发集6.1329.39
测试集5.2429.57

表后解释要区分两个指标的不同故事。BLEU 从开发集 6.13 降到测试集 5.24,绝对值低,说明词级完全匹配很少。chrF++ 在两集分别为 29.39 与 29.57,基本持平且远高于 BLEU 量级,支持部分字符片段命中的解释,即输出可能抓住词根词缀但整词与语序仍错。原文的判断是分数有限但可作未来基线,并强调需要扩大数据规模,这属于有限解释而非因果证明。未评测边界包括未报告其他翻译模型对照、未报告人工评价,因此不能把自动指标当成人评,也不能把末步分数推广为全程稳定。

反证与失败条件:哪些对照说明难在哪里?

本节把论文中的失败条件当作反证来读。第一个反证是大模型未胜出。Omnilingual 1B 与 3B 在两集词错误率均在 60% 以上,3B 更差,说明在 Badini 上增加参数未带来收益。原文观察到语言标识错误,一些输出未用阿拉伯文转写 Badini,这是可操作的检查点:复现时应先看输出文字系,再看错误率,避免把文字系错误误读为声学错误。

第二个反证是小数据微调 Whisper 反而最差。字符错误率在两集约 39%,词错误率超 70%,远高于未微调的 Whisper Large V3 与 W2V-BERT CTC。这支持数据量与方言失配是主瓶颈的解释,但原文未做消融区分是数据量、学习率、训练轮次还是正字法归一化导致,因此不能说拿掉某组件必然怎样,只能说当前微调配置下未改善。

第三个对照是跨任务一致性。识别最好成绩测试集词错误率 55.07%,翻译 BLEU 5.24,两者同时低,支持声学建模与跨语言映射都受限的判断。但相关性不是因果,未测量误判率分解、延迟或成本,不能承诺扩大数据一定同时改善延迟与成本。训练资源与推理开销在原文未报告,总体趋势不等于每组都成立。

边界与缺项:哪些结论不能超出证据?

先说数据边界。最终语料 5224 条、15 小时 40 分钟、45 人,在低资源方言中是有意义的起点,但相对大模型训练需求仍小。说话人 45 人且划分不重叠有助于测泛化,但未报告性别年龄口音分布、每人时长分布、文本领域分布,音乐与自发对话等场景也未覆盖,因此不能把朗读 Flores 句子的成绩推广到自发语音。

再说方法缺项。翻译一致性、审校修改率、录音设备分布、验证者一致性、音频采样与格式、微调超参数、解码与归一化条件、统计显著性、硬件预算均未在证据中出现。这些缺失不是技术错误,但复现前必须列为待补项。特别是原文表头与算术若有冲突应标注冲突,本文证据中划分数字加总一致,2022 加 1165 加 2037 等于 5224,时长分段 5 小时 47 分钟加 3 小时 36 分钟加 6 小时 17 分钟等于 15 小时 40 分钟,未发现冲突。

最后说推测边界。用可能待验证表达未验证部分:Badini 与标准北部库尔德语差异可能是错误主因,但原文未做按音系词汇分类的错误分析,因此只能说支持而非证明。用报告显示表达直接报告:W2V-BERT CTC 最好、翻译分数低、剔除 1078 条。用可能表达:扩大数据可能改善,但未测量下不能承诺误判率延迟成本同步改善。

复现先做什么,需要准备什么条件?

复现的数据准备动作是先核对文本与划分。起点是 2000 英语 Flores 句,终点是 5224 条音频文本对,含训练 2022 条 5 小时 47 分钟 16 人,开发 1165 条 3 小时 36 分钟 14 人,测试 2037 条 6 小时 17 分钟 15 人。动作包括检查说话人不重叠、核对总时长、记录剔除 1078 条的过滤标准。由于本次未验证资源可达,不预设数据已公开,复现前先确认原文链接与许可状态,再谈下载。

下表把划分条件整理为可执行核对表,数字与单位保留原文写法,时长用原文分段写法,不逐格追加百分号,不四舍五入。

分区条件话语条数时长说话人数说话人重叠
训练集2,0225h47m16与开发测试不重叠
开发集1,1653h36m14与训练测试不重叠
测试集2,0376h17m15与训练开发不重叠
合计5,22415 小时 40 分钟45划分间无重叠

表后是复现顺序建议,针对论文特有误解。先做文字系检查,确认输出是否为阿拉伯基 Badini 书写,再算 CER 与 WER,避免语言标识错误污染声学结论。再做可运行基线复跑,优先跑 W2V-BERT CTC 与 Whisper Large V3 的原文配置,再试小数据微调,并完整记录优化器、学习率、批量、冻结层、解码参数与文本归一化。还需补的验证是双人抽检翻译与录音一致性、按领域与说话人分解错误、报告置信区间。只有补齐这些,才能判断何时值得尝试该路线:当目标是 Badini 朗读句的基准对比时值得用,当目标是自发对话或跨方言部署时还需补数据与评测。

收束:这篇工作留下了什么,下一步看什么?

回到中心矛盾:多语言基准需要可比平行数据,而 Badini 缺同时提供准确译文与对齐录音的资源。本文的解法是用结构化翻译录音验证流程补上这块拼图,得到 5224 条、15 小时 40 分钟、45 人的平行语料,说话人划分不重叠,剔除 1078 条不合格录音。最强证据是 ASR 最好成绩测试集字符错误率 14.11、词错误率 55.07,S2TT 测试集 BLEU 5.24、chrF++ 29.57,主要代价是绝对性能仍低,小数据微调未解决问题。

对初学者的学习依赖是先分清任务与指标,再看数据构造,最后读结果。ASR 看字符与词错误率越低越好,翻译看 BLEU 与 chrF++ 越高越好,二者不可混放。数据构造的每一步都有明确动作与负责人,翻译由学生分阶段完成加教师审校,录音保留真实 variability,验证逐条剔除。实验条件的公平性要看划分、解码、归一化是否一致,原文只明确了说话人不重叠,其余记为缺项。

下一步值得看的是扩大规模、补错误分类、补人工评价、补超参数与成本报告。何时值得尝试该数据路线:当需要在 FLEURS 体系内评价 Badini 朗读句识别与翻译时,可沿用其划分与基线;当需要部署到噪声更大或口语化更强的场景时,应先补相应数据再下结论。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 iwslt-2026 论文汇总