英文题目:Hamsa: A Manually Annotated Emirati Arabic Corpus for Speech and Language Technologies

会议身份:conference:interspeech:2026:conference-paper-id:alyafeai26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据标注 #SFT #语音识别

评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Mohammed Alyafeai:机构信息未能从会议 PDF 纯文本可靠映射
  • Hamza Alobeidli:机构信息未能从会议 PDF 纯文本可靠映射
  • Omar Alkaabi:机构信息未能从会议 PDF 纯文本可靠映射
  • Shaikha Alsuwaidi:机构信息未能从会议 PDF 纯文本可靠映射
  • Leen AlQadi:机构信息未能从会议 PDF 纯文本可靠映射
  • Ahmed Alzubaidi:机构信息未能从会议 PDF 纯文本可靠映射
  • Maitha Alhammadi:机构信息未能从会议 PDF 纯文本可靠映射
  • Basma El Amel Boussaha:机构信息未能从会议 PDF 纯文本可靠映射
  • Hakim Hacid:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

阿联酋阿拉伯语自动语音识别面临输入为自然会话语音、输出为方言忠实转写文本的任务,难点在于与现代标准阿拉伯语的音系交替、特有否定词与阴性形态,以及背景噪声和七个酋长国之间的地区变体。作者构建Hamsa语料的链条分为三步:先从公开阿联酋在线内容抓取并过滤出清晰单语会话片段,保留4174个平均约1分3秒的原始样本并切分为短句,再由5名母语者按方言正字法指南逐句转写,随后由1名标注者对约5小时约45%数据做二次人工校对以统一拼写。相比侧重英阿语码转换播客的Mixat,该工作坚持单语会话覆盖与反MSA归一化,提供更干净的方言训练信号。在Hamsa测试集上微调的Whisper-large-v2将词错误率从42.25%降至24.46%,字符错误率从71.91%降至8.27%,并在外部Mixat测试集上同步改善,显示方言适配而非语料过拟合。该结论目前仅适用于短句主导的非重叠语音,对边界乡村变体、码转换和说话人独立泛化的外推尚未验证。原文未披露训练时长、推理与部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

阿联酋口语为什么难倒只学过标准语的模型?

输入是阿联酋日常对话录音,目标是输出与说话人口音一致的阿联酋方言文本。本解读的目标读者是刚进入语音与语言方向的研究生,需要保留的关键信息是语料规模与划分、标注规则、微调条件、评测基准与主结果数字,输出是 1 篇可以对照原文复述方法的中文讲解。

先把任务说清楚。阿拉伯语存在双层使用习惯,正式写作与新闻广播多用现代标准阿拉伯语,日常交流则用各地方言。白话讲,标准语像是全国统一的书面普通话,方言像是家里和市场上真正说的话。论文研究的阿联酋阿拉伯语是阿联酋主要口语,它与地理上接近的海湾方言仍有区别。原文举的例子包括字母ج常被读成类似ي的音,词形随之变化,词汇也有本地含义,例如表示斋月餐与早餐的词与标准语理解不同,而且 7 个酋长国之间还有细微差别。

这就带来学习依赖。自动语音识别如果主要在标准语上训练,遇到方言发音会系统性听错,机器翻译、字幕、大语言模型预训练和客服语音服务也会连带受影响。论文指出,已有大规模阿拉伯语语音资源多偏向标准语正式朗读,不能代表日常口语的多样性。因此本研究不是做一个通用识别器,而是先补一块明确缺失的数据:纯粹的、去掉英语混入的阿联酋单语会话语料,再验证它能否让现有模型真正适应方言。

需要提前说明可用性边界。原文没有给出经本次验证可达的代码、模型或数据链接,资源状态证据为 NONE,因此不能写数据已公开或可下载。原文关于发布的说法是正在与内容提供方落实再分发协议,公开发布将提供转写标注、元数据与采集脚本,供研究者自行取回原始音频,且限于非商业学术研究使用。这意味着复现时要按转写加自取音频的方式理解,不要默认能直接拿到打包音频。

已有阿拉伯语语音资源覆盖了什么,还缺哪一块?

按同输入、同目标、同监督来对照,已有路线可以分成 3 层。第一层是标准语基础资源,例如阿拉伯广播新闻转写系统和 GlobalPhone 的 35 小时标准语语料,以及 Mozilla Common Voice 和 MASC 等更大规模资源。它们的输入多为正式朗读或广播,目标是建立标准语基准,监督是规范转写。学习价值是证明了大规模标准语可以训练可用系统,但缺的是日常方言。

第二层是多方言广播与富标注资源,例如 MGB-2、MGB-3 和 QASR。它们的输入包含多种方言广播语音,目标除识别外还包括方言标识与标点恢复等,监督更丰富。原文的判断是这些资源仍以埃及和黎凡特方言为主,海湾阿拉伯语很少被覆盖。第 3 层是海湾内部资源,沙特方言的 SAAVB 约 96 小时,是目前海湾最大的语音资源,但不覆盖阿联酋口音。唯一接近的是 Mixat,约 15 小时播客转写,但设计目标是研究阿英码切换,录音风格是播客而非日常会话。

这样缺口就很具体。文本侧的阿联酋研究有社交媒体语料与形态标注,但没有音频,做不了语音技术。Mixat 有音频但混入英语且域较窄,不适合训练单语会话识别。Hamsa 的定位因此是第一份明确为识别开发而做的大规模人工转写单语阿联酋语料,强调会话多样性与方言拼写保真。理解这一定位,后面才能明白为什么论文要用 Hamsa 与 Mixat 双基准做交叉验证。

要解决的具体问题是什么?用什么例子能看懂错误?

问题可以写成一句话:给定阿联酋口语录音,模型输出的词串与人工方言转写不一致,且错误集中在方言特有现象上。论文用两个实例对比了参考转写与多个模型输出,并归纳出 4 类反复出现的错误。第一类是音系替换,例如ق与ج的对应关系,母语者按方言发成ج但书写仍保留ق,受标准语训练的模型处理不好这种映射。第二类是方言否定词,例如阿联酋用مب而不用邻近海湾变体的مو,训练数据缺这种区分就会出现替换与上下文扭曲。

第三类是阴性形态。白话讲,阿联酋阴性形式词尾按口语写作ج而不是标准语的ك,模型会默认回标准语形式,听对了音却写错了字。第 4 类是正字法过度纠正,模型把方言特有拼写改回标准语写法,读起来发音接近但字形判错。论文指出这 4 类错误会叠加,最严重时模型输出除个别功能词外基本不可读。这是一个教学例子,不是新增实验结论,作用是让初学者明白方言识别的难点不在噪声本身,而在发音到文字的映射规则与标准语不一致。

因此评价不能只看一个总分。后面同时报告词错误率与字错误率是有原因的,词错反映整词是否可用,字错反映发音接近程度与拼写偏差,二者一起看才能判断模型是完全没听懂还是听懂了但写成了标准语。

Hamsa 的整体做法是怎样一条流水线?

沿着一个样本走完全程最清楚。输入是一段来自阿联酋在线公开内容的录音,可能是独白,也可能是最多 3 人对话,含重叠语音的样本会被系统性排除。表示阶段是人工听写得到的方言文本串,不做标准语归一化。组件包括采集过滤、人工转写、指南约束、2 次复核和工具支持。目标是得到可直接用于微调的语音到方言文本平行数据。输出是转写标注、元数据与采集脚本的组合,而不是默认包含原始音频的打包下载。

最终集合是 4174 个音频样本,平均时长 1 分 3 秒,内容覆盖地区讨论、正式话语、日常闲聊、诗歌、歌曲与社会评论。质量过滤只保留连贯且适合训练的语音。需要区分两个口径:这是采集与标注前的样本口径,后面训练与测试划分会把长录音切成更短的句级片段,因此训练集样本数会远大于 4174。初学者容易把这两组数字混淆,记住前者是原始录音段数,后者是切分后的模型训练样本数。

这条流水线的关键选择是保方言。标注员被要求按阿联酋人实际说法写词,而不是按标准语改写,并配有方言与标准语对照表。例如阴性第二人称代词在两地发音相近但阿联酋写法带词尾ي,否定词、连写词、借词写法、主语一致字母等都有明确规则。工具上用 Python 脚本与自研 Streamlit 界面完成听音、改稿与问题标记。整个设计把一致性压力放在指南与复核上,而不是依赖模型后期纠错。

标注指南管住哪些容易漂向标准语的地方?

标注指南是方法中最值得复述的部分。它的操作是给每个易错现象定一条写法。口语读成ج但应写作ق的词,按ق写;阿联酋不写的ا不补;词尾ه应为ة的必须纠正。

قبايل与سايل这类词按口语把ئ写作ي;قالو与قامو这类复数词尾的وا是否属于词根本体要按规则保留;لهالشي按口语写成一个 token 而不拆成标准语形式;阴性形式按口语写作ج;جذي与جي这类常见语音误拼要纠正。

否定词用مب或هب而不用مو;بغى属于其他方言,阿联酋正确形式是با;英语借词按ج发音则写作ق;缺少主语一致字母的 شو类结构要补上;阴性第二人称代词写作带尾ي的形式。

这些规则的共同点是只管写法一致,不管是否符合标准语审美。初学者可以这样记:听到的音决定识别哪个词,指南决定这个词在文本里长什么样。没有这一步,不同标注员会把同一个发音写成标准语和方言两种样子,模型就会学到矛盾监督。

现代标准阿拉伯语 × 阿联酋阿拉伯语: 现代标准阿拉伯语负责正式书面与广播等规范场景的统一表达,阿联酋阿拉伯语负责阿联酋日常口语的发音、形态和词汇表达,二者搭配的原因是只用标准语训练的模型会把方言发音强行映射回标准形式,组合意义在于 Hamsa 用方言原样转写保留 ق读作ج、阴性词尾写作ج、否定词用مب等区别,让模型学到方言到方言文本的直接对应。

四类识别错误对应到信号与文本的哪一环?

把错误放回流水线看。第一环是声音到音素,方言把ق发成ج,若模型只有标准语的声学映射,就会把音归到错的字母。第二环是词选择,否定词مب在训练中缺席,模型会用更常见的مو或相近词替代,并拉偏周围词。第三环是形态与词尾,阴性ج被改成标准语ك,属于文本先验压倒声学证据。第四环是拼写后处理,方言特有拼写被过度纠正为标准语,字错可能不大但词错增加。

论文对 Whisper-v2 零样本字错误率高达 71% 的部分解释就与此有关:不是每句都完全听不懂,而是大量方言拼写被系统性改写,字符级编辑距离累积得很高。mms-1b-all 的输出问题更重,除功能词外大段不连贯,说明缺方言匹配数据时多语表示也难以直接迁移。这部分是论文报告的现象解释,不是证明某种架构必然失败。

音系替换 × 正字法归一化: 音系替换负责解释发音层面的系统性偏离,例如把ق说成ج,正字法归一化负责解释书写层面的模型偏好,例如把方言拼写改回标准语形式,二者搭配的原因是阿联酋方言的识别错误同时来自听错音和写错形,组合意义在于标注指南要求按发音写方言形而不纠正为标准语,从而同时阻断这两类错误来源。

语料是怎样从长录音变成可训练句子的?有神经网络训练吗?

本节对应数据集论文的构造过程,本研究没有从零训练新的声学模型,真正的计算是语料构建与后面对已有识别模型的微调。先讲构造。标注工作量分给 5 名阿联酋母语者,每人约 2.2 小时、约 2370 个音频片段,逐句听写。之后 1 名标注员对约 5 小时、约占语料 45% 的部分做全量 2 次复核,对照指南纠正不一致。2 阶段合计约 16 小时人力标注努力。因为标注员处理的是非重叠片段,没有计算正式的标注者间一致率,2 次复核是主要质量保证,论文明确承认这是局限,并建议未来在保留子集上做重叠标注以便报告一致性。

遇到的实际困难包括音频质量不均、背景噪声、酋长国内部地区差异,以及偶发的阿联酋语与标准语或英语码切换。对混合语句制定了何时转写、何时省略的规则,以保证一致性。长录音在进入模型前被切成平均约 3.5 秒的短句,训练集得到 11000 个样本、共 10.74 小时,测试集 861 个样本、共 51.8 分钟。句子复杂度相近,平均每句 7.85 对 8.15 个词,但测试集最长达到 109 词而训练最长 47 词,说明测试中有更长的连续谈话段。

人工转写 × 2 次复核: 人工转写负责由 5 名母语者每人约 2.2 小时逐句听写并保留方言原貌,2 次复核负责由 1 名标注员对约 5 小时即约 45% 语料按指南统一校对,搭配的原因是非重叠分工无法计算标注一致率,需要第二遍检查来收敛拼写漂移,组合意义在于用约 16 小时人力投入换取训练文本在否定词、阴性词尾和连写词上的一致性。

评测与微调条件如何设置才算公平可比?

实验要回答的问题是 Hamsa 微调是否带来真正的方言适应。与谁比包括两类,一是同一模型微调前后的零样本基线,二是同一模型在 Hamsa 与 Mixat 上分别微调后的交叉表现。条件一致性通过固定超参数实现,所有模型用同一套训练配置,以隔离训练数据的影响。指标方向是词错误率与字错误率越低越好,需要同时看两个基准即 Hamsa 测试集约 51 分钟与已有的 Mixat 测试集。

被测模型包括 Whisper-v2、Whisper-v3、seamless-m4t 与 mms-1b-all,另有 FastConformer 与 ArTST-v3 只做预训练状态评估。原文说明后两者微调需要不同代码库与训练管线,超出本次评估范围,因此不能把它们未微调的分数当成同条件输家。微调实现用 Hugging Face Trainer 库,批量大小 32,学习率 1 乘 10 的负 5 次方,混合精度 FP16,热身 5 步,训练 3 轮,生成序列最大长度 225,硬件为单个 NVIDIA H100 GPU 节点并启用梯度检查点等省显存特性。未报告的内容包括优化器种类、学习率调度细节、随机种子与多次运行方差,复现时应把这些记为缺项而不是默认。

下面先看句子长度分布,它决定了切分后样本是否仍像日常会话,以及训练与测试的难度是否对称。横轴是每句词数,纵轴是频次,蓝色为训练,橙色为测试。

看图路径: 1. 先看横轴句子长度与纵轴频次的含义,再对比蓝色训练集与橙色测试集的高度差异;2. 确认峰值是否都落在 5 到 10 词区间,并观察 10 词之后蓝色长尾如何下降;3. 检查横轴 30 词之后是否还有可见柱子,判断测试集重尾在图中是否可辨认

原论文 Figure 1:Frequency distribution of sentence lengths in Hamsa train and test splits.

论文图 1。原论文 Figure 1:“Frequency distribution of sentence lengths in Hamsa train and test splits.”。

从像素可见,两组柱子都在 5 到 7 词附近达到最高,训练集峰值柱高度超过 1400,测试集对应峰值约 100 出头,之后随词数增加快速下降,10 词后进入长尾。横轴在图中主要展示到约 50 词,30 词之后柱子已接近零线。图注补充说明测试集重尾可达 109 词而训练最长 47 词,这一点在当前像素分辨率下不能逐柱读出具体长句位置,只能按图注归因引用。教学含义是训练与测试主体都是短会话句,但测试包含少量更难的长句,因此测试词错误率天然可能波动更大,不能把 1 次下降全归因于模型变强,还要结合外部 Mixat 基准一起判断。

微调后识别分数变了多少?哪组数字最关键?

先提出比较问题:在固定超参数下,用 Hamsa 微调是否同时降低 Hamsa 与 Mixat 上的错误率,且优于用 Mixat 微调。公平条件是同一模型、同一超参数、分别只换训练数据。指标方向是两个基准上的词错误率与字错误率越低越好。下表整理训练与测试划分的基本规模,作用是先确认数据量与难度,再看分数,避免把数据切分差异误读成模型能力差异。

划分样本数总时长平均时长平均每句词数
测试集861 samples51.8 minutes3.61 seconds8.15 words per sentence

表后解释需要同时说收益与代价。规模上训练集远大于测试集,总词数全库 93354 词,训练词汇量 23350 对测试 3459,语速约每词 0.448 秒对 0.443 秒,基本一致。代价是时长与词数的相关系数从训练的 0.740 降到测试的 0.544,说明测试语音密度变化更大,加上最长句差异,测试集更难且更不均匀。这是理解后面分数波动的前提,不是模型缺陷的借口。

词错误率 × 字错误率: 词错误率负责衡量按词切分后识别错词的比例,对词边界和词形变化敏感,字错误率负责衡量按字符计算的编辑距离,对发音相近但拼写不同的错误更敏感,搭配的原因是方言中一个音变可能只错几个字母却导致整词判错,组合意义在于同时看两者可以区分模型是整句混乱还是仅正字法细节偏差,例如 Whisper-v2 微调后字错误率下降幅度远大于词错误率。

换训练数据会怎样?反向对照支持什么、反对什么?

本节按问题组织交叉微调对照。测的是数据来源的影响,与谁比是零样本、Hamsa 微调、Mixat 微调三态,条件是否一致由相同超参数保证,指标方向仍是错误率越低越好,关键数字集中在 Whisper 与 seamless、mms 系列上,支持的判断是 Hamsa 带来可泛化的方言适应,限制是不同架构对码切换与翻译导向预训练的敏感度不同。

模型与训练数据Hamsa 词错误率Hamsa 字错误率Mixat 词错误率对照含义
统一微调配置32 batch size1∗10−5 learning rate5 warmup steps3 epochs,225 tokens 上限

表前已说明比较问题与公平条件,表后要讲具体收益、代价与反例。收益上 Whisper-v2 在 Hamsa 上词错误率下降约 17.79 个百分点,字错误率从 71.91% 降到 8.27%,Whisper-v3 从 29.69% 降到 23.04%,而且两者在 Mixat 上也同步变好,支持这是方言适应而非只记住 Hamsa 风格。反例是反向不成立,用 Mixat 微调会让两个 Whisper 模型在 Hamsa 上变差,论文归因于 Mixat 播客域较窄且会话多样性不足。另一个未胜出项是 seamless-m4t,它对 Mixat 微调反应更强,在 Mixat 上最好成绩 23.77% 来自 Mixat 微调而非 Hamsa 微调的 24.84%,论文推测与其翻译导向架构对单语转写任务不敏感有关,这属于有限解释而非已验证因果。

mms-1b-all 从 Hamsa 微调获得最大绝对下降,从 69.60% 到 41.55%,在 Mixat 上从 61% 到 38.57%,但仍是总体最弱,且 Mixat 微调会让它在两个基准上都变差,论文归因于码切换内容与其多语表示冲突,同样待进一步验证。零样本的阿拉伯专用模型 FastConformer 与 ArTST-v3 分别为 35% 与 38.29% 词错误率,却被 Hamsa 微调后的 Whisper 超过,报告显示小而准的方言数据可以胜过更大的专用预训练,但这不等于所有场景下通用模型都更好。

Hamsa 微调 × Mixat 微调: Hamsa 微调负责提供单语种会话式阿联酋方言的干净转写信号,Mixat 微调负责提供播客域的阿英码切换信号,二者搭配比较的原因是检验适应是真正的方言能力还是只记住某个语料库风格,组合意义在于 Hamsa 微调后在 Mixat 测试集上也变好而反向则在 Hamsa 上变差,说明单语会话数据的泛化方向与码切换数据的干扰方向不同。

这批数据与结论的边界在哪里?

先说规模与覆盖。11 小时按大识别标准不算大,但对低资源单语会话阿联酋语来说是可观的人工投入。地理覆盖有意受限,边境与乡村变体未被覆盖,因此不能把结论推广到所有阿联酋口音。训练与测试切分不是严格说话人无关,虽然独立的 Mixat 评测提供了跨说话人与录音条件的外部信号,但严格的说话人隔离仍缺失。

再说标注与发布。没有正式标注一致率,只有指南加 45% 2 次复核,未来需要说话人元数据与重叠标注来补正式报告。音频再分发依赖与原始内容方的许可,公开发布初期只提供转写与采集脚本而非原始音频文件。这意味着外部复现必须自己按脚本取音频,网络可达性、删除与转码都可能引入差异。

最后说模型结论的边界。未测量延迟、推理成本与误判率分布,不能承诺这些量同步改善。总体趋势不等于每组都成立,例如 seamless 与 mms 的行为就与 Whisper 不同。把 Hamsa 理解为方言适配的有效起点,而不是一劳永逸的方言解决方案,才符合证据强度。

要复现这篇工作,第一步先做什么?

复现先做数据口径对齐。按原文用 11000 对 861 的句级划分理解训练与测试,不要用 4174 原始录音数直接对比。检查平均时长 3.51 秒对 3.61 秒、范围 2.00 秒到约 13.7 秒、平均词数 7.85 对 8.15 是否在自取音频与切分后基本一致,若长句尾部对不上,优先检查切分与过滤规则而非调参。

再做文本规范对齐。把表 2 式规则建成检查表,重点核对否定词、阴性词尾、连写词、借词与代词写法,确保自建转写不漂回标准语。可以先拿少量样本做 2 人独立听写加仲裁,补上原文缺失的一致率环节。接着按原文超参数跑微调:批量 32、学习率 1 乘 10 的负 5 次方、FP16、热身 5 步、3 轮、最大生成长度 225,在 H100 或等效显存条件下启用梯度检查点。评测必须同时跑 Hamsa 测试集与 Mixat 测试集,并保留零样本、Hamsa 微调、Mixat 微调三态,否则无法判断是泛化还是过拟合。

信息条件上区分三件事:论文方法可运行不等于数据可直接下载,权重可下载不等于系统可一键部署。按非商业学术研究约束使用转写与脚本,自行承担音频获取与许可合规。若要扩展,原文未来工作提到 50 小时以上、说话人元数据、码切换标注、语音合成与方言标识,这些都超出本次证据,不能当成已完成部分引用。

何时值得尝试 Hamsa 路线,还需补哪项验证?

当任务输入是阿联酋日常口语、输出要求保留方言写法,且已有模型在阴性词尾、否定词与ق与ج对应上系统性出错时,值得尝试 Hamsa 路线。它的可操作点很具体:用方言保真转写做小规模高质量微调,配合双基准交叉验证,而不是盲目扩大标准语数据。Whisper-v2 与 v3 的结果支持这条路,seamless 与 mms 的反例提醒要按架构分别验证。

还需补的验证包括严格说话人无关划分、重叠标注一致率、多次随机种子的方差、长句与噪声子集的分组误差,以及推理延迟与部署成本。若目标是客服自动化、字幕或教育无障碍,还需要补真实场景的端到端评测,而不仅是短句词错误率。回到中心矛盾:标准语资源解决的是规范语音,Hamsa 解决的是本地人真正说话的方式,11 小时的价值在于让模型第 1 次系统看到这种方式,但把它变成稳定产品仍需要更大覆盖与更严的评测。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总