英文题目:What Counts as a Mistake? Annotating Recitation Events in Quran Memorization Transcripts

标签:#音频事件检测 | #数据标注 | #评测协议 | #基准测试 | #语音

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Mohamad Al Mdfaa:LemoniLab FZCO (lemonilab.com)
  • Nursultan Askarbekuly:Innopolis University (innopolis.ru)
  • Ahmed Helaly:Innopolis University (innopolis.ru)
  • Ubai Sandouk:LemoniLab FZCO (lemonilab.com)
  • Manuel Mazzara:Innopolis University (innopolis.ru)

📌 核心摘要

输入为商用语音识别转写文本与固定经文参照,输出为带半开区间定位的类型化事件,难点在于重复、自我纠正、开端套语与可接受拼写差异在字面编辑距离上都像错误。方法链分三步:标注规范先将差异收敛为十个组合标签并规定原文空格分词与空跨度锚定,其输出进入可执行评分器。评分器按重叠配对同时结算标签与位置并报告标签感知与定位F1,其输出进入基线与智能体试点。基线与试点分别用现成差异与生产组件适配及限时代码生成探测任务难度,并回检标注接口坐标错误。相对已有方法的关键机制差异是将重复、修复与可接受拼写单列为良性或已纠正类别而非错误的轻重程度,使定位误差与命名误差得以分离,实际意义是定位已近解决而命名仍是瓶颈。在Evaluator v2.1评测设置下,Claude Code, Fable 5.1的micro F1为0.892,高于Plain diff的micro F1 0.525。结论适用边界仅限转写文本层面的已切分已评审单元,不覆盖元音与tajweed声学错误,也尚未验证向未见背诵者分布的外推,原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,读完要能复述什么?

本文的输入是生产环境录制的背诵音频经商用语音识别得到的转写文本,以及每节经文的固定标准参考文本。目标不是判断录音整体对错,而是对转写与参考之间的每一个差异给出类型和位置。读者读完应当能复述三件事:第一,哪些差异必须保留为可核对信息,即单元划分、参考文本、转写词序列和事件跨度;第二,输出是什么形式,即每个单元返回若干三元组,包含组合标签、转写跨度和参考跨度;第三,什么不属于本文任务,即只判断文本差异,不判断是背诵者口误还是识别错误,也不处理转写中写不出的元音与 tajweed 发音错误。

学习路径按依赖展开。先理解背诵陪练场景为什么编辑距离不够用,再看相关工作如何从音频正确性转向转写差异分类,接着走完一个样本从输入到表示再到评分的完整链路,然后拆开标签体系、定位规则与评分器匹配逻辑,再讲标注如何构造、实验条件如何隔离,最后看基线与智能体试点的结果、失败来自哪里以及复现时先做什么。全篇例子凡属教学构造都会明确标为例子,不把例子当作论文报告的数字。

同输入同目标的相关路线在做什么?

论文把相关工作分成两条线。第一条是古兰经朗诵的机器支持,多数从音频出发,包括用语音识别做经文切分、对声学信号做 tajweed 规则分类、用预训练编码器做古兰经语音识别,以及众包朗诵标注、非母语者 6 类标注、经文与词级音频文本对齐等数据集。这些工作通常标记一段录音或一个音素正确还是不正确。第二条是发音评估与非流利标注,前者把学习者尝试与参考对照打分,后者把重复与修正记录为自身结构而不是错误。本文继承的是第二条线的思想,但对象是语音识别转写对照固定参考,需要对每个差异 typing 与 locating。

对照时要注意输入与监督并不相同。音频分类工作的输入是声波,监督是录音级正确性;本文输入是转写词序列加参考词序列,监督是每个差异的类型与双端跨度。因此不能把音频正确率与本文标签感知 F1 直接比较高低。编码智能体在本文只是被试的求解器,其常用衡量是软件与机器学习工程基准,与背诵标注任务的运行阶段也不同。

为什么编辑距离找到差异还不等于找到错误?

背诵练习通常由听者纠正背诵者,应用用听者替代者转写后再与参考比较。编辑距离能定位不同,但不能决定解释。在生产抽查数据中,74% 的受检经文单元完全没有事件,而有事件的单元里相当一部分是人类听者根本不会指出的情况:换气后重复一遍短语,说错一个词并立刻纠正,或书写形式与奥斯曼体不同但朗读内容并无差别。如果把这些都标记为未解决错误,会给学习者误导性反馈。论文明确说明不衡量不同误报的相对用户代价。

于是任务被定义为对转写对照参考的差异做类型化定位事件标注,并且只判断文本而不判断说话人。举一个教学例子帮助理解,不代表原文数据:假设参考是 3 个词 A B C,转写是 A B B C,编辑距离会说多了一个 B,但标注还要决定这个多出的 B 是换气后的良性重复,还是实质插入错误。标签记录的是转写与参考之间差了什么,而不是背诵者或语音识别谁造成的。写不出的元音与 tajweed 错误在转写层面不可见,明确在任务之外。

方法全景:沿一个样本走完输入到输出

先沿一个样本走完全程。输入是一节经文单元的已切分转写词数组与精确参考词数组,检测与切分由外部供给,系统不需要自己找经文边界。表示是原样空白分词后的词序列,跨度是进入该原始数组的半开区间。组件对转写与参考做比较,输出每个事件的标签加转写跨度加参考跨度。目标是让输出同时答对叫什么与指哪里。输出随后进入可执行评分器,与金标准事件在单元内 1 对一配对并计分。

全景包含 3 个可复述部分。第一是标签体系,用一个组合标签同时表达事件类型与是否 benign 或 corrected,不再设独立的 benign 对 mistake 字段,也不设 uncertain 逃逸项。第二是定位约定,用原文词与半开跨度记录位置,遗漏用空转写跨度锚定,插入用空参考跨度锚定。第三是评分器,配对时忽略标签以便单独报告定位,计标签感知分数时再要求标签一致。一个单元返回的事件形如包含 label、hyp_span、ref_span 的记录,开端套语作为独立单元单独评分。

标签与定位各自分工什么,如何搭配?

标签体系共有 10 个事件标签加 clean。替换错误、遗漏错误与插入错误记录未解决的实质差异;替换已纠正与遗漏已纠正记录先错后对的自我修复;良性重复记录额外出现;字母良性与拼写良性记录可接受的书写差异。

求护词良性与 basmala 良性记录开端公式。受检后发现无事件的单元记为 clean,这与尚未受检是不同状态,数据中加以区分。

重复 × 修正: 重复负责记录 reciter 因换气或停顿把正确短语又说一遍的额外出现,修正负责记录先说错后立刻说对的 2 次尝试,二者搭配的理由是都包含 2 次文本出现但教学含义不同,组合意义是把不需要纠正的流利性现象与已经自我纠正的过程从未解决的错误中分离出来。

定位 × 标签: 定位负责指出差异在转写词序列和参考词序列的哪个半开区间,标签负责说明该差异属于替换错误、遗漏、良性重复等哪一类,二者搭配的理由是只找到位置不知道如何反馈,只给类别不知道纠正哪里,组合意义是评分器可以分别报告找得准不准与叫得对不对。

4 个需要裁决的决定值得单独复述。遗漏包括开头、中间与结尾缺失,录音末节经文提前停止仍记遗漏,不因录音位置推测意图。重复的跨度同时覆盖原短语与其额外出现,并对准单一参考拷贝,使其与已纠正事件的定位方式对齐。先错后对记 corrected 事件,先对后错再复述则记覆盖 2 次尝试的替换错误,并在备注记录顺序。拼写方面,经约定的上下文无关归一化能消除的差异不产生事件,只有需要上下文接受的残留形式才记拼写良性,且可接受上下文是枚举的,不能泛化为任意词尾删除。

开端公式与拼写边界为什么必须裁决?

每个记录的求护词与 basmala 作为独立单元呈现,转写为公式本身而参考为空。复合开端在一个词数组上产生两个事件。判断 basmala 是良性还是插入,正是被测的判断;若排除这部分,就会隐藏最重要的失败模式。字符串比较下,复合开端包含两个金标准公式,但朴素差分可能只返回一个横跨两者的插入跨度,这正是定位对但解释错的典型情况。

开端套语 × 插入错误: 开端套语负责解释求护词与开端章句这类仪式性起始语为何出现在转写中,插入错误负责记录参考文本之外多出的实质内容,二者搭配的理由是两者在字符串比较上都表现为多余词,组合意义是要求系统先判断多余文本是否属于可接受的开端公式,再决定是否作为错误标记。

拼写良性差异 × 替换错误: 拼写良性差异负责记录书写形式与奥斯曼体 orthography 不同但朗读内容一致的情况,替换错误负责记录转写词与参考词实质不同的情况,二者搭配的理由是两者都表现为词形不一致,组合意义是只有经过约定的上下文无关归一化和枚举的可接受上下文才能免于记错,否则仍按替换错误处理。

拼写良性是最依赖裁决的类别。只有残留的、需要上下文接受的形式才进入该类,可接受上下文逐条枚举。教学例子:若归一化已统一某种 hamza 或 alif 变体,则不再记事件;若某种词尾 alif maqsura 在连读后接定冠词时是否接受,则必须查枚举表,不能自行推广。这解释了为什么后文智能体在该类系统性失败:边界不是从文本可见结构能推出的,而是由裁决写进指南的。

没有模型训练时,标注与开发集如何构造?

本研究没有训练神经网络权重,也没有报告梯度路径、参数冻结或优化器设置。该节的真实计算过程是标注构造与开发释放。标注由 1 名审稿人逐条批准,依据是未经改动的原始语音识别转写与每节精确参考,批准以整段录音为单位:任何未解决问题都会使整段录音留在集合之外,而不是带 hedged 标签进入集合。这就是为什么体系没有 uncertain 类别,不确定性通过扣留批准来表达。集合中全部 314 个经文单元与 34 个开端单元都携带该批准,每一个节内事件都附有书面备注,记录针对哪个差异以及为何选择该标签,这些备注支撑了后文失败分析,但与答案一起保密。

标注 × 算法: 标注负责把哪些差异算哪类事件的裁决边界固定下来,算法负责在给定转写和参考时复现这些带位置的标签,二者搭配的理由是试点把未标注数据、标注指南和教学例子一起交给编码智能体,组合意义是可以区分失败来自检测不到,还是来自跨度约定与裁决边界没有被学到。

已完成的标注规模是 100 个生产录音案例,348 个受评单元,162 个定位事件,覆盖 274 节经文、38 个苏拉、10 名学习者身份,其中 1 人贡献 46 段录音。选择是目的性抽样,因此计数只描述已标注集合,不估计错误流行率,也不暗示推广到未见背诵者。另有 3 段已批准录音留在评分集之外,其仅转写拷贝加入开发候选,标注私存。标识符与转写经双源导出核对,排除了标点归一化重复与冗余 clean 子段。金标准答案与入选成员在持有者私包中,草稿不释放金标准样本。开发释放包含 127 个案例与 888 个单元,包括 44 个较新录音中的 63 段,允许共享 clean 经文与不同错误变体,但排除完整金标准拷贝与含事件的金标准片段。

下表提出的问题是各标签在金标准中有多少事件、给了几个教学例子,以及 6 个同日有效运行如何处理它们。公平条件是同一 162 事件乘 6 共 972 个实例,正确要求标签与跨度同时超过容差。指标方向是正确率高好,missed 与 mislabelled 低好。表后将解释拼写与修正类为何成为残留难点。

Labelgoldteachcorrectmislab.misseddominant failure
substitution_mistake62794%0%6%span too narrow
isti3adha_benign290100%0%0%—
omission_mistake26588%0%12%read as substitution
basmala_benign18088%0%12%compound opening
spelling_benign12124%61%15%read as substitution
repetition_benign5163%0%37%read as insertion
substitution_corrected4138%0%62%read as insertion
letters_benign4154%46%0%read as substitution
insertion_mistake1117%0%83%read as substitution
omission_corrected110%67%33%read as corrected substitution

该表显示替换错误与求护词良性占比较大且处理较好,而拼写良性、替换已纠正与遗漏已纠正正确率明显偏低。教学例子数量并不解释成败:开端公式零例子却接近全对,拼写良性有一个例子仍只有约 1/4 正确。代价集中在两处,一是跨度约定,把 2 次尝试记为一个事件而运行只报额外文本;二是裁决边界,把枚举接受的拼写读成替换错误。未胜出项在这里不是某个模型,而是用例子数量预测难度的直觉,该直觉被数据反驳。

评分器如何配对、计分与控制容差?

系统接收已审核的经文切分、经文标识与精确参考,因此检测与切分是供给而不评分,该任务另有配套投稿。每个单元返回事件列表。配对在单元内对预测与金标准做 1 对一最大总相似度匹配,一个宽预测至多认领一个金标准事件,其余记为漏检。配对资格要求双端跨度都重叠,且转写相似度与参考相似度的较小值不低于 0.50。论文说明早期版本取平均会让参考跨度精确而转写跨度指向别处也能匹配,因此改为取最小值。

事件需校验已知标签、整数端点、词界与标签特定的空跨度,无效预测记为误报。空跨度只与空锚点匹配,精确或一词松弛,不与选中词匹配。配对忽略标签以便单独报告定位。任一侧超过 7 个事件的单元用确定性贪心匹配。

分数以标签感知事件 F1 为主:配对成功且标签一致才算真阳性,标签错的配对同时记 1 次误报与 1 次漏报。另报告 micro F1、要求端点完全相同的精确跨度 F1、跨金标准标签的 macro F1,以及去掉标签的定位准确率召回率 F1。应用侧成本用每 100 单元的漏检加误报原始计数表示,报告 r 为 1 与 2 的情形,论文称 1 比 1 到 5 比 1 不改变排序,低于约 0.77 比 1 时报空最优。报空 F1 为 0,金标准为 1。评分器 v2.1 通过合成坐标、标签、锚点与适配器回归测试及私密金标准预言检查。

容差从 0.05 扫到 1.00,基线 micro F1 移动约 4 个点,精确跨度 F1 不变,因基于差分的基线输出精确跨度,0.50 是为可解释而选而非调优。一词锚点松弛在 0 到 10 之间不改变基线分数,因遗漏在两词之间的索引本就含糊而保留。论文提醒输出更宽松跨度的系统会更依赖容差。

基线与智能体试点各测出什么?

实验比较的问题是现有可运行方法与短期编码智能体在同一评分器下能达到什么水平。条件是 348 单元、162 金标准事件,同一 v2.1 评分器。基线是朴素差分与适配的生产清理对齐组件,试点是 3 个编码智能体在 8 个模型上各做 1 次 20 分钟开发运行,每次冻结一个 solution.py 再在私密金标准上运行。试点不是第 8 节的预注册重复运行比较,模型、预算与种子均未预先冻结,不能据此对智能体或模型做一般排序。其中 Fable 5.1 晚 1 天运行且工具许可方式不同,后文汇总保留 6 个同日有效运行并将其作单独对照。指标方向是 F1 高好,复查成本低好。

Systemmicro F1exact F1macro F1loc F1review cost
Predict nothing0.0000.0000.0000.00051.2
Plain diff0.5250.5050.1780.82623.3
Adapted production components0.5180.5050.2840.78626.7
Claude Code, Fable 5.1 (pilot)0.8920.8790.7020.9479.2
Codex, GPT-6-Astra (pilot)0.8920.8620.7010.9348.1
Claude Code, Opus 5 (pilot)0.8800.8490.6600.9319.2
Codex, GPT-5.6-Sol (pilot)0.8750.8630.6310.9389.5
Claude Code, Sonnet 5 (pilot)0.8560.8250.6090.9129.8
Antigravity, Gemini 3.6 Flash (pilot)0.7970.7730.3870.87814.1
Antigravity, Gemini 3.1 Pro (pilot)0.7950.6770.5020.87310.9
Antigravity, gpt-oss-120B (pilot)0.1430.1210.0170.187169.3

该表的主要收益是定位与定名的差距。朴素差分定位 F1 为 0.826,能找回 126 个金标准事件,但标签感知 F1 只有 0.525;适配生产组件定位 0.786,标签感知 0.518。两者精确跨度 F1 都是 0.505。7 个成功的试点运行标签感知 F1 在 0.79 到 0.89 之间,远高于基线,且在 348 单元零无效预测。

具体代价是失败运行 gpt-oss-120B 因未做阿拉伯语 orthography 归一化,把普通 hamza 与 alif 变体都记成替换错误,共 567 个预测中 545 个是该标签,并把开端单元都判 clean,另有 22 个无效事件,micro F1 仅 0.143,低于朴素差分。未胜出项还包括适配器从未预测开端公式、字母、上下文拼写与遗漏纠正等 6 类,说明显式事件建模仍有缺口,但论文强调这不证明清理导致错误,也不衡量部署应用的全部特性。

剩下错误是找不到,还是叫不准与框不准?

该节按失败来源组织。先看检测是否仍是瓶颈。972 个金标准事件实例中有 970 个得到重叠预测,只有两个拼写良性完全无人重叠。未匹配的 97 个实例中 95 个有重叠预测但低于匹配容差,最常见原因是指南把重复或修复的 2 次尝试记为一个事件,而运行只报额外文本。错标签的 59 个实例集中在拼写良性与字母良性,都被读成替换错误。

只有 7 个金标准事件击败全部 6 个同日运行,其中 5 个是同一正字法情形,即连读后接定冠词前词尾 alif maqsura 是否保留,指南在命名上下文枚举为接受而六运行都判替换错误;一个是补回缺失介词的重启,记遗漏已纠正而四运行读成替换已纠正;最后一个是 2 次尝试短语,金标准覆盖 2 次而运行都只框第二次。

下表的问题是 6 个同日运行的输出量与误报结构是否失控。公平条件是同一 162 事件与 233 个 clean 单元,指标方向是预测总数接近 162 好,误报与 clean 误 flag 低好。表后结合一致性解释为什么量不是问题而约定是问题。

Runevents predictedfalse positivesclean units flagged
Codex, GPT-6-Astra172230
Claude Code, Opus 5156160
Codex, GPT-5.6-Sol158180
Claude Code, Sonnet 5158211
Antigravity, Gemini 3.6 Flash159311
Antigravity, Gemini 3.1 Pro145231

六运行预测 145 到 172 个事件,与金标准 162 相差在约 10% 以内,在 233 个 clean 单元上共只产生 3 个 spurious mistake 标记,误报每运行 16 到 31 个且都以替换错误为主。也就是说,运行没有通过编造错误淹没学习者,这是应用最不能承受的失败模式,未出现。把六运行看作同一指南的独立读者,114 个事件六者都与金标准标签一致,43 个分裂,5 个六者一致但与金标准相异,恰落在上述拼写规则与跨度约定上。论文的判断是,一致性相异不是噪声,而是指示指南在做 stipulative 工作的条款位置,但不能决定哪种读法正确。

Fable 5.1 的对照支持该拆分:它在替换已纠正、良性重复与字母良性上全对,平均跨度交并比 0.995,无 clean 误 flag,但剩下 9 个错标签中有 8 个是拼写良性,仍包括同样的连读形式与遗漏纠正重启,说明跨度约定可被能力克服,而裁决边界不能。试点也报告标注一半未被检验:七运行直接写规则而未打开训练池,只有 Fable 5.1 用成品检测器标注 888 单元作分布检查而非先标注后学习,因此试点只衡量算法一半。

哪些限制使结论不能推广?

论文明确列出多项限制。已标注集是目的性小样本,1 名学习者贡献 100 段中 46 段,标签分布高度偏斜,因此 macro F1 只是覆盖检查而非稳定估计。单一审稿人批准全部记录,不报告 annotator 间一致性,无法分离指南与该审稿人的解读,书面备注使决策可审计且失败分析显示独立读者分歧位置,但不能替代第二标注者在样本上的复核,论文称这是首先要补的工作,六运行一致反对金标准的 5 个事件是自然起点。

更关键的是输入暴露问题。100 段入选转写作为同一录音的输入已在公开释放中出现过,12 段还有过早期机器标注试点,裁决与入选成员私密但输入不私密,运行时隔离不能证明此前未见过,主张未见输入需要另建语料。准备的开发释放含 127 案例与 888 单元,包括较新录音 63 段中的 44 段,允许共享 clean 经文与不同错误变体,但排除完整金标准拷贝与含事件金标准片段,一处本地语音识别修复因非古兰经内容被排除,剩余新录音不是冻结隐藏测试。

隔离方式也因运行时而异,Codex 与 Claude Code 在新目录非交互运行并做网络限制与凭证隔离,Antigravity 在新窗口目录运行,网络未独立记录,模型选择取操作者报告。试点预算 20 分钟使直接写规则成为理性选择,因此未观察到先标注后开发,不代表更长预算下不会标注。

何时值得尝试,复现先做什么,还缺哪项验证?

当任务是转写对照固定参考且需要区分未解决错误与重复、修复、开端公式、可接受拼写时,该标签体系与评分器值得尝试。若只需要定位差异,朴素差分已接近解决;若需要像听者那样反馈,则必须显式建模事件命名。复现先做三件事:第一,按原文用空白分词与半开区间实现跨度,遗漏与插入分别用空转写与空参考锚定,并保留标签特定的空跨度校验;第二,实现最小相似度不低于 0.50 的单元内 1 对一配对,配对忽略标签,计分再要求标签一致,同时实现精确跨度与定位分数;第三,保留各自比较归一化为算法选择,不改动金标准指南,并对无效预测记误报。

还需补的验证包括第二标注者样本一致性、对 stipulative 拼写上下文的独立复核、在真正未见输入语料上的测试,以及固定预算、模型与标注交付的重复运行比较。资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。论文称金标准答案、入选测试包与评审历史留在开发环境之外,开发释放的共享 clean 输入与既往公开暴露已披露,复现时应遵守该隔离,不把公开输入当作未见测试。

收束:找到不难,叫准才难

回到中心矛盾。162 个事件中 68 个良性加 5 个已纠正,共 73 个即 45% 在只有错误类别的体系下会被当作未解决错误送达学习者,另有 233 个单元本无事件。基线定位 F1 达 0.826 与 0.786 而标签感知只有 0.525 与 0.518,差距全部来自命名而非寻找。试点显示 970 除以 972 的实例已有重叠预测,残留是跨度 extent 与裁决边界。教学上应记住两条:重复与修复的跨度覆盖 2 次尝试而非仅额外文本。

拼写是否接受查枚举而不推广。未验证的推测应以可能或待验证表达,例如智能体共识可作为指南审计信号,但不能决定裁决正确性,也不能把训练池分布检查等同于先标注后学习。

📎 论文与评分元数据

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-14 语音/音乐/音频论文速递