英文题目:Harf-Speech: A Clinically Aligned Framework for Arabic Phoneme-Level Speech Assessment
会议身份:
conference:interspeech:2026:conference-paper-id:azad26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#人类参与评测 #SFT #语音学与音系 #语音 #病理语音评估
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告
👥 作者与机构
- Asif Azad:机构信息未能从会议 PDF 纯文本可靠映射
- MD Sadik Hossain Shanto:机构信息未能从会议 PDF 纯文本可靠映射
- Mohammad Sadat Hossain:机构信息未能从会议 PDF 纯文本可靠映射
- Bdour Alwuqaysi:机构信息未能从会议 PDF 纯文本可靠映射
- Sabri Boughorbel:机构信息未能从会议 PDF 纯文本可靠映射
- Yahya Bokhari:机构信息未能从会议 PDF 纯文本可靠映射
- Abdulrhman Aljouie:机构信息未能从会议 PDF 纯文本可靠映射
- Ayah Othman Sindi:机构信息未能从会议 PDF 纯文本可靠映射
- Ehsan Hoque:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作处理现代标准阿拉伯语朗读发音评估,输入为参考文本与朗读录音,输出为0到5分临床量表上的话语级发音分数与词级音素反馈,难点在于咽化音、喉音与短元音敏感且缺乏经言语语言病理学家验证的开放工具。基于MSA的发音词典生成规范音素序列并归一化为Harf音素集,作为期望真值进入后续比较。微调后的语音到音素模型将录音直接解码为实际音素序列,默认骨干为OmniASR-CTC-1B-v2,其输出与期望真值一同送入对齐阶段。大语言模型按词切分后用Levenshtein距离完成音素对齐得到替换、删除与插入,并行计算最长公共子序列比率与基于编辑距离的准确率、完整率,再以经验权重融合并映射到0到5分。与专有端到端评估的关键差异在于显式保留参考生成与可审计对齐,每个扣分可追溯到具体音素操作而非黑盒似然。在40例三位专家评分的评测设置下,Harf-Speech的PCC为.791,高于Azure的PCC .635。该结论仅在朗读MSA与轻中度偏差范围内有效,自发对话、方言、儿童言语及重度障碍尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,先保留哪些关键信息?
这篇解读的输入是 Harf-Speech 论文的正文证据与两张官方原图,目标是让刚进入语音或音频方向的研究生能够复述方法、复核实验条件并理解临床对齐的含义。阅读时必须保留的信息包括任务定义、4 个系统阶段、微调与零样本模型的对比条件、40 句专家评分协议以及主结果数字的适用边界。最终输出是 1 篇按学习依赖展开的中文技术解读,不做超出证据的推广。
临床语音治疗中的发音评估,通俗说就是判断病人把每个音读对了没有。英文名是 phoneme-level pronunciation assessment,其中音素就是能够区分词义的最小语音单位,例如阿拉伯语中强调音与非强调音的差别会改变发音正确性判断。后文统一把音素简称为音位符号,把语言治疗师简称为临床专家。
阿拉伯语的难点在于现代标准阿拉伯语具有丰富的辅音库、强调音和咽音,以及短元音和变音符号的功能性作用。也就是说,文本上省略变音符号很常见,但发音上短元音缺失会被视为错误,这使得音素级敏感性很高。通用商业发音评估系统往往是面向多语言的一刀切闭盒方案,既没有针对阿拉伯语音系优化,也没有与语言治疗师的打分做过对齐验证。
因此论文要解决的不是单纯把语音识别做准,而是做出一个可解释、可复现、与临床量表对齐的完整评分系统。系统输入是参考句子文本和被试朗读录音,输出是 0 到 5 分临床量表上的整句分数和词级分数。理解这一点后,才能明白为什么论文既要报告音素错误率,又要报告与专家分的相关性和一致性。
已有路线走到了哪里,为什么还缺临床对齐?
自动发音评估最早的一条路线是基于语音识别似然的优度分数,英文名是 Goodness-of-Pronunciation,缩写为 GOP。白话说就是看目标音素在声学模型下有多大可能,可能性越低越可能是读错。后来出现了基于联结时序分类和自监督编码器的方法,其中联结时序分类英文名为 Connectionist Temporal Classification,缩写为 CTC,自监督编码器的代表是 wav2vec 2.0。这类方法提高了高资源语言的音素识别能力。
在阿拉伯语方向,已有工作用卷积神经网络、Transformer 和迁移学习做误发音检测与诊断,不少集中在古兰经诵读场景。但论文指出,变音符号省略、丰富音位对立和缺乏标准化基准限制了临床对齐的评估。最近出现的 QuranMB.v1 被描述为首个现代标准阿拉伯语音素级误发音检测公开基准,提供了标准化评估协议和基线,恰好说明该任务本身难度高,需要更强的建模。
另一条路线是完整发音评估服务,例如微软 Azure 发音评估。这类系统是闭源的,论文认为其缺乏透明的音素级建模,也没有针对阿拉伯语的临床验证。同期多模态基础模型可以直接处理音频输入,但其细粒度阿拉伯语音素转写能力基本未经检验。Harf-Speech 的定位因此是开放组件、模块化、可替换主干,并且直接与持证临床专家打分比较,这是与上述路线在输入、目标、监督和运行阶段上的主要区别。
论文把任务形式化成什么可计算问题?
论文把 1 次评估定义为给定参考文本和对应朗读录音,预测一个与临床专家一致的分数。计算上可以拆成两个子问题。第一个是序列预测问题,把连续语音波形映射为离散音素符号序列,同时把参考文本映射为规范音素符号序列。第二个是序列比较与评分问题,在两个符号序列之间做对齐并换算为分数。
举一个教学例子帮助理解流程,不代表论文的真实数值。假设参考文本对应规范序列包含 10 个音素,系统从录音中识别出 9 个音素,其中有替换和漏读,对齐模块会标出哪里替换、哪里删除、哪里插入,评分模块再把这些计数变成 100 分制和 0 到 5 分。这个例子只是说明输入到输出的形态,真实性能必须看论文报告的错误率和相关系数。
需要区分的是,音素识别准不等于评分与专家一致。识别阶段用音素错误率衡量符号转写差异,评分阶段用相关系数、组内相关系数和误差衡量与专家量表的一致程度。论文同时报告两类指标,正是为了避免把自动指标当成临床有效性的证明。
四段流水线如何从一句话走完到分数?
Harf-Speech 的总体安排是先呈现参考句,被试朗读并录音,然后系统自动处理文本与音频,比较期望与实际音素序列并给出整句分与词级反馈。按系统视角可分为 4 个阶段,分别是参考音素生成、语音转音素预测、音素切分与对齐、评分计算。每个阶段自动运行,不需要人工干预,设计目标是可扩展和一致评估。
论文强调模块化和模型无关。也就是说,当前效果最好的微调模型被用作语音转音素主干,但换成其他主干不需要改动对齐与评分框架。这种安排的理由是便于跨数据集、方言和部署条件替换,也便于未来接入更好的语音模型。
以下导读帮助建立全图概念,图中示例词按图注翻译为做好准备,图中展示的音素串差异与颜色仅用于说明两条序列的比较关系,具体数值以正文公式和实验表为准。
看图路径: 1. 先沿顶部参考文本与录音两条输入支路看到两条音素序列的生成位置;2. 再看中部虚线下方切分器如何把整句音素拆成词级分组;3. 最后看右侧两种对齐算法如何汇入同一评分模块并输出整句与词级分数
论文图 1。原论文 Figure 1:“Overview of the Harf-Speech methodology. The example reference word shown in the figure translates to “be prepared””。
从像素可见的结构看,顶部是音素抽取部分,左侧参考文本一路向下经标准发音词典生成器得到规范序列,上方人物经麦克风录音得到波形再经微调后的语音抽取器得到实发序列,两条序列在中部虚线处汇合进入下半部分。下半部分是分数计算部分,两条序列一方面直接进入两种对齐算法,另一方面经过一个大语言模型切分器拆成词级分组后再参与对齐,最终由评分算法输出右侧的整句分数条与两个词级分数条。沿着这条输入到表示再到组件再到目标最后到输出的路径走一遍,就能复述 1 次完整推理。
参考序列与实发序列分别怎么得到?
参考音素生成阶段输入是参考句子文本,输出是规范音素序列。论文使用基于现代标准阿拉伯语的发音词典生成器,英文名是 MSA phonetizer。白话说就是查表加规则,把文字变成应该怎么读的音素串。随后按 Harf 音素字母表做归一化,包括去掉位置后缀和静音标记、处理双辅音即 geminate 的合并、重映射词表外符号。这个序列被当作期望的正确发音。
语音转音素预测阶段输入是被试录音波形,输出是实际发出的音素标签序列。框架本身不绑定具体模型,但论文明确指出直接使用现成模型在阿拉伯语音素识别上表现不足,因此微调了多个主流架构。最终选中的主干是 OmniASR-CTC-1B-v2。
语音转音素模型 × 标准发音词典生成器: 语音转音素模型负责把实际录音转写成被试真正发出的音素序列,标准发音词典生成器负责把参考文本转写成应该发出的规范音素序列,二者搭配的理由是发音评分需要同时获得期望与实际两条可比序列,组合后新增的作用是把声学差异转化为同一音素字母表上的符号差异,供后续对齐和评分直接计算。
切分与对齐阶段先解决词级分析问题。参考序列与预测序列用一个大语言模型切分器分成词对齐分组,该切分器以文本和音素序列为条件。随后在音素级用编辑距离计算对齐,英文名是 Levenshtein distance,得到替换、插入和删除映射,供评分使用。论文还用最长公共子序列参与评分,其白话含义是在保持相对顺序前提下两序列最长公共部分的长度。
两个互补分数如何合成临床量表分?
给定对齐后的序列,系统计算两个互补指标。第一个是最长公共子序列比率,英文缩写为 LCS Ratio,计算方式是参考序列与预测序列的最长公共子序列长度除以参考长度,再缩放到 0 到 100 分。该指标捕捉音素顺序保持情况,对孤立插入相对宽容。
第二个是发音分,英文名为 Pronunciation Score。它从编辑距离对齐中得到替换数、删除数和插入数,记为 S、D、I,参考音素总数记为 N。先定义准确率与完整度,再按 0.60 和 0.40 加权得到发音分。准确率同时惩罚替换、删除和插入并截断于零,完整度只惩罚删除。最终 Harf-Speech 分数按最长公共子序列比率权重 0.6、发音分权重 0.4 加权,再线性映射到 0 到 5 分临床量表。论文称权重为经验默认权重。
最长公共子序列比率 × 编辑距离发音分: 最长公共子序列比率分工是度量顺序保持程度,对孤立插入更宽容,编辑距离发音分分工是基于替换、删除、插入计数惩罚实质性发音错误,二者搭配的理由是单一指标无法同时反映流畅顺序与准确性,组合后按 0.6 和 0.4 加权形成兼顾保持性与正确性的最终分数。
这里的组合意义需要讲清。只用顺序保持指标会漏掉系统性替换,只用编辑距离指标会对轻微插入过于敏感。加权后系统既奖励整体可懂的顺序,又惩罚实质性音位错误。复述时应先说符号与输入,再说计算目标,最后说原文明确的权重与映射,不要自行猜测梯度或优化细节,因为评分部分是确定性计算而非可训练模块。
哪些模型被微调,数据与训练条件是什么?
本研究的训练对象是语音转音素主干,而不是评分公式。论文微调了 3 个主流语音识别架构,分别是 Wav2Vec2-LV-60-ESpeak-CV-FT、Qwen3-ASR-1.7B 和 OmniASR-CTC-1B-v2,目标是使其适应规范、合成与真实误发音语音上的稳健音素预测。零样本多模态模型没有经过这种微调,只用标准化临床风格提示词引导输出音素序列。
微调数据主要使用 IqraEval 数据集,该数据集包含完全标注元音的现代标准阿拉伯语语音。论文称使用了全部 3 个切分进行训练,包括母语与合成误发音样本。训练数据的 3 种来源在正文中交代为母语者流利语音、用语音合成系统按混淆矩阵系统引入音素级错误的合成误发音、以及真实人声误发音,分别提供规范参考、可控错误覆盖和真实偏差与韵律变化。
训练实现细节按原文交代。所有模型使用混合精度、4 倍梯度累积和线性学习率调度。Wav2Vec2 的有效批量为 64,学习率为 3e-5,权重衰减为 0.01,训练 10 轮并按音素错误率选模型。OmniASR-CTC-1B-v2 训练 35k 步,每 1k 步验证 1 次,Qwen3-ASR 采用可比设置。论文未报告优化器内部梯度路径的逐层冻结细节,因此复述时只讲到证据给出的批量、学习率、步数与选模标准,不从模型名称推定实现。
基准测试与临床验证的条件是否一致?
音素识别基准测试在验证集随机抽取的 500 个样本上进行。论文明确说明采用子集的原因是 Gemini-3-pro 推理时间非常高,Gemini-3-flash 也在较小程度上偏慢,全量验证集推理不现实。评估指标是音素错误率与实时率,其中实时率定义为推理时间除以音频时长。零样本模型的系统提示词与词表参考放在补充材料,正文只说明使用了标准化临床风格提示。
临床验证则使用另外整理的 40 个语音样本,来源多样,由 3 位母语为阿拉伯语的持证语言治疗师独立评分,每位具有 8 到 10 年阿拉伯语语音语言评估经验。论文称 40 个样本是在保证可靠性分析所需变异性与控制专家标注工作量之间的折中,3 位评分者是计算稳定组间一致性所需的最小数量。每位专家在 0 到 5 发音量表上打分,该子集用于评估自动分与临床判断的对齐。
比较的公平条件需要分开看。模型之间比较音素错误率时,微调模型与零样本模型的监督条件不同,因此结论应表述为任务专用微调对阿拉伯语音素建模仍是必要的,而不是同条件下的架构胜负。系统之间比较临床对齐时,Harf-Speech 与 Azure 发音评估都与同一组专家均分比较,指标包括皮尔逊相关、斯皮尔曼相关、组内相关系数、平均绝对误差、均方根误差、精确一致与正负 1 分内容差一致,方向是相关与一致越高越好、误差越低越好。
音素识别谁最准,谁最快,代价在哪里?
比较问题是微调模型是否在准确性与速度上同时优于零样本多模态模型。公平条件是同一 500 样本验证子集上的音素错误率与实时率,指标方向是两者越低越好。下表整理论文正文连续原句中可逐字核对的关键数字,完整表格数字以原表为准,此处只呈现正文明确写出的结论性数值对比。
| 条件 | 指标 | 微调代表 | 零样本对照 | 未胜出或失败项 |
|---|---|---|---|---|
| 验证子集 500 样本 | 音素错误率越低越好 | OmniASR-CTC-1B-v2 为 8.92% | Gemini-3-pro-preview 为 15.07% | Wav2Vec2 为 13.58% 但高于最优 |
| 验证子集 500 样本 | 实时率越低越好 | OmniASR-CTC-1B-v2 为 0.004 | Gemini-3-pro-preview 为 10.75 | Qwen2.5-Omni-7B 未能产生可用输出 |
表后解释需要同时讲收益与代价。论文报告微调模型一致优于零样本多模态模型,OmniASR-CTC-1B-v2 以 8.92% 最低错误率和 0.004 最快实时率成为 Harf-Speech 主干的明确选择。Wav2Vec2 以 13.58% 错误率和次低实时率成为轻量替代,这是未胜出但仍有价值的选项。反例是 Gemini-3-pro-preview 虽然在零样本中达到 15.07%,但实时率高达 10.75,意味着推理耗时远超音频时长,部署代价过高,而 Qwen2.5-Omni-7B 则未能产生可用的阿拉伯语音素输出,说明通用多模态模型不能直接替代任务微调。
音素错误率 × 实时率: 音素错误率分工是度量语音转音素模型的转写准确性,数值越低表示识别越准,实时率分工是度量推理耗时除以音频时长的部署代价,数值越低表示越快,二者搭配的理由是临床系统既要准又要可用,组合意义是避免只看精度而选中无法落地的慢模型。
该结果支持的判断是任务专用微调对阿拉伯语音素级建模仍然必要,但限制是该结论只在论文的 500 样本子集与提示条件下成立,且未测量误判率随口音或噪声的变化,因此不能推广为所有场景下的最优架构。
自动分与专家分的一致性能否接近专家之间的一致性?
本节的比较问题是 Harf-Speech 与 Azure 谁更接近专家均分,以及 Harf-Speech 是否接近专家之间的可重复性上限。公平条件是同一 40 句临床子集与同一 0 到 5 量表,指标方向是相关和一致越高越好、误差越低越好。以下先给出图前导读,图中每个子图横纵轴均为 0 到 5 分,点颜色表示绝对分歧,浅色带为正负 0.5 容差,左上角标注了对应子图的皮尔逊相关、斯皮尔曼相关与平均绝对误差。
看图路径: 1. 先对比第一行专家之间与第二行系统对专家的散点离散程度;2. 再看每个子图左上角标注的皮尔逊相关与平均绝对误差数值;3. 最后观察对角线附近浅绿色容差带内外点的颜色与数量变化
论文图 2。原论文 Figure 2:“Pairwise scatter plots on the 0–5 clinical scale.”。
从像素可见,第一行 3 个专家两两对比的子图点群紧贴对角线且以绿色为主,说明专家之间分歧小。第二行 Harf-Speech 对 3 位专家及专家均值的 4 个子图点群多数仍分布在对角线与容差带附近,但在低分区有少数偏离较远的橙红色点。最右下角 Azure 对专家均值的子图点群更分散,高分区出现纵向拉开,橙红色点更多,与正文所说更大逐样本偏差一致。观察时应先确认子图标题指示的比较对象,再结合纵轴是原始临床分数而非相对改变量来判断好坏,不能把个别偏离点推广为整体趋势。
组内相关系数 × 皮尔逊相关系数: 皮尔逊相关系数分工是度量自动分与专家分线性变化趋势是否一致,组内相关系数分工是进一步度量绝对分值是否一致且考虑评分者效应,二者搭配的理由是趋势一致不等于分数可直接替代专家分,组合后才能同时判断排序有效性和临床量表上的可替换程度。
下表用正文原句可覆盖的数字整理临床对齐主结果,比较对象是论文实际可运行的 Azure 基线,不用事后最优值代替可部署收益。
| 条件 | 指标 | Harf-Speech | Azure 基线 | 专家间参考 |
|---|---|---|---|---|
| 40 句专家均分 | 皮尔逊相关越高越好 | 0.791 | 0.635 | 0.858 到 0.927 |
| 40 句专家均分 | 组内相关越高越好 | 0.659 | 0.593 | 不低于 0.846 |
| 40 句专家均分 | 平均绝对误差越低越好 | 0.79 | 0.94 | 0.38 到 0.56 量级 |
表后解释应增加新对照与适用条件。论文报告 Harf-Speech 对专家均值达到 0.791 皮尔逊相关和 0.659 组内相关,正负 1 分一致为 76.9%,并且对第一位和第 3 位专家分别达到 0.798 和 0.795,接近专家间范围的下限。相对 Azure,论文报告在均值上高出 0.156 皮尔逊相关、高出 0.066 组内相关,平均绝对误差从 0.94 降到 0.79。未胜出项需要指出,Azure 在个别子表中有精确一致略高的格子,且两系统在正负 1 分一致上同为 76.9%,说明 Harf-Speech 的优势主要在相关与误差而非所有离散一致指标。限制是 40 样本较小且多数集中在高分区,低分区证据少,因此相关系数可能受分布影响。
去掉哪一部分会怎样,论文给了什么反证?
严格意义上论文没有做逐模块剔除的消融表,因此不能说拿掉某个对齐或评分分支后必然怎样。能当作反证使用的是两类已验证对照。第一类是主干替换对照,同一验证子集上微调模型与零样本模型的错误率和实时率差距表明,若不做阿拉伯语音素监督微调,音素转写精度与可用性都会明显下降。第二类是系统替换对照,同一 40 句临床集上 Harf-Speech 与 Azure 的逐专家相关和误差差距表明,只用通用商业评分而不做本地音系优化与临床对齐,相关性会系统性偏低。
评分设计的内部分工也提供了机制层面的理解。最长公共子序列比率容忍孤立插入,编辑距离发音分惩罚替换、删除和插入,二者加权后系统对轻微冗余不过度扣分,但对实质音位错误仍会扣分。如果只保留其中之一,直觉上会出现宽容过度或严苛过度,但论文没有报告单分支分数,因此这只能作为待验证的推测,不能写成已测量的消融结论。
另一类失败条件是 Qwen2.5-Omni-7B 未能产生可用阿拉伯语音素输出。这不是精度高低问题,而是输出不可用,说明在细粒度音素转写任务上,通用多模态模型的词表约束与提示方式可能直接失效。复现时应把这类失败也记录为边界,而不是只保留胜出模型。
哪些结论尚未被测量,不能直接承诺?
首先是样本与分布限制。临床验证只用了 40 个样本,且散点显示多数样本集中在高分区,低分区样本少。3 位评分者是计算稳定一致性的最小配置,能够给出可靠性参考,但不能代表更广泛临床人群、年龄、方言和严重程度分布。因此 0.791 相关是报告值,不是普适保证。
其次是资源状态限制。本次收到的证据中资源状态为未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开。论文正文提到开放组件与补充材料,但按本次可核对原则,只能说补充材料中载明了采样细节、指标定义与提示词,具体链接可达性本次未能确认。复现前必须先核对原文链接与数据许可。
最后是未测量量。论文未报告误判率随噪声、麦克风、儿童语音或方言的变化,也未系统报告训练硬件预算与端到端临床延迟。实时率只反映音素识别阶段的推理耗时比,不能等同于从录音到分数的实际等待时间。总体趋势成立不等于每组每步都成立,引用时应使用报告显示、结果支持、机制可能待验证 3 层措辞加以区分。
要复现 Harf-Speech,最先做什么,先准备什么?
复现的第一步是重建两条音素序列。参考侧需要实现或获取现代标准阿拉伯语发音词典生成器,并复刻归一化步骤,包括去掉位置后缀与静音标记、合并双辅音、重映射词表外符号。录音侧需要准备一个可运行的语音转音素主干,论文的最优选择是微调后的 OmniASR-CTC-1B-v2,轻量替代是 Wav2Vec2。必须保留的关键超参数包括 Wav2Vec2 的有效批量 64、学习率 3e-5、权重衰减 0.01、训练 10 轮并按音素错误率选模,以及 OmniASR 训练 35k 步与每 1k 步验证的设置。
第二步是重建切分、对齐与评分。切分器用大语言模型以文本与音素序列为条件生成词级分组,对齐用编辑距离得到替换、删除与插入,最长公共子序列比率与发音分按 0.6 和 0.4 加权后再映射到 0 到 5 分。复现时应先用论文示例词做好准备的整句走通输入到表示再到组件再到目标最后到输出,再检查整句分与词级分解是否一致。
第三步是复核评估。音素识别用 500 样本子集上的音素错误率与实时率,临床对齐用独立 40 句上的皮尔逊相关、组内相关、平均绝对误差与正负 1 分一致。还需补做的验证包括扩大低分区样本、报告跨设备与跨方言表现、记录端到端延迟与标注成本,并明确区分代码开源、权重可下载与系统可运行三者的不同状态。
何时值得尝试这种路线,如何一句话记住它?
当任务同时要求细粒度可解释反馈与临床量表对齐时,值得尝试这种把识别与评分解耦的路线。它的好处是每一步都可检查,音素错在哪里、对齐算成什么、分数如何合成都有迹可循,便于临床专家核对。当只有高层流利度分数就够用,或者没有条件获得专家标注做对齐验证时,这套重型流水线的收益会打折扣。
常见的误解是把低音素错误率直接当成临床有效,或者把高相关当成分数可直接替代专家。论文的写法恰好避免了这两点,它用错误率选主干,用相关与一致证明临床对齐,并保留 Azure 作为实际可运行基线。记住它的方式是两条序列、两种对齐、2 次加权,两条序列指规范与实发,两种对齐指顺序保持与编辑距离,2 次加权指准确率与完整度的合成以及顺序分与发音分的合成。
回到中心判断,Harf-Speech 显示本地化微调加透明评分可以在小样本临床集上接近专家间一致的下限,但这仍是有限证据。下一步最需要的是更大更多样的临床样本、公开可运行的实现,以及对部署代价的完整测量。只有补齐这些,才能从可复述的方法走向可信赖的临床工具。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

