英文题目:HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems

会议身份:conference:interspeech:2026:conference-paper-id:baranski26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据标注 #语音 #语音识别

评分:7.4/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Mateusz Barański:机构信息未能从会议 PDF 纯文本可靠映射
  • Jan Jasiński:机构信息未能从会议 PDF 纯文本可靠映射
  • Julitta Bartolewska:机构信息未能从会议 PDF 纯文本可靠映射
  • Marcin Witkowski:机构信息未能从会议 PDF 纯文本可靠映射
  • Konrad Kowalczyk:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

自动语音识别(Automatic Speech Recognition,ASR)输入为真实自发财报录音,输出为转写文本,难点是幻觉(Hallucination)与普通语音错误交织,且在低词错率(Word Error Rate,WER)下依然出现。作者先用 7 模型平均模型间词错率筛选困难片段,再由双人独立标注加第三人仲裁完成幻觉、循环(Looping)与循环幻觉的跨度级标注并校正参考文本,接着用大语言模型(Large Language Model,LLM)五次投票估计严重度,最后按会议隔离划分训练与测试集并评测代理指标与解码器嵌入检测器。与以往在非语音或人工损坏语音上诱发幻觉不同,该链条保留自然语音错误模式并提供可复用检测基准。在 HALAS 上字符错率(Character Error Rate,CER)与语义代理分别达 81% 与 80% ROC-AUC(Receiver Operating Characteristic Area Under the Curve),单层解码器嵌入检测器 F1 为 53.1%,多层拼接提升至 56.1%,表明自然幻觉检测依然困难。该结论仅适用于英语财报领域经分歧富集的高难度短句,不反映真实部署幻觉发生率。原文未披露训练、推理与部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,要解决的困难为什么值得做数据集?

这篇论文的输入是真实的、无人工加噪的英语财报电话录音,目标是回答现代端到端语音识别是否会在自然语音上产生幻觉,以及这种幻觉能否被可靠检测。作者把幻觉定义为转写文本中与音频输入所说词语不对应的错误片段,范围从多余的填充词,到改变或矛盾原意的增添,再到同一词或短语的多次重复即循环。必须保留的关键信息是:以往的缓解与评估多用非语音或人工损坏音频,而自然语音上的发生情况尚未被研究;论文因此要做第一份人工标注的自然幻觉数据集,并提供可复现的划分与基准。

对于刚进入语音领域的读者,白话解释是:语音识别模型有时会脑补。即使音频里没有那句话,模型也会因为训练中见过太多类似句式而输出一句流利但不存在的话。比如音频只说了谢谢,模型却补出一整句感谢参加本次电话会议。这与普通的听错不同,听错至少还能在音频里找到发音相近的依据,而幻觉是没有语音依据的编造。论文要解决的学习依赖是:如果没有自然语音上的幻觉标签,任何检测方法都只能在非语音上自证有效,无法知道在真实部署中是否可用。

输出是一份名为 HALAS 的数据集、1 次对 7 个先进模型的定量与定性分析,以及一个检测基准。数据集以逗号分隔文件组织,每行对应一个 Earnings 22 音频样本,包含 7 个模型的预测、utterance 级标签和字符跨度标注,并给出按会议来源划分且按平均词错误率、幻觉率和时长分层的训练与测试划分。代码与补充材料当前可用,论文给出 GitHub 仓库地址,状态码为 200 可达,同时标注平台使用第三方开源工具。后续各节将按任务与路线、方法全景、标注细节、实验条件、结果与反证、复现建议展开,每一步都只讲论文实际做的动作。

已有检测路线在什么输入和监督下工作?

论文把已有幻觉检测分为需要参考文本的参考方法和不需要参考文本的非参考方法。参考方法例如用大语言模型比较预测与参考文本是否一致,非参考方法例如维护在非语音输入上最常出现的短语查找表,或对解码器特定层的嵌入做二分类。缓解路线包括用语音活动检测做音频预处理,或用无语音的噪声录音微调模型权重乃至自注意力头,让模型对无语音返回空转写。

同输入、同目标、同监督的对照是:这些方法都在非语音或人工损坏语音上评估。也就是说,它们的输入不是自然连续语音,目标是把明显异常的长插入找出来,监督要么依赖参考文本,要么依赖已知非语音。这与 HALAS 的输入不同,HALAS 的输入是真实自发语音,长度与质量各异,说话人来自 27 个国家。论文明确指出这种评估限制了实际适用性,而自然语音上的幻觉发生尚未被研究。

同运行阶段的对照也很重要。预处理与微调发生在解码之前或训练阶段,检测发生在解码之后。论文的基准同时覆盖解码后文本代理指标和解码器内部表示分类器,但不重新训练 7 个被测语音识别模型本身。理解这一点可以避免误解:HALAS 不是要证明某个降噪更好,而是提供自然语音上的标签,让任何阶段的方法都能在同一标签下比较。

要判定的问题是什么,什么不算幻觉?

论文要判定的问题是:给定一段自然语音和某个模型的原始预测,不看数据集自带的参考文本,只听音频,能否标出其中无语音对应的片段,并判断整句是否含幻觉。教学例子是:若音频说我们下季度见,预测多出谢谢参加几个词,而音频中没有任何类似发音,这几个词就是幻觉;若只是把季度听成季节,有发音接近的依据,则按标注指导属于语音错误而非幻觉。例子仅用于理解定义,不代表论文的统计数值。

标注指导明确要求只依据预测与音频的比较,不依据参考文本。原因是作者发现 Earnings 22 自带参考常有错误,若依赖参考会把参考错误误判为幻觉。为此设置了音频验证步骤:先听音频排查无语音、多人同时说话或主要非英语等情况,这类文件直接排除,避免标注歧义。然后对每个模型的预测再听 1 次音频,标出符合定义的词或短语,并打上幻觉、循环或幻觉循环 3 类标签之一。后两者的区别在于被重复的内容是否在语音中出现过。

问题还包括严重程度。论文借用大语言模型把每个幻觉分为轻微、中等或严重,轻微是低影响填充,中等是部分遮挡或语境偏移,严重是矛盾或改变含义。每个样本评估 5 次取多数投票。这种分级不是人工标签的替代,而是对标注后幻觉危害的补充分析,协议与提示词放在仓库中。

从原始电话录音到 HALAS 要走哪几步?

整体流程可以沿一个样本走完。输入是一段 Earnings 22 切分后的短音频,总时长 119 小时共 57390 段,第 5 与第 95 百分位时长分别为 0.6 秒和 17.6 秒。7 个模型分别用创建者默认参数做推理,得到七份原始预测。与此同时,原始音频也被送入难度筛选。只有筛选通过的候选音频及其原始预测才进入人工标注,经过 2 名独立标注加 1 名仲裁后形成 HALAS 的一行。

下图是论文给出的音频文件管线总览,先看文字导读再看图,之后结合正文解释复述动作。图中左侧是数据源,中间是模型与筛选,右侧是标注与成库,箭头区分了音频流与预测流。

看图路径: 1. 先从左侧 Earnings 22 沿 audio 箭头看到七个模型与音频选择框的主路径;2. 再看预测箭头如何与原始音频一起进入基于模型间词错误率的筛选;3. 最后看两名标注者与仲裁者如何汇入 HALAS

原论文 Figure 1:Diagram of audio file pipeline in HALAS creation.

论文图 1。原论文 Figure 1:“Diagram of audio file pipeline in HALAS creation.”。

该图显示左侧灰色 Earnings 22 框发出音频箭头,一路送给 7 个红色模型框,分别是 Wv2、Wv3、Wv3T、CrW、Can、CanF 和 Par,另一路音频直接送入紫色音频选择框。7 个模型的预测箭头也汇入同一紫色框,框内注明基于模型间词错误率。紫色框输出候选音频与预测,分别送给蓝色标注者 1 与黄色标注者 2,2 人结果再汇入红色仲裁者,最终指向绿色 HALAS 框。复述方法是:先并行获得多模型预测,再用分歧度选难例,最后用人审定标签。这个顺序保证了标注池富集幻觉,同时标签来自人听而非模型投票。

七个被测模型和难度筛选具体怎么算?

7 个模型是论文在 2025 年 6 月 1 日时参考开放语音识别榜单选出的低词错误率先进模型,包括 OpenAI Whisper 的 4 个版本 large v3、large v3 Turbo、large v2 和微调变体 Crisper Whisper,以及 Nvidia Nemo 的 Canary-1B、Canary-1B-Flash 和 Parakeet-TDT v2。论文说明据其所知这些模型训练时未用过 Earnings 22,推理用各自公开实现与默认参数,对全部数据集运行。这一交代是为了说明幻觉不是因为在测试集上训练过或参数调偏,而是零样本泛化下的自然行为。

幻觉 × 语音错误: 幻觉指与音频无语音对应关系的预测片段,语音错误则包括可找到语音来源但听错的音近错误,二者分工在于前者检验模型是否凭语言先验编造,后者检验声学辨别能力,搭配理由是只看词错误率会把两类混在一起,组合意义是标注时要求只听音频判定有无语音对应,从而把编造与听错分开统计。

难度筛选的计算目标是挑出模型间分歧最大的片段。步骤是:先丢弃 E22 中标记为听不清与外语的文件;为防止重复循环主导分歧度量,先去除相同词或短语的重复,再用基础文本归一器归一化所有预测;然后对每段音频计算所有模型两两之间平均模型间词错误率,把其中一个模型预测当作另一个的参考;最后按该值降序取顶部作为候选。关键是去除重复与归一化只用于计算度量,送标注的仍是原始预测,保持标签面对的是用户真实看到的文本。

标注者听到什么、标什么,一致性如何?

标注由 10 名付费专业标注者完成,要求英语 B2 以上。标注者对每段音频先做音频验证,再对每个模型的预测听音标注。标注只标词或短语的文字与字母跨度,并给出 utterance 级标签。仲裁者除裁决分歧外,还复查并修正了全部参考文本,把语音内容无法辨清的 14% 样本记为听不清。这一步说明论文的人工参考比原始数据集参考更可靠,但也意味着部分极难样本无法用于需要参考的指标。

循环 × 幻觉: 循环指对音频中真实出现过的词或短语不正常重复,幻觉指重复的内容本身在音频中并不存在,二者分工是区分重复的来源是否真实,搭配理由是两者在文本上都表现为重复但成因不同,组合意义是让标注能判断重复是解码停不下来还是先编造再重复编造。

一致性方面,初始双人标注的 Cohen kappa 为 0.87,属于高度一致。论文同时提醒 HALAS 是有意富集幻觉的采样,分歧大的难例被优先选中,因此数据集不反映真实部署中的幻觉频率。但标注的幻觉仍来自真实语音录音,能保留自然错误模式。这个提醒很重要:不能把训练划分中 33.6% 或测试划分中 22.6% 的幻觉率直接解读为线上事故率,它们是为训练与评估检测器而构造的难度分布。

本研究训练了什么,没有训练什么?

本研究没有训练 7 个被测语音识别模型,也没有微调它们的声学或语言权重。7 个模型只做推理,参数冻结,推理开销与训练预算不在论文报告范围内。论文实际训练的是用于检测幻觉的轻量分类器。

模型间词错误率 × 候选筛选: 模型间词错误率指把 7 个模型的预测两两互为参考计算平均词错误率,候选筛选指按该值从大到小取顶部片段送标注,二者分工是前者提供难度代理信号、后者执行截断取样,搭配理由是同一音频下分歧越大越可能是困难样本,组合意义是用无参考的方式富集幻觉而不必先知道正确答案。

真实计算过程有两类。一类是文本代理指标上的 XGBoost 分类器,输入是 7 个文本代理指标,分别在 3 种数据机制下训练:只用目标模型自身训练数据、只用其他 6 个模型训练数据而目标模型不见、以及用全部训练数据。另一类是解码器嵌入上的逻辑回归分类器,复现已有工作的做法,取 Whisper large v3 解码器生成结束符后第 21 层嵌入做 utterance 级分类,再扩展为拼接第 2、13、23 层嵌入的多层版本。逻辑回归的权重与偏置只在 HALAS 训练划分上拟合,测试划分用于评估。这种安排让论文能检验跨模型泛化:用其他模型数据训练的检测器能否用于未见过的新模型。

未报告的缺项是分类器的超参数搜索细节、训练时长与硬件配置,论文只说明方法来源与拟合数据划分。不能从冻结被测模型推定检测器输出确定,也不能把无训练的被测模型等同于确定性求解,因为解码仍受默认采样与实现影响。

数据划分、指标与比较条件如何保证公平?

数据划分为按来源会议切分,并按平均词错误率、幻觉率与时长分层,保证同一会议不跨划分泄漏。测试集进一步过滤,只保留时长超过 1.0 秒且至少 3 个词的音频,以获得稳定评估。下表是论文报告的划分规模与难度,比较问题是训练与测试在时长与幻觉富集上有何差异,公平条件是同一音频来源不重叠,指标方向是幻觉率越高表示检测任务中正例越多而非模型越差。

划分文件数P5 [s]P95 [s]HR [%]
train28660.268.0233.6
test7451.2212.1522.6

上表显示训练集 2866 段、测试集 745 段,测试集第 5 百分位 1.22 秒、第 95 百分位 12.15 秒,长于训练集的 0.26 秒与 8.02 秒,幻觉率 22.6% 低于训练集 33.6%。主要含义是测试集更长、更完整,适合稳定评估,而训练集更短、更难,适合学习难例。代价是两者时长分布不一致,不能把两划分的绝对指标直接对比为模型进步。论文同时报告全量 3611 段的来源,以及各模型在 HALAS 上的词错误率在 31.46% 到 110.5% 之间,说明筛选后的音频确实困难。百分点与相对百分比在此不同,幻觉率的差值应读作百分点差而非相对变化。

指标方面,代理指标用 ROC 曲线下面积,越高表示用该指标值直接预测幻觉的能力越强;检测器用准确率、精确率、召回率与 F1,F1 越高表示在不平衡标签下综合越好。跨模型实验对每个模型重复 3 种训练机制并平均,保证比较时目标模型的数据可见性是唯一变量。

自然语音上的幻觉有多普遍,词错误率能抓住吗?

论文报告所有被测模型都在 HALAS 音频上产生幻觉,utterance 级幻觉率在 21.4% 到 43.8% 之间,平均约 30.9%,循环平均仅 1.1%。各模型标注错误数平均 1105 条,其中 Wv2 最多 1518 条,CrW 最少 772 条。词错误率从 31.46% 到 110.5% 不等,CanF 因超长插入达到 110.5%。这些是论文直接报告的数字,支持的判断是自然语音上幻觉确实存在且不罕见,但因数据集是富集采样,不能推广为线上频率。

字符错误率 × 语义相似度: 字符错误率负责度量字面结构偏离,语义相似度如 BERTScore 与 SeMaScore 负责度量意思偏离,二者分工是分别捕捉拼写层与含义层的差异,搭配理由是幻觉可能字面很短但含义大变,组合意义是论文把两类指标都当作幻觉探测器来画 ROC,从而检验哪一层更接近人工标签。

下图比较有无幻觉两类在词错误率与语义分上的分布,先看导读再看像素,之后解释为何常用指标不够用。

看图路径: 1. 先对比上方面板词错误率中灰色无幻觉与红色有幻觉的重叠区间;2. 再看右上角 0-80% 放大区在低词错误率处仍有红色分布;3. 最后看下面板 BERTScore 在 0.80 到 0.95 区间的两类重叠

原论文 Figure 2:All model WER (top) and BERTScore (bottom) distri- bution.

论文图 2。原论文 Figure 2:“All model WER (top) and BERTScore (bottom) distri- bution. Extreme WER aggregated in 250+ overflow bin.”。

该图上方面板横轴为词错误率百分比,纵轴为占比百分比,灰色为无幻觉、红色为有幻觉,极端值归入 250% 以上溢出柱,并对 0 到 80% 做放大。可见两类在 50% 到 80% 及 100% 附近高度重叠,幻觉甚至出现在低至 6.25% 的低词错误率处,只有在 200% 与 250% 以上溢出柱中幻觉因灾难性长插入才凸显,100% 整数倍处的峰是短音频少词导致的人工假象。下面板横轴为 BERTScore,纵轴为占比,幻觉整体左移但在 0.80 到 0.95 区间仍与无幻觉大量重叠。含义是结构与语义指标都不能仅靠阈值可靠分离幻觉,几乎转对的句子也可能含幻觉。

幻觉文本分布进一步显示每模型高度偏向少数高频短语,平均 55% 标注幻觉来自各自前 10 短语,前 30 覆盖 75%。13 个短语出现在所有模型中,包括 you、thank you、good 等,跨模型 Jensen-Shannon 相似度显示 Whisper 三者高于 0.84,Par 则较离群。严重程度方面,Par、CrW 与 Wv3 以轻微插入为主但仍有超 25% 严重错误,CanF、Can 与 Wv2 严重率超 38%,中等最少,呈现要么无害填充要么严重改意的两极。

七个代理指标与先进检测器各能走多远?

论文把 7 个文本代理指标值直接当作幻觉预测器,在全部 7 模型预测上画 ROC。字符错误率与 SeMaScore 略优,提示结合结构与语义可能更好,而困惑度与长度比仅 0.60 与 0.62,说明 HALAS 中的幻觉往往流利且简洁,无法靠简单启发式识别。下图是跨全部模型的 ROC 曲线,导读后看图再解释相对高低。

看图路径: 1. 先确认横轴是误报率、纵轴是真正率,对角虚线为随机基线;2. 再比较 CER 与 SeMa 曲线在左上区域的位置与其他曲线的高低;3. 最后看 PPL 与 Length 曲线贴近对角线的程度

原论文 Figure 5:ROC curves and AUC scores for various hallucination metrics across all ASR models.

论文图 3。原论文 Figure 5:“ROC curves and AUC scores for various hallucination metrics across all ASR models.”。

该图横轴为误报率、纵轴为真正率,图例给出 CER 0.81、Sema 0.80、BERT 0.77、插入率 0.73、WER 0.72、长度比 0.62、困惑度 0.60。可见黄色 CER 与紫色 Sema 在左上区域最高,绿色 BERT 紧随,蓝色插入率与浅蓝 WER 居中,黑色长度与橙色困惑度贴近对角线。纵轴是原始真正率而非改善量,曲线越高表示同一误报下抓住更多幻觉。论文进一步用 XGBoost 组合七指标,平均 ROC-AUC 在自身数据为 0.829、其他模型数据为 0.828、全部数据为 0.835,其他模型数据与自身持平说明可泛化到未见模型,全部数据更高说明多模型标注有额外预测价值。

解码器嵌入 × 逻辑回归分类器: 解码器嵌入指 Whisper large v3 解码器在生成结束符后特定层的隐藏向量,逻辑回归分类器负责把该向量映射为有无幻觉的 utterance 级判断,二者分工是前者提供模型内部信心与生成状态,后者提供可训练的轻量决策边界,搭配理由是不需要参考文本即可利用内部表示,组合意义是把单层扩展为 2、13、23 层拼接后提升召回与跨域泛化。

先进方法在 Whisper large v3 测试划分上的比较问题是:在有人类标签的自然语音上,参考式大模型判断与非参考式内部表示谁更准,公平条件是同一测试划分与同一 utterance 标签,指标方向是 F1 越高越好。下表整理论文报告的可运行策略数字,另行说明的跨域结果放在表后。

检测器Acc.Prec.Rec.F1
GPT-4o mini71.730.162.640.7
Gemini 2.0 Flash84.550.035.741.6
DE 2187.157.849.153.1
DE 2,13,2386.453.958.556.1

上表显示即使大模型可直接看到参考文本,GPT-4o mini 精确率仅 30.1% 而召回 62.6%,Gemini 2.0 Flash 精确率 50.0% 而召回仅 35.7%,F1 约 40 到 41%。非参考的单层解码器嵌入 F1 为 53.1%,多层拼接后召回从 49.1% 升至 58.5%,F1 达 56.1% 最高。用全部指标组合的 XGBoost 在全部数据上 F1 为 55.4%,用其他模型数据训练仍有 53.4%,支持跨模型泛化。未胜出项是大模型判断:有参考仍低分说明自然幻觉的细微编造难以仅靠文本对比发现。跨域上,在非语音增强数据上多层检测器 F1 达 77.3%、单层 72.4%,高于在 HALAS 上的分数,说明 HALAS 更难且训练出的检测器可泛化。

哪些结论有边界,什么还不能说?

论文明确标注的边界是 HALAS 不反映真实幻觉频率,因为候选按模型间分歧从顶部选取,难例被放大。测试集虽经长度与词数过滤更稳定,但时长分布与训练集不同,跨划分比较需谨慎。14% 样本被仲裁者记为听不清,说明极难音频的参考本身不可靠,需要参考的指标在这些样本上可能失真。

未验证的推测需用可能表述。幻觉文本跨模型相似可能与常见礼貌用语与训练偏置有关,但论文未做因果实验,只能说分布支持这一方向,待验证。严重程度由 GPT-4o mini 5 次多数投票给出,Fleiss kappa 高于 0.79 显示模型自洽,但这不是人类严重性标签,不能当作人评。相关性不等于因果,低词错误率处仍有幻觉不等于词错误率无用,只是说明阈值法不够。

未测量的量不能承诺改善。论文未报告检测器的延迟、误报成本、训练资源与推理开销,也未评估预处理或微调缓解在 HALAS 上的效果,因此不能说多层嵌入检测更快或更便宜。总体趋势不等于每组都成立,例如 Par 幻觉分布更偏、CanF 词错误率异常高,平均数会掩盖单模型特性,使用时应分模型查看。

要复现应先准备什么,按什么顺序跑?

复现先做三件事。第一,从当前可用的 GitHub 仓库获取 HALAS 的逗号分隔文件与补充材料,包括各模型的提交哈希与推理参数,以及严重性评估的完整提示词;HuggingFace 镜像也在论文中给出。第二,从公开渠道获取 Earnings 22 音频,按文件名中的段与文件标识对齐,注意论文已丢弃标记为听不清与外语的文件。第三,确认 7 个模型的公开实现来源,其中 Crisper Whisper 与 large v2 用 Hugging Face 实现,其余用 GitHub 版本,均用创建者默认参数推理。

运行顺序是:先用基础文本归一器复算模型间词错误率并复现候选排序逻辑,注意去除重复与归一化只用于计算;再加载 HALAS 训练与测试划分,按来源会议不泄漏的原则检查切分;然后复现代理指标的 ROC 与 XGBoost 3 种机制,以及 Whisper large v3 第 21 层与第 2、13、23 层拼接的逻辑回归。评估时用 utterance 级标签算准确率、精确率、召回率与 F1,用指标值直接预测时算 ROC-AUC。标注工具方面,论文致谢 HumanSignal 允许使用其平台,第三方标注平台当前可用,复现标注需招募英语 B2 以上标注者并执行双人加仲裁流程。

需保留的关键超参数与信息条件是:标注时只听音频不定参考、循环三分类的定义、测试集大于 1.0 秒且至少三词的过滤、逻辑回归拟合仅用训练划分。若要测跨域,需用已有非语音增强数据集并把相对参考的任何插入视为幻觉,再套用同一检测器。

何时值得尝试 HALAS,下一步还需补什么验证?

当你的任务是自然语音上的幻觉检测而非非语音空转写时,值得尝试 HALAS。它的价值在于提供真实语音、7 模型覆盖、字符跨度与 utterance 2 级标签,以及按会议切分的稳定测试集。论文显示字符与语义指标约 0.81 与 0.80 的 ROC-AUC,多层内部表示 F1 为 56.1%,说明问题具有挑战性但可用多模型数据训练出可泛化的检测器,其他模型数据训练的组合指标 F1 达 53.4% 就是证据。

实践建议是:先用全部数据的 XGBoost 或多层嵌入基线做起点,再结合字符与语义两类特征;不要只用长度或困惑度做阈值,因为它们在 HALAS 上接近随机;对短音频的 100% 整数倍峰与 250% 以上溢出柱要单独处理,避免被极端插入误导阈值。若部署新模型,可先用其他 6 模型数据训练检测器,再用少量本模型标注校准,因为论文显示跨模型机制与自身机制持平。

还需补的验证包括:在未富集的随机部署流上测误报率与校准,补充延迟与计算成本,评估语音活动检测与微调缓解在自然幻觉上的真实收益,以及用人评复核严重程度分级。常见误解是把幻觉率高读作模型差,把自动语义分高读作无幻觉,把跨域 77.3% 的 F1 读作问题已解决;论文的实际含义是高幻觉率来自难例富集,语义分在 0.80 到 0.95 仍大量重叠,跨域更高恰说明自然语音更难。回到中心矛盾:流利不等于忠实,HALAS 让这种不忠实在自然语音上可被核对与复述。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总