英文题目:HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.1797
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准设计 #环境声 #音乐 #语音 #音频问答
评分:7.8/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Feiyu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Yiming Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Wenhuan Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Daipeng Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xianghu Yue:机构信息未能从会议 PDF 纯文本可靠映射
- Jianguo Wei:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
大音频语言模型需对语音、环境声与音乐片段回答二元判断、计数、多标签与开放式问题,难点在于流畅回答常缺乏声学支撑,且时序比较、缺席证据推理与偏差拒答难以用单一准确率诊断。HalluAudio先从Common Voice、FSD50K与音乐语料筛选音频并对齐标注,输出干净可控的候选片段进入任务构造。接着以参数化模板按域实例化时序比较、感知识别与一致性任务,并施加混合音频与缺席证据无效查询做对比对抗增强,形成受控正负样本对。随后经自动过滤与多轮人工核验打包为5720对平衡问答,再走统一零样本推理,经输出归一、有效性校验与行为分析得到准确率、肯定偏置与拒答诊断。与仅约1K二分类的AHa-Bench不同,该设计以受控对比与扰动一致性分离能力错误与幻觉,并实现二元、计数与开放式多格式及偏差拒答多维诊断。在HalluAudio声音基准下,Qwen2.5-Omni在响度比较任务上的准确率为92.77%,高于其在共存判断任务上的61.68%。该结论适用边界受限于英语短片段模板问答,尚未验证长音频、多轮对话与多语言外推,且开放式问答占比较小。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/Feiyuzhao25/halluaudio — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
这篇解读的输入是 HalluAudio 论文正文与本次收到的官方原图像素,目标是让刚进入语音、音乐、音频方向的研究生能复述该基准如何构造、如何评测、如何下结论。必须保留的信息包括三域划分、任务类型、5 步构造流水线、零样本统一评测协议、准确率之外的偏差与拒绝指标、以及开源代码当前可用的状态。输出是 1 篇可核对的方法复述,不做营销式判断,不补写原文没有的数值效果。
白话先讲两个关键术语。大音频语言模型(Large Audio-Language Model,简称 LALM)指把音频编码器与大语言模型对齐,能听语音、环境声、音乐并用文本回答的系统。音频幻觉指模型生成的主张得不到输入音频证据支持,包括编造不存在事件、与确定性声学结构矛盾、在证据不足时仍作肯定回答 3 种代表情形。论文把幻觉与一般能力错误区分开,后者如推理太难或输入本身模糊,前者强调有明确音频答案却答错或硬答。
大音频语言模型 × 音频幻觉: 大音频语言模型负责把语音、环境声、音乐编码后交给语言模型生成文本回答,音频幻觉则指该回答中出现输入声学证据不支持的主张,二者搭配的原因是前者 fluency 强而接地弱,后者正是要把不支持的主张从一般能力错误中分离出来单独度量,组合意义在于把评测焦点从能答多少转向回答是否有声学依据。
论文报告的核心矛盾是能力评测与可靠性评测脱节。在标准音频基准上表现强的模型,在受控的缺席证据、扰动属性、混合音频条件下仍出现系统性幻觉。HalluAudio 因此不是再做一个通用问答集,而是做一个能诱发幻觉、能分域分任务定位失败模式的诊断工具。代码资源状态为可用,地址为原文给出的 GitHub 仓库,本次解读写作时按可用处理。
已有路线走到哪里,为什么还缺音频幻觉基准?
第一条路线是大音频语言模型本身。从离散音频词元建模,到把音频编码器与语言模型对齐,再到支持识别、问答、描述、音乐理解与指令跟随,系统形态从转写工具走向通用音频推理模型。已有能力基准覆盖多音频处理、语音助手等方面,但可靠性特别是幻觉维度报告很少。
第二条路线是文本与视觉幻觉研究。文本侧已揭示流利但无依据的生成,视觉侧已讨论物体幻觉与跨模态一致性,方法上常用二值判断、偏差分析与对抗扰动。音频侧起步较晚,早期工作指出词错误率发现不了流利但语义无关的识别错误,也有小规模二值问答基准尝试把幻觉引入音频评测。
论文对已有音频幻觉工作的判断是规模小、模态覆盖窄、任务单一、诊断深度不足。具体缺的是统一分类体系、受控对比音频对、多格式评测任务与大规模人工标注评估。HalluAudio 的定位就是补这块缺口,跨语音、环境声、音乐三域,同时支持二值判断、多选推理、属性验证与开放问答,并引入对抗提示与混合音频条件。教学例子是只听一段火车经过声却问是否含雷声,若模型答是,就是典型的感知幻觉,与视觉中把不存在物体说成存在的做法同目标、同监督思想,但运行在音频证据上。
论文到底要解决哪个可操作的问题?
论文要解决的问题是给定一段音频与一个自然语言问题,判断模型的文本回答是否被声学证据支持,并在三域多任务上定位是哪类支持失败。输入是原始音频字节与参数化模板生成的问题,输出是归一化后的结构化判定与行为分类。任务包含 3 类幻觉敏感维度。结构与时间幻觉由时序比较任务检验,如顺序、重叠、计数、语速与响度比较。感知幻觉由识别任务检验,如事件存在、乐器与流派、语音或音乐判别。语义幻觉由一致性任务检验,如转录匹配在删除或交换扰动下是否前后矛盾。
结构幻觉 × 感知幻觉: 结构幻觉负责描述对顺序、时长、次数、响度等可判定声学结构的错误主张,感知幻觉负责描述对声音事件或音乐元素有无与属性的错误断言,二者分工是把时间推理错误与存在判断错误分开,搭配原因是两类错误需要不同的对比构造来诱发,组合后才能对应到时序比较、识别与一致性 3 类任务设计。
这个问题之所以需要新基准,是因为常规问答集大多是有效可答问题,模型靠语言先验也能蒙对。HalluAudio 特意加入对比与对抗构造,使部分问题故意缺乏充分音频支持,用来检验过度自信的肯定回答与过度保守的错误拒绝。论文报告对比任务占 2662 对,显式对抗或无效查询占 621 对,合计超过一半被设计为通过受控扰动或证据缺席来探测幻觉,这与传统以有效查询为主的分布不同。
HalluAudio 全景:一个样本走完输入到判定需要哪几步?
先沿一个样本走全程。假设输入是一段含两段声音的录音,问题是哪段更响。音频与问题先按统一零样本协议送入被测模型,模型生成自由文本,可能是不确定、拒答或直接给第一段更响等多种表述。评测引擎先做输出类型归一化,把大小写、标点与冗余空白统一,把二值表述映射为是或否,把计数表述抽取数字,把无法作答表述映射为统一拒绝标签。再做有效性检查,对照音频、任务定义与真值判定是否有效。最后做行为分析,把错误输出分流为肯定或否定偏置、错误拒绝与其他错误,并按域与任务聚合。
该流程的安排理由在原文有明确交代。受控多域音频构造保证证据可判定,统一提示保证跨模型条件一致,结构化输出验证保证异构自由文本可公平比较。图 1 把这 3 段画成从左到右的模块化流水线,左侧是三域音频构造,中间是提示与模型推理,右侧是归一化、校验与分析。
看图路径: 1. 先从左到右走主路径:三域音频构造到统一提示再到模型最后到分析;2. 看中间黄色块如何把参数化提示约束为二值、计数、多标签与无效查询四种输出;3. 看右侧蓝色块如何把自由文本先归一化再做有效性判定最后分流为偏差与拒答;4. 注意中间红色生成回答与绿色期望回答的对比示例表达的判定逻辑
论文图 1。原论文 Figure 1:“Overview of the HalluAudio framework.”。
从像素看,图 1 左侧粉色大块按语音、环境声、音乐纵向排列,分别列出干净与重叠语音、语速响度,单声音、共现声音、缺席声音,多歌手流派、多乐器、语音音乐等构造。中间黄色大块上部是模板化参数提示、域感知实例化与受控答案格式,下部是二值是否、数值计数、多标签分类与故意无效查询,底部注明零样本推理与统一评测协议,右侧给出响度比较的生成回答与期望回答对照。右侧蓝色大块自上而下是输出类型归一化、有效性检查、行为分析,错误输出分出肯定否定偏置、错误拒绝与其他错误。理解这张图就能复述方法主路径,后续小节分别展开构造、提示、归一化与指标。
诱发机制:对抗提示与混合音频各自改什么?
对抗提示在文本侧动手。做法是为每类任务写带槽位的参数化模板,槽位用音频标注实例化为有效查询,或用故意错配的属性实例化为无效查询。改法包括对抗否定、无效查询与属性级扰动。例如语音域问男性说了什么而音频实际只有女性说话,环境声域问是否含随机标签声音而该声音并不存在,音乐域做乐器与流派错配。这些问题故意缺乏充分音频支持,用来检验模型是承认不确定还是编出流利答案。
混合音频条件在信号侧动手。做法是选择覆盖多说话人、富事件声音与结构化音乐片段的录音,构造重叠、共现、顺序、响度对比等需要细粒度分辨的条件。例如两说话人是否重叠,汽车与风声是否同时出现,两种打击乐音色先后顺序。两类机制必须配合。
对抗提示 × 混合音频条件: 对抗提示负责在文本侧改槽位、换属性、构造不存在事件或无效问题,混合音频条件负责在信号侧叠加说话人、共现事件与响度对比,二者搭配的理由是只改一侧无法区分是语言先验在猜还是听觉分辨失败,组合后形成最小对比对,使肯定偏置与证据矛盾能被定位到触发条件。
从实现看,每个数据实例包含问题、答案、音频文件名与原始音频字节四字段,模型直接消费原始音频而非中间特征。有效查询保证仅凭音频证据可答,无效查询故意引用音频中缺席的属性。所有实例经自动脚本校验问题、答案空间与音频内容的一致性,再进入人工校验。这种设计使幻觉触发条件可复现,研究者换模型重跑同一音频问题对即可比较。
没有模型训练时,这个基准实际构造了什么?
本研究没有训练任何被测大音频语言模型,该节对应的是数据集构造与标注流程,不是神经网络优化。因此不存在参数冻结与更新、梯度路径、学习率与重置时机的报告,解读不从模型名称推定实现。实际计算过程是 5 步流水线。第一步音频选择,从 Common Voice、FSD50K、GTZAN 与 Mridangam 系列等来源按可靠标注挑选多条件片段。第二步模板化提示生成,为每任务设计参数化模板并实例化。
第三步对比与对抗构造,对提示或音频属性做最小修改形成正负对照。第四步验证与质量控制,先自动生成大候选池,再经 2 名独立标注人与 1 名高级评审做 3 轮校验,检查音频问题对齐、真值正确与诱发条件有效,分歧用多数投票加高级评审裁决,持续歧义则修订或丢弃。第 5 步打包与均衡,按域、任务与幻觉类别平衡分布。
模板化参数提示 × 人工校验: 模板化参数提示负责用带槽位的统一句式大规模生成音频问题对,保证任务语义可控且覆盖计数、排序、存在、比较等类型,人工校验负责检查音频与问题对齐、答案正确与诱发条件是否成立并修订或丢弃歧义样本,搭配原因是自动生成保规模而人工保接地,组合意义是得到既大规模又可复现的幻觉诊断集而非普通问答集。
图 2 展示任务构成的细节,中心是三域占比,外圈是细任务扇区,引线给出具体问法与音频依据,是理解分布是否均衡的最直接材料。
看图路径: 1. 先看中心圆的三域占比与内圈时间比较、识别、一致性三类划分;2. 再看外圈每个细任务扇区的名称与引线给出的问法和括号内音频依据;3. 对比左右两侧无效查询的答案标注方式如无女性说话时答 None
论文图 2。原论文 Figure 2:“Detailed task composition of the HalluAudio dataset across speech, sound, and music domains.”。
从像素看,图 2 是环形旭日图,中心标注语音约 37%、音乐 30%、其余为环境声,内圈是时间比较、识别、一致性 3 类,中圈外圈展开为重叠检查、词序、计数、速度响度比较、声音存在共存、多标签检查、乐器识别、流派匹配等。引线例子包括哪段更响、汽车与风是否同现、是否含雷声而实际是火车经过、词 apple 是否在 pink 之前、男声问题而实际是女声说话、ok 出现 3 次的计数等,红色标注正确答案位置。这种可视化说明每个扇区都有明确的音频依据写法,复现时应先按图核对任务清单再按表核对数量。
论文还报告模板改写稳健性检查。随机抽 1000 对跨三域样本做语义等价改写,在相同推理设置下测 5 个代表模型,原提示与改写提示的绝对差异在 0.2% 到 1.8% 之间,平均约 0.7%,支持性能差异主要来自任务结构与声学推理而非措辞。解读把该结果记为支持而非证明,因为只覆盖抽样子集与 5 个模型。
评测条件:测谁、怎么问、用什么尺子量?
被测对象覆盖开源与闭源。开源包括 Qwen 系列音频模型、Llama-Omni 系列、Kimi-Audio、Phi-4-Multimodal、Audio Flamingo 3、Music-Flamingo、Pengi、MiMo-Audio、Step-Audio-2 等,闭源包括 GPT-4o-Audio 与 Gemini-2.5-Flash。不同模型按各自侧重被安排到不同域,细节见原文模型域对照表。所有模型用统一零样本协议测 3 次取平均,以保证统计稳定性。
尺子不止准确率。准确率按域统计有明确真值提示中答对的比例。是否偏置检验用 3 个互补量:肯定预测比例、无关错误比例与条件准确率,用来诊断无支持肯定回答的系统性偏向。错误拒绝率统计有有效真值却被模型拒答的比例,反映过度保守的幻觉模式。输出归一化先转小写去标点,把二值映射为是否,把计数抽数字,把无法作答映射为统一拒绝,再计算指标。
下表整理语音域 3 个示例任务的规模与问法,比较问题是同域内不同推理负担的任务是否都需要单独报告,公平条件是同一音频来源与同一归一化流程,指标方向是样本数越大覆盖越稳而非越大越好。表前这段提出比较问题,表后一段解释取舍。
| 领域 | 任务 | 样本数 | 提示模板要点 | 是否开放问答 |
|---|---|---|---|---|
| 语音 | 重叠检查 | 189 | 两说话人声音是否重叠 | 否 |
| 语音 | 词序 | 245 | 词 AAA 是否在词 BBB 之前 | 否 |
| 语音 | 二值计数 | 156 | 说话人是否说了 XXX 次 AAA | 否 |
上表说明语音域同时包含重叠、排序与计数 3 种结构负担不同的任务,若只报告平均准确率会掩盖计数与排序上的结构幻觉。代价是细任务样本量有限,单任务波动较大,因此原文同时报告多任务平均与分任务准确率。未胜出项在后续结果中可见,如部分模型在重叠上尚可但在计数上崩塌,复现时应保留分任务表而不能只看平均。
第二张表整理环境声与音乐的对照任务,比较问题是跨域同为存在与顺序判断时证据形式是否相同,公平条件仍是统一零样本与同一归一化,指标方向同上。
| 领域 | 任务 | 样本数 | 提示模板要点 | 是否开放问答 |
|---|---|---|---|---|
| 环境声 | 重叠检查 | 254 | 标签 1 与标签 2 是否重叠 | 否 |
| 环境声 | 声音顺序 | 300 | 标签 1 是否在标签 2 之前 | 否 |
| 音乐 | 流派匹配 | 291 | 是否为给定标签音乐 | 否 |
该表显示环境声强调存在、共现与对抗否定,音乐强调乐器流派识别与比较推理。收益是能检验缺席证据推理,代价是环境声否定证据需从无事件中推断,对肯定偏置更敏感。复现时需注意无效查询与错配标签的构造比例,否则跨域比较不公平。
主结果:哪个域的哪类任务最先暴露幻觉?
论文报告幻觉行为高度依赖任务与域,没有模型全域稳健。语音域结构幻觉重创计数与排序等时间任务,MiMo-Audio 与 Step-Audio-2 相对较好,Qwen-Audio、Llama-Omni 与 Pengi 在多个子任务低于 50%。语义幻觉出现在转录相关提示,Phi-4-Multimodal 在噪声与性别扰动下退化,Kimi-Audio 识别不一致。GPT-4o-Audio 总体较均衡但细粒度感知仍弱。环境声域感知与结构幻觉在多标签、共存与对抗否定设置下放大,MiMo-Audio 与 Qwen2.5-Omni 相对稳定。音乐域模型分化最大,GPT-4o-Audio 与 MiMo-Audio 在高层语义查询较稳,但多数模型在计数与顺序等结构时间推理上困难,Qwen2-Audio 与 Gemini-2.5-Flash 接近随机或出现拒答尖峰。
肯定偏置 × 错误拒绝: 肯定偏置指证据不足或矛盾时模型仍倾向回答是,错误拒绝指有明确正确答案时模型仍以无法获取音频或信息不足为由拒答,二者分工是分别刻画过于自信与过于保守两种可靠性失效,搭配原因是只看准确率会把两种相反失效互相抵消,组合意义是要求同时报告是偏、条件准确率与拒绝率才能还原失败模式。
肯定偏置分析显示 Qwen2-Audio 与 Kimi-Audio 在语音与环境声上持续过度预测肯定回答,在排序与计数上偏斜最强,呈域无关偏置。无关错误比例则显示肯定偏置不必然等于语义无关错误,Qwen 系列无关比例相对低,Pengi 与 Audio Flamingo 3 在交换与删除扰动下接地明显变弱。条件准确率揭示不对称决策,强肯定偏置模型在正例上准而在负例上差,Phi-4-Multimodal 更均衡但偏保守。总体肯定偏置在环境声最突出,因为否定证据必须从声学事件缺席中推断。
错误拒绝不是统一的安全行为而是独立幻觉模式。语音域拒答集中在计数、语速与响度比较等结构 demanding 任务,Qwen2-Audio 在计数与速度上极端拒答,Gemini-2.5-Flash 跨多数任务持续高拒答,Phi-4-Multimodal、Kimi-Audio、MiMo-Audio 与 Step-Audio-2 接近零拒答。环境声拒答反映感知不确定而非任务复杂度,Qwen2-Audio 在共存与响度上尖峰,Gemini-2.5-Flash 依然广泛拒答。图 4 把这种分任务拒答频率画成热图,是复现拒答分析的关键对照。
看图路径: 1. 先看上半语音热图的横轴模型与纵轴任务的网格结构;2. 找出颜色最深的两个格子并读出其任务名与对应模型的拒答数值;3. 再看下半环境声热图最右侧一列是否整体偏深并对比左侧多数接近零的列
论文图 4。原论文 Figure 4:“False Refusal Rate in speech and environmen- tal sound domains.”。
从像素看,图 4 上下两块热图分别对应语音与环境声,横轴为模型、纵轴为任务,颜色越深数值越大。上块语音中 Qwen2-Audio 列在精确计数格标 79.6、速度格标 71.2、响度格标 100.0,最右侧 Gemini-2.5-Flash 列在重叠 55.7、顺序 37.8、计数 45.8 等多格显著偏深,其余多数列接近 0.0。下块环境声中 Gemini-2.5-Flash 列在响度 74.9、存在 53.4、错配 48.5 等格偏深,Qwen2-Audio 在共存格出现 21.4 的局部尖峰。解读是过度拒答集中在 2 个模型,而多数模型在对抗否定下仍保持低拒答,说明拒答策略差异大于任务本身难度。
反证与失败条件:去掉接地后模型靠什么在答?
论文用 3 类定性失败补足数字平均数。第一类是幻觉肯定回答,音频中无可懂语音而多模型仍生成流利具体转录,从日常短句到长篇无关陈述都有,语言形式良好但无声学依据,说明模型在感知不确定下默认调用语言先验而非接地拒答。开放识别与描述任务尤其多发,因为缺少显式否定监督会鼓励过度生成。
第二类是任务相关但事实错误,如重叠判断中模型理解题意却与时间线矛盾,常见于二值或有限选项任务,原因包括过度泛化、时间线索误读或依赖与证据不对齐的浅层启发式。第 3 类是错误拒绝,明明可答却用通用不确定、访问声明或索要上下文搪塞,多出现在需识别目标缺席的否定但良定义问题上。
跨域对比显示同一模型在结构相似的排序任务上失败形态不同。语音侧多为幻觉肯定或任务相关错误,环境声侧多为错误拒绝或过度谨慎,音乐侧多为标签混淆、任务偏离与保守弃权。这支持域与结构依赖的判断,也说明单域评测无法推广。复现时应把这 3 类失败当作必查清单,对每个错误样本先判定属于肯定幻觉、任务相关错误还是错误拒绝,再统计分布,而不是只记错了多少。
论文未报告的边界是开放问答数量少于二值分类,且仅含英语数据。方法与设计声称可迁移到其他语言,但多语言幻觉未被测量,因此不能把结论推广到多语言场景。
哪些结论有证据,哪些还只是待验证?
直接报告的是三域分任务准确率、肯定预测比例、无关错误比例、条件准确率与错误拒绝率的分布,以及模板改写的平均 0.7% 小波动。有限解释的是肯定偏置在环境声最突出、拒答是独立幻觉模式、强标准基准表现不蕴含抗幻觉鲁棒性,这些解释有跨模型跨任务的一致趋势支持,但仍受限于所选模型集合与任务构造。未验证推测是检索接地或强化推理一定能降低幻觉,原文仅在模型介绍中提及个别系统含检索以减少幻觉,未给出受控消融,因此解读用可能与待验证表述。
缺失证据不是技术错误。论文未测量误判率之外的延迟、成本与训练资源消耗,未报告输出帧率与实际延迟的对应关系,也未给出统计显著性检验细节,只说明 3 次运行取平均。总体趋势不等于每组每步成立,例如某模型平均较好仍可能在特定扰动上崩塌。相关性不作因果,如肯定比例高且条件准确率低支持肯定偏置判断,但不能直接断定语言先验是唯一成因。
要复现这套诊断,先做什么,需要什么条件?
先做环境与数据准备。从可用代码仓库获取脚本与模板,按表 1 音频来源准备 Common Voice、FSD50K、GTZAN 与 Mridangam 系列的对应片段,核对每个实例四字段是否完整,音频为原始字节而非特征。关键超参数与信息条件是零样本、统一提示、3 次运行取平均、输出归一化规则,包括小写去标点、二值关键词映射、计数数字抽取与统一拒绝标签。换模型时保持提示模板与答案空间不变,否则偏差与拒答不可比。
再跑最小可核对集。先复现语音重叠、词序与计数 3 个任务的样本数与问法,再跑环境声重叠与顺序、音乐流派匹配的对照,检查分任务准确率方向是否与论文一致。接着复现肯定偏置三量与错误拒绝热图,重点看 Qwen2-Audio 与 Gemini-2.5-Flash 的拒答尖峰是否再现,以及 Qwen 系列在排序计数上的肯定偏置。开放问答需单独评估流程,不能混入二值指标。
还需补的验证包括中文或其他语言的等价模板集、长音频与多轮不一致检验、以及推理开销与延迟的同步测量。代码开源不等于权重可下载与系统可运行,复现前应区分脚本可用、数据许可与模型访问权限三件事。若某模型在本地无法加载,应明确标注未评测边界而不删除不利基线。
何时值得用 HalluAudio,记住哪三句话?
当你的任务要求回答必须有声音依据,例如语音转写核对、事件存在判断、乐器属性确认或响度顺序比较,且不能接受流利编造与无故拒答时,值得用 HalluAudio 做可靠性体检。它不替代能力基准,而是补上缺席证据与扰动条件下的诊断。论文特有的误解是把高准确率当作低幻觉,把拒答当作安全,把单域好当作全域好。原文证据不支持这 3 种等价,复现时应同时看准确率、肯定偏置与拒绝率。
记住三句话。第一,用受控对比与无效查询诱发幻觉,用归一化加有效性检查保证可比,用偏置与拒答分解定位失败。第二,结构幻觉看计数排序与比较,感知幻觉看存在与属性,一致性看扰动前后是否矛盾。第三,报告时保留分任务数字与未胜出项,说明适用条件与英语为主的局限,再谈改进方向,这样后人才能在相同信息条件下重复你的判断。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


