标签:#音频字幕生成 | #偏好优化 | #基准测试 | #模型评估 | #多模态模型
评分:6.8/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5
👥 作者与机构
- Jianjiang Yang:The University of Manchester
- Peihang Li:The University of Hong Kong
- Shanqing Xu:Huazhong University of Science and Technology
- Mengchen Qian:Huazhong University of Science and Technology
- Lu Zhang:Shanghai Academy of Educational Sciences
- Meng Luo:National University of Singapore
📌 核心摘要
多模态大语言模型需同时处理图像视频音频到文本的理解与文本到图像视频音频的生成,输出幻觉表现为与输入语义矛盾或无支撑的声明,难点在于时序因果、声学线索与组合关系的验证工具成熟度差异极大。方法链第一步由原子声明分解将长输出拆为可验证原子句并经自反思校验语义保真。第二步将原子句送入模态专用专家验证,图像用开放集检测器与大模型集成判属性关系事件,视频将声明转问答做帧级取证,音频由三专家投票并以等权多数汇总证据。第三步由推理聚合器综合各专家判断、证据与置信信号输出标签与解释,而经偏好优化训练的轻量验证器以高置信直判、低置信回退全流水线实现前置过滤。相对仅适用图像的单模态自检流水线,差异在于统一声明协议加模态专用取证与可调成本的混合调用,意义在于跨六任务复用同一判定语义。在OmniHallu-Bench基准下,本框架在图像到文本任务的Mac.F1为82.95,高于GPT-4.1 UNIHD基线的78.88。结论适用边界受限于以文本为中心的四类幻觉划分与现有专家能力,关系型幻觉最难且视频长程推理与音频源分离仍是主要失败条件。全量流水线单样本推理开销约为15秒与约0.12美元,过滤后延迟降至约6秒与约0.05美元。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。
可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么要统一检测?
这篇论文的输入是跨模态模型的输入输出对,目标是判断输出是否幻觉。理解方向的输入是图像、视频或音频,输出是文本描述;生成方向的输入是文本提示,输出是图像、视频或音频。必须保留的信息是每条输出能否拆成可验证的原子断言、每条断言是否有输入侧证据支持、最终在声明级别如何计数。输出是一个统一的检测流程和一个 10000 样本的人标基准,覆盖图像到文本、视频到文本、音频到文本、文本到图像、文本到视频、文本到音频 6 个方向。
对刚入门的同学,白话先行:幻觉在这里不是模型说胡话的修辞,而是指输出里出现了输入中没有或与输入矛盾的语义。英文叫 hallucination,本文的检测叫 hallucination detection。统一的动机是过去的基准多半只看一个模态或只看理解不看生成,图像的基准不管视频音频,视频的指标不管生成对齐,导致无法比较哪类错误更难、哪个组件可迁移。
下面这张总览图把 6 个方向的幻觉实例放在同一版式下,先看它有助于建立直觉:理解任务错在文本,生成任务错在媒体与提示不一致,但都可归为对象、属性、关系、事件 4 类。
看图路径: 1. 先按面板从上到下确认六个子任务的输入在左还是在右;2. 再看每条模型输出中被标色的词对应哪类对象属性关系事件错误;3. 对比理解任务与生成任务中待验证文本的位置有何不同;4. 注意音频面板没有画面 grounding,只能依赖声学标签和时序描述
论文图 1。原论文 Figure 1::“MLLMs produce hallucinations in both comprehension and generation across modalities, spanning object, attribute, relation, and event hallucination types.”。
该图共 6 个面板:图像到文本举了球衣颜色和对手球队的错误,文本到图像举了三只斑点狗数量姿态与地毯颜色的错误,视频到文本把冲浪误说成滑板场,文本到视频把两个女孩弹琴误生成为沙发上看电视,音频到文本与文本到音频则涉及语言流派标签和歌声掌声鼓点的时序。教学要点是不要把颜色词都当成同一难度,对象是否存在最容易用检测器验证,关系和事件需要组合推理,这正是后文拆分加专家分工的原因。
已有路线在输入目标监督上与本文有何不同?
第一条路线是单模态幻觉评估。图像侧有点问式的存在性测试和描述评估,视频侧有针对视频描述事实性的指标,音频侧有针对音频描述的评测。它们的输入多为单一模态对,目标多为响应级打分,监督多为人工打分或规则匹配。本文与之同输入不同目标:本文把目标统一为声明级二分类加理由,便于跨模态并排比较。 第二条路线是检测方法。
从单模型的自一致性检查,到图像文本的多步拆分验证管线,再到跨系统一致性排序和音视频描述的偏好优化纠错。这些方法在运行阶段不同:自检不需要外部工具,多智能体需要调用检测器和专家模型。本文继承拆分验证聚合范式,但把视频的时间因果证据和音频的声学线索做成模态专属分支,这是与通用检测器的关键区别。 第三条路线是工具增强的多智能体系统。
已有工作让语言模型决定调用何种外部工具、把视频理解改写为工具调用序列、把开放词汇检测用于对象验证。本文把该思想用于幻觉检测:对象类用开放集检测器,属性关系事件类用多模型集成,视频先把断言改写为针对性问答再做帧级证据抽取。 为理解覆盖范围的差异,先比较基准的功能、粒度和模态数,下表选自原文基准对比表,问题是过去基准是否同时支持声明级、带理由和 4 模态六任务。
| Benchmark | Granularity | # Instances | Task | Rationale |
|---|---|---|---|---|
| POPE (Li et al., 2023b) | R | 500 | I2T | ✗ |
| AMBER (Wang et al., 2024a) | R | 1,004 | I2T | ✗ |
| MHaluBench (Chen et al., 2024a) | R, S, C | 420 | T2I, I2T | ✔ |
| OmniHallu-Bench (Ours) | R, S, C | 10,000 | T2I, T2V, T2A, I2T, V2T, A2T | ✔ |
从表中可见,早期文本基准实例数虽大但只有单模态响应级,图像和视频音频基准多为几百到上 1000 样本且限于 1 对模态,只有本文基准同时达到 10000 样本、六任务、4 模态和响应片段声明 3 级粒度并提供理由。公平条件是都按各自原文报告的任务数和模态数比较,指标方向是覆盖越广越有利于统一研究,但实例数大不等于难度大。该表也提示未胜出项:若只关心单一图像存在性判断,轻量专用基准成本更低,不必动用本文重型管线。
任务如何形式化,四类幻觉如何界定?
论文把文本、图像、视频、音频记为 4 类数据集合,模型把某一类输入映射为某一类输出。理解任务是从图像视频音频到文本,幻觉存在于生成的文本中;生成任务是从文本到图像视频音频,幻觉表现为生成媒体与提示的语义偏差。教学例子:提示说三只狗并排走,生成图像只有两只躺着,这就是生成幻觉;反过来图像明明是蓝色球衣,描述写成红色,就是理解幻觉,此处例子仅说明方向,不附加数值。
理解任务 × 生成任务: 理解任务负责检验模型生成的文本描述是否忠于输入的图像视频音频,生成任务负责检验模型生成的图像视频音频是否忠于输入的文本提示,搭配理由是两者幻觉方向相反但都可表达为输入语义集合是否包含输出断言,组合意义是用同一套拆分验证聚合流程实现六向任务的并排比较。
形式化定义是若输出中存在任何一条可抽取的语义断言不属于输入可推导的真语义集合,则判为幻觉,否则为非幻觉。符号含义是输入为跨模态源,输出为待检媒体或文本,真集合为输入可支撑的语义元素,存在量词强调只要有一条不支持即整体判幻觉。计算目标是在声明级逐条判定,再聚合为样本级结论。原文实现是先分解再逐条验证,最后聚合。
\[\Hallucinate(\hat{y}\mid\mathbf{x})=\begin{cases}1&\text{if }\exists\;\phi(\hat{y})\notin\mathcal{G}\\ 0&\text{otherwise,}\end{cases}\]4 类 taxonomy 适用于全部模态:对象指引入不存在的实体,属性指颜色大小音色等性质错误,关系指空间时间因果关系错误,事件指事件级细节错误包括时序错乱或虚构动作。每类在 6 个任务中都有实例,从而支持跨模态比较。需要区分的是报告与推测:论文报告了 4 类分布为对象 35%、属性 25%、事件 25%、关系 15%,这是设计上的分层比例,不是自然分布的测量。
三段式管线如何走完一个样本?
全景分 3 段:原子断言拆分、模态感知的专家验证、基于推理的聚合。沿一个样本走一遍:假设输入是一段视频加模型生成的描述,拆分器先把描述切成多条自包含可验证的短句;每条短句送入视频专家分支,专家把它改写为问答并抽取相关时间段的帧证据,给出支持或不支持;最后推理模型综合所有断言的专家判断、证据和置信信号,输出最终标签与解释。若是生成任务,则待拆分文本是输入提示,待验证媒体是生成结果,方向反转但流程相同。
原子断言拆分 × 声明级检测: 原子断言拆分负责把一段描述或提示切成语义离散、可独立验证的短句,声明级检测负责对每条短句分别判支持还是幻觉,二者搭配的理由是响应级判断会把正确与错误混在一起,只有先拆分才能定位到具体哪一句错、聚合时才能按条计数,组合意义是把检测粒度从整段下沉到可溯源的证据单元。
下图展示了左右两路如何汇合,先看有助于记住数据流向,避免把拆分与验证的顺序弄反。
看图路径: 1. 先沿左侧文本经大语言模型到原子断言的主路径看分解位置;2. 再看三路视觉视频音频专家在哪里汇入共识投票节点;3. 确认最右侧推理验证是最终裁决而不是投票本身
论文图 3。原论文 Figure 3::“Overview of the OmniHallu multi-agent framework.”。
图中左侧文本经大语言模型得到原子断言列表,上方多媒体大模型分支示意待检媒体来源,中间三排分别为视觉大模型、视频模型和音频模型专家,它们汇入共识投票节点,最右侧推理模块做最终验证。底部 3 段横条明确了分解、多智能体执行、推理验证的顺序。教学动作是先追踪断言箭头,再看专家分支是并行而非串行,最后确认投票只是中间汇总,最终标签由推理器决定。
拆分与专家验证各自解决什么困难?
原子断言拆分用大模型对目标文本做思维链提示加自反验证,每个样本得到文本与断言集合,每条断言要求语义离散、语法自足、可验证。理解任务拆生成描述,生成任务拆输入提示。论文在 300 样本子集上对比人工参考,报告平均覆盖率 0.92、平均冗余度 1.15,图像最好、音频最差,这显示拆分质量本身随模态下降,后文消融证实它是主要瓶颈。 模态专家验证按任务分组:图像任务的对象类用开放集检测器做存在性验证,属性关系事件类用多个大视觉模型独立判断。
视频任务先把断言改写为问答以做时间分解和帧级证据抽取,默认三专家可关注特定时间段;音频任务默认三音频专家。组内用等权重多数投票汇总,理由是缺乏可靠的跨模型置信度校准,等权更透明且无需任务调参,投票摘要与个体证据痕迹一并交给聚合器。
模态专家验证 × 多数投票: 模态专家验证负责用适合该模态的工具和模型给出每条断言的判断与证据,多数投票负责在专家不一致时用等权重汇总出一个可解释的中间结论,搭配理由是单模型在视频时序和音频声学上各有盲区且缺乏可靠的跨模型置信度校准,组合意义是用透明的投票先压缩分歧,再把分歧痕迹留给推理聚合器做最终裁决。
推理聚合在主实验中用更强的推理模型,接收每位专家的判断、证据和置信信号,输出最终标签与理由。对照实验用较弱推理模型替换以剥离模型强度的影响。需要指出的是主结果用了强推理器而基线用各自模型,因此跨表比较时要同时看同容量对照,否则会高估架构收益。
投票与推理聚合为何要分两层?
投票层解决专家分歧的初步压缩,推理层解决证据质量的权衡。举例:3 位视频专家对同一时序断言给出两支持一反对,投票给出多数支持的摘要,但反对者可能提供了关键的跨帧证据,推理器需要读到该证据才能推翻多数。若只有投票,少数派的正确证据会被计数淹没;若没有投票直接把所有原始输出丢给推理器,上下文冗长且缺乏结构,推理器更易遗漏。
推理聚合 × 可解释理由: 推理聚合负责综合各专家的判断、证据和置信信号输出最终标签,可解释理由负责说明依据了哪条证据、否决了哪条判断,搭配理由是投票只能计数不能权衡证据质量,组合意义是在保留投票透明性的同时,让强推理模型处理时序因果和模糊声学证据的综合。
原文附录说明等权投票的选择依据是所选专家在各自领域性能相当,不等权需要可靠校准,而校准暂不可得。这意味着当所有专家共享同一感知盲区时,投票无法纠错,音频任务正是如此:弱声源分离和模糊声学线索导致全体误判。理解这一点才能正确解读后文音频提升虽大但绝对值仍最低的现象。
小验证器训练了什么,没有训练什么?
本研究的主管线没有训练大专家和推理器,而是调用现成模型做拆分、验证和聚合。唯一训练的是紧凑的声明级验证器,初始化自 7,000,000,000 参数规模的视觉语言模型,输出 3 类标签:支持对应非幻觉,不支持对应幻觉,弃权触发完整专家验证。输入是任务输入加单条原子断言,目标是近似多智能体决策边界,做低成本过滤器。
组相对策略优化 × 校准惩罚: 组相对策略优化负责在同一断言采样一组候选判断并用组内相对优势更新小验证器,校准惩罚负责在专家信号冲突时惩罚过度自信,搭配理由是只奖励标签正确会让小模型学到冒进的捷径,组合意义是同时优化正确性、与多智能体共识的一致性和置信度可靠性,使其能做高置信直判、低置信转交的过滤器。
奖励由三项加权组成,权重分别为 1.0、0.7、0.3:标签奖励鼓励与真值一致,证据奖励鼓励与多智能体共识一致,校准奖励在专家冲突时惩罚过度自信。优化用组相对策略优化,对同一断言采样一组判断并用组内归一化优势更新,不使用显式偏好对。训练用 6000 训练、1000 验证、3000 测试的无源媒体重叠划分,训练 3 轮、学习率十万分之一、组大小 8。未报告的缺项是优化器类型、批量大小和硬件预算,复现时需自行记录。
\[\pi_{\psi}(\ell\mid\mathbf{x},c_{i}),\;\;\ell\in\{\texttt{SUP},\texttt{UNSUP},\texttt{ABS}\}.\]上式中符号为小验证器参数、输入与断言、3 个离散标签,计算目标是给出条件判断分布,实现是高置信大于 0.85 时跳过专家调用,不确定判弃权时转交完整集成。
\[\mathcal{L}_{\text{GRPO}}=-\mathbb{E}\Bigg[\frac{1}{K}\sum_{k=1}^{K}\hat{A}_{k}\,\log\pi_{\psi}(y_{k}\mid\mathbf{x},c_{i})\Bigg],\]该式为组相对策略优化损失,对组内每个采样用归一化优势加权对数似然,原始目标、近似与梯度路径按原文实现为准,未给出的梯度细节不猜测。3 种集成模式为独立验证器、过滤混合与聚合器加权,分别对应零专家调用、部分调用与全量调用。
数据从哪来,标注与指标如何保证可比?
基准共 10000 样本,理解占 60%、生成占 40%,图像视频音频按 5 比 3 比二分层。理解任务数据源包括图像描述、视频描述和音频描述的公开集,输出由多个大模型生成以减少对单一模型伪影的依赖;生成任务提示来自 compositional 对齐基准,图像视频音频分别由多生成器产生。标注先用思维链做原子拆分加自反验证,再由 3 名训练标注员独立审核,只有完全一致才保留,约 24.3% 因分歧被移除,过滤前一致性系数图像视频音频分别为 0.89、0.86、0.83,最终 4000 人工精标加 6000 模型生成人工审计。 下图核对分层比例,先看有助于复现采样时保持同分布。
看图路径: 1. 先读左中右三个环形图的标题确认切分维度;2. 再核对理解占六成生成占四成、图像视频音频为五比三比二;3. 最后核对对象属性事件关系四类的百分比加总是否为百分之百
论文图 2。原论文 Figure 2::“Statistics of OmniHallu-Bench: distribution across modalities, tasks, and hallucination types.”。
三环图从左到右依次为任务类型、模态和幻觉类型:理解 60% 生成 40%,图像五成视频三成音频 20%,对象三成五、属性 20% 五、事件 20% 五、关系一成五。平均每样本原子断言数为图像到文本 4.2、文本到图像 3.8、视频到文本 5.6、文本到视频 4.1、音频到文本 3.5、文本到音频 3.1,整体幻觉率 42.8%,生成高于理解。评估沿用已有管线的声明级精确率召回率 F1,分别对幻觉与非幻觉计算,再算准确率与宏平均 F1,主指标为宏平均 F1,因其平衡两类检测能力。
主结果测了什么,条件公平吗?
主实验测六任务声明级检测,比较对象为单模型思维链自检和仅适用于图像的多步管线,视频音频侧用各模态最强模型的自检。条件不一致处必须说明:本文框架用更强推理模型,基线用各自模型,因此同容量对照在后文单独报告。指标方向均为越高越好,显著性用 10000 次自助检验报告小于 0.01。 先看图像到文本的子表,问题是在同为声明级宏平均下,多智能体是否超过单模型自检与图像专用管线。
| Method | F1 | F1 | R | Mac.F1 |
|---|---|---|---|---|
| Self-Check | 76.52 | 77.30 | 77.23 | 76.91 |
| UNIHD | 79.20 | 78.55 | 78.69 | 78.88 |
| 82.96 | 82.93 | 82.03 | 82.95 |
该子表截取图像到文本四行:较弱自检、较弱管线、较强自检、较强管线与本文方法,列为幻觉 F1、非幻觉 F1 与宏平均。可见本文宏平均最高,领先同容量较强管线约数个点。表后解释:收益来自拆分定位加专家集成,代价是 5 到 8 次接口调用与更高延迟;未胜出项是较强管线在非幻觉召回上仍具竞争力,若应用只关心少误报,可权衡成本选用轻量方案。 再看视频与音频方向,下表把视频到文本、文本到音频等行的关键 F1 并置,问题是架构收益是否随专家变弱而变大。
| Method | F1 | F1 | R | Mac.F1 |
|---|---|---|---|---|
| Self-Check | 70.40 | 69.84 | 68.22 | 70.12 |
| 77.13 | 77.15 | 76.17 | 77.14 | |
| Self-Check | 65.57 | 66.98 | 64.26 | 66.28 |
| 73.45 | 73.33 | 72.22 | 73.39 |
表中视频与音频行的模式一致:本文方法在幻觉与非幻觉 F1 上双双领先,音频绝对值最低但相对提升最大。这支持多智能体在单模型较弱时价值更大的判断,限制是跨模态绝对值差异部分来自工具成熟度而非模态本身,视觉专家参数远大于音频专家,不能直接读成音频本质更难。 按幻觉类型的柱状图进一步显示难度层级,先读有助于避免把平均数当成全程。
看图路径: 1. 先确认六个子图分别对应哪一个跨模态方向;2. 再在每个子图内比较对象属性关系事件四组柱子的高低顺序;3. 注意橙色柱相对绿色柱的提升在关系类上是否更明显
论文图 4。原论文 Figure 4::“Detection performance by hallucination type. Object hallucinations are easiest to detect; relation hallucinations are the most challenging across all modalities.”。
六子图纵轴为 F1 分数,横轴为对象属性关系事件,绿色与橙色分别代表基线与本文方法。可见对象最高、关系最低,属性与事件居中,该顺序在六任务中稳定。橙色在关系类上的抬升最明显,平均约 9.2 点,支持组合推理最需要多专家互补证据的解释。但像素不能精确读数时不要硬写具体分值,趋势判断以原文文字为准。
跨模态梯度与理解生成差异说明了什么?
论文报告模态梯度为图像高于视频高于音频,图像宏平均约八十出头,视频约七十中高,音频约七十出头。同一模态内理解高于生成,例如图像到文本高于文本到图像,视频到文本高于文本到视频。机制解释是理解可直接把断言 grounding 到源媒体,生成则需判断生成媒体是否忠实反映提示,后者证据更间接。另一因素是专家成熟度:视觉大模型远大于音频专家,工具生态不成熟放大了音频难度。
失败模式按模态区分:图像多为小尺度或遮挡对象漏检与细微属性差,视频多为事件排序错误、中间动作遗漏与因果归因错且证据分散在非相邻帧,音频多为声源分离弱与模糊声学线索且全体专家共享感知局限。原文总结为图像感知受限、视频推理受限、音频工具受限。教学提醒是总体趋势不等于每组都成立,个别样本可能因提示简单而生成任务反而易检,部署时应按任务分别设阈。
成本方面全文管线每样本 5 到 8 次调用、约 15 秒、约 0.12 美元,加过滤器后降至 1.7 到 2.8 次、约 6 秒、约 0.05 美元,全基准约 1200 美元或过滤后约 500 美元。延迟下降支持近实时反馈,但未测量误判率之外的实际交互延迟分布,不承诺所有场景都满足实时。
拿掉拆分投票推理器会发生什么?
消融测组件贡献,问题是拆分粒度与集成多样性谁是主要瓶颈,条件是保持其余模块不变、指标仍为宏平均 F1。
| Task | Full | w/o ACD | w/o MV |
|---|---|---|---|
| I2T | 82.95 | 75.02-7.93 | 77.64-5.31 |
| V2T | 77.14 | 70.10-7.04 | 72.34-4.80 |
| A2T | 74.11 | 67.05-7.06 | 69.24-4.87 |
| T2A | 73.39 | 66.81-6.58 | 68.92-4.47 |
该表行为六任务,列为完整、去拆分、去多专家投票。可见去拆分下降约 6.6 到 7.9 点,去投票下降约 4.5 到 5.3 点,且差距在六任务中一致。这支持拆分质量是首要瓶颈的判断:无拆分时推理器只能做响应级判断,失去细粒度定位。未胜出或负结果是即使保留投票,去拆分仍大跌,说明集成不能弥补粒度缺失;边界是该结论限于当前推理器容量,更弱推理器下差距可能变化,待验证。 推理模型对照进一步剥离模型强度的影响,问题是换用同容量推理器后架构是否仍有收益。
| Task | GPT-5.2 | GPT-4.1 |
|---|---|---|
| I2T | 82.95 | 78.44 |
| V2T | 77.14 | 71.83 |
| A2T | 74.11 | 67.56 |
| T2A | 73.39 | 67.23 |
该表对比强弱推理器在六任务的宏平均,强推理器领先 4.5 到 6.6 点,差距在视频音频更大,支持强推理在证据模糊时补偿更多的解释。但即使同为较弱推理器,本文在视频音频仍领先基线 1.3 到 1.9 点,显示多智能体确有超出模型强度的价值。代价是强推理器成本更高,复现预算有限时应优先报告同容量对照。 专家数量消融显示从 1 到 2 到 3 单调提升,下表选自原文专家数对照。
| Task | 1 Expert | 2 Experts | 3 (Ours) |
|---|---|---|---|
| I2T | 77.62 | 80.54 | 82.95 |
| V2T | 71.24 | 74.52 | 77.14 |
| A2T | 68.20 | 71.18 | 74.11 |
| T2A | 67.54 | 70.02 | 73.39 |
表中三列为 1 专家、2 专家、3 专家,六行均为递增,例如图像到文本从 77.62 到 80.54 到 82.95。这支持集成多样性有效的判断,但附录同时报告把大专家换为小专家会大跌,说明数量与容量缺一不可。未评测边界是超过 3 专家的收益与成本拐点,原文未给出,不猜测。
哪些结论受限,哪些不能推广?
分类粒度受限:4 类提供跨模态共同基础,但压缩了模态特有现象与复合错误,例如视频事件可再分为时序排序、动作遗漏与因果错误,音频可区分声源分离与音色,文本中心 formulation 也排除了图像到音频等非文本配对。模型与专家依赖:性能依赖推理器与可用专家,视觉专家远大于音频专家,跨模态差异部分反映工具能力,多数投票无法纠正全体共享的错误。 伦理与数据方面,基准来源为公开集,模型生成内容已披露并经人工审计,高风险使用前需透明文档与人工复核。
本文未提供经验证的资源可用性声明,不得声称代码模型数据已公开,复现应以论文描述的调用与标注流程为准。 区分直接报告、有限解释与未验证推测:梯度与消融数值为直接报告;工具成熟度导致梯度的解释为有限解释,有专家规模差异支持但非因果证明;未来需更强时序听觉组合验证的建议为待验证方向。缺失证据不是技术错误,例如未测量每步延迟分布,就不承诺实时性全面成立。
复现先做什么,需要哪些信息条件?
先复现评估协议:按声明级分别计算幻觉与非幻觉的精确率召回率 F1,再算准确率与宏平均,主看宏平均。划分上验证器用 6000 训练、1000 验证、3000 测试且无源媒体重叠,避免泄露。采样上保持理解 60% 生成 40%、图像视频音频 5 比 3 比二、4 类幻觉比例不变,否则平均数不可比。 再复现管线:用思维链加自反验证做原子拆分,图像对象用开放集检测器、其余用多模型集成,视频先改写为问答再抽帧证据,音频用三音频专家,组内等权投票后交推理器综合判断与证据输出标签加理由。
关键超参数为验证器学习率十万分之一、3 轮、组大小 8、奖励权重 1.0、0.7、0.3、高置信阈值 0.85。需补的验证是批量大小、优化器细节与硬件预算,以及超过 3 专家的成本拐点。 成本规划按每样本调用数与单价估算,全量与过滤模式分别预算,过滤模式仅对弃权样本调用全集成,专家调用占比约 34.2%。常见误解是把可训练验证器当成替代品:独立使用虽接近全管线但仍有差距,过滤混合与聚合加权分别对应平衡与高可靠 operating point,应按延迟成本与可靠性选型。
何时值得尝试,还需补哪项验证?
当任务需要定位到具体哪一句错、且需跨图像视频音频比较时,值得尝试拆分验证聚合:对象类可直接用检测器快速验证,关系事件类用多专家互补,音频模糊时用强推理补偿。若只有单图像存在性判断或延迟成本极敏感,可先用自检或独立小验证器,不必直接上全管线。 复现后还需补两项验证:一是同容量推理器下的对照,避免把模型强度误记为架构收益;二是按幻觉类型分别报告,确认关系类提升是否在新数据上复现,因为平均提升可能掩盖某类退化。
总体判断是声明级拆分、模态感知证据与结构化推理在异构场景下改善检测,但时序与音频 grounding 仍是短板,未来进展更可能来自针对性的时序听觉与组合验证能力,而非通用检测器 alone 的简单放大。
📎 论文与评分元数据
排名:前50% | 文档类型:数据集与基准 | arXiv 原文
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
评分规则:type-aware-v1
评分模型:muse-spark-1.3-contributor
评分请求协议:openai_responses

