英文题目:SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models
会议身份:
conference:cvpr:2026:conference-paper-id:Zhang_SVHalluc_Benchmarking_Speech-Vision_Hallucination_in_Audio-Visual_Large_Language_Models_CVPR_2026_paper
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#基准测试 #基准设计 #音视频 #语音 #音视频问答
评分:6.6/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Chenshuang Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Kyeong Seon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Chengxin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Tae-Hyun Oh:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
SVHalluc以同步采集的人声语音与烹饪操作视频为输入,以二选一或多选问答为输出,要求判断语音所述实体是否可见及其叙述事件与当前画面是同时、过去还是未来,其难点在于语音富含指代缺失的实体与跨越过去现在未来的时序叙述,模型易将听说内容幻觉为所见事实。从YouCook2验证集截取对齐的语音视频对并用Whisper获取转写负责提供可核对的语音文本,其输出进入语义失配与时间错位样本构造,分别替换动作客体与错置说话时刻与视觉发生时刻以制造幻觉诱因。再经GPT过滤不合理组合并由人工核验保留清晰样本,最后以零样本方式在包含语义与时间各三个由粗到细任务的2405个视频问题对上统一评测。与仅用狗叫或汽笛指示当前事件的环境声基准相比,其关键机制差异在于显式检验命题级语义接地与跨模态时序定位,因而能暴露单模态感知强但跨模态整合弱的失效模式,具有推动语音 grounded视频理解的实际意义。在SVHalluc基准的细粒度语义对齐任务下,加入语音转写的Qwen3-Omni的准确率为83.14%,高于原始Qwen3-Omni的准确率79.50%。该结论适用边界受限于烹饪教学视频与英语叙述场景,在开放域对话、强噪声或长时因果推理等尚未验证范围内的外推存在失败条件。原文未披露训练、推理或部署成本
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?为什么语音幻觉值得单独做基准?
本文的输入是一段配有人声语音的视频,目标是让音视频大语言模型同时看画面和听语音,然后回答语音内容与画面是否对应、时间是否一致。初学者容易把这件事理解成给模型同时喂视频和音频就行,但论文指出现有幻觉基准主要用环境声做事件指示器,例如狗叫表示狗在叫、警笛表示警笛响起,问题往往简化为狗是否在发出声音,或者听到警笛时人在做什么。这类声音语义稀疏且只指示当前时刻。
人类语音则不同,它由有意义的语言单位组成,信息密集且结构化,可以描述不在眼前的物体、未发生的动作,甚至谈论过去或未来的事,还可以是与画面无关的评论。因此语音与画面的关系不是简单的同时出现,而是需要逐词理解说了什么,再到画面里找证据,还要判断时间指向。论文要解决的学习问题是,当前音视频大模型能否把语音内容准确对齐到对应视觉信号,还是会被语音内容诱导出看似合理但无依据的回答。输出是选择题答案,评价用准确率等指标。
必须保留的信息是基准名为 SVHalluc,覆盖语义和时间两个维度,共 2405 个视频问答对,数据来自 YouCook2 验证集的烹饪过程视频。资源状态方面,本次未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开,原文中的项目页链接本次未能确认可达。
同类基准做了什么?本文与它们差在哪里?
先讲同输入同目标的工作。已有的音视频幻觉基准同样输入视频加音频、目标是检验模型是否产生无依据输出,例如 AVHBench 发现模型常在没有音频证据时就认定可见物体在发声,另一类工作考察模态间虚假相关如何引发幻觉,DAVE 则用环境声做当前时刻的时间接地,问听到警笛时人在做什么。这些工作把音频当作事件是否发生的指示器,关注的语义事件有限,时间上也只指向声音发生的当前时刻。再讲同监督同运行阶段的差异。
本文同样采用零样本问答形式,同样用二选一或多选保证可统计比较,但在监督构造上做了不同选择:不再用狗叫这类环境声,而是用人声语音内容作为干扰或线索,要求模型理解指令、物体名和动作描述,并处理过去、现在、未来 3 种时间关系。运行阶段上,本文与前人一致,都是直接调用已有音视频大模型作答,不额外训练被测模型。
因此不能把类别差异当成同条件胜负:环境声基准考的是听到声音能否找到当前事件,语音基准考的是听懂句子后能否在画面中找到语义对应并排准时间,两者难度和能力指向不同。初学者常误以为语音只是另一种音频,实际上语音带来的是语言级语义和跨时间指代,这是本文要补的评估缺口。
要测的两种幻觉是什么?题目长什么样?
论文把语音视觉幻觉分成语义和时间两个互补维度。语义幻觉问的是语音里的什么内容有画面证据支撑,模型应能发现语义不一致,避免把不匹配或无关语音当成画面事实。时间幻觉问的是语音叙述的事件相对听到语音的时刻,在画面时间线上处于何处,模型应能区分过去、现在、未来,而不是把叙述事件幻觉到错误的时间位置。每个维度各设 3 个由粗到细的诊断任务。语义侧是全局语义对齐、细粒度语义对齐、跨模态语义绑定。
时间侧是时间对齐、时间预测、跨模态时间绑定。举例来说,例子仅为教学示意:全局题问这段语音是否在描述视频中的视觉事件,选项是与否;细粒度题问语音提到的车打芝士在视频中是否可见,选项是与否;语义绑定题问给定的组合事件在视频中是否可见,正确答案为否,因为该组合从未在视觉上出现;时间对齐题问听到语音时所述事件是否正在同时发生。
时间预测题问相对听到语音的时刻,叙述事件发生在过去、现在还是未来;时间绑定题问听到语音时画面正在发生的动作是什么,并在选项中混入语音提到但发生在另一时间的事件和来自其他视频的干扰事件。所有题目统一为文本问句加视频输入,模型生成对应选项答案。
语义幻觉 × 时间幻觉: 语义幻觉负责回答语音里说的内容在画面里有没有对应物,分工是判别物体、事件是否存在;时间幻觉负责回答语音说的事情相对说话时刻发生在过去、现在还是未来,分工是定位跨模态时间关系。二者搭配是因为人类语音同时携带丰富语义和时间指向,组合后才能覆盖语音既可能说错对象又可能说错时刻的两种失效模式。
基准全景:一个样本如何走完输入到答案?
沿一个样本走完全流程有助于建立整体感。输入是一段烹饪视频片段及其同步人声,例如画面显示把切碎的胡萝卜洋葱倒入红锅,语音却说把火调到中小火、放面包片并加上车打芝士。表示阶段,模型需要分别得到视觉表示和语音表示,语音既可以是音频波形,也可以经语音识别转成文字。组件阶段,模型先要从语音中抽出叙述事件,包括动作与物体,再在视频帧中寻找视觉证据,然后做语义对应判断和时间关系判断。
目标阶段,语义任务要求输出是否可见或是否描述,时间任务要求输出是否同时或过去现在未来中的一项。输出是选项字母。论文用图示把这一链路分成上下两排,上排讲语义,下排讲时间,每排左侧是视频帧加波形加字幕,右侧是 3 个问题的提问模板与正确答案标记,目的是让读者一眼看到语音如何成为干扰源。下面的导读先说明该图是 6 个任务的实例化展示,再给出图片标记,之后解释每个面板的可执行观察点。
图前导读如下:该图把语义与时间两类幻觉各用一个完整样本实例化,左侧呈现视频帧、语音波形与转写文本,右侧列出 6 个任务的问法与正确选项,适合对照理解题目构造逻辑。
看图路径: 1. 先看左侧上下两组视频帧加波形加字幕的输入构成,确认语音与画面是配对输入;2. 再看右侧上框三个语义问题与下框三个时间问题的提问方式差异;3. 对照绿色对勾标注的正确答案,理解负样本为何答否或选另一时刻;4. 沿一个样本走完从听到的句子到画面动作再到选项的对应链路
论文图 1。原论文 Figure 1:“Cross-modal speech-vision hallucinations in audio-visual LLMs.”。
上排样本的语音与画面明显错配,3 个语义问题的正确答案均为否,意在检验模型是否盲信对齐;下排样本的语音描述擀面动作,时间对齐与时间预测的正确答案指向同时与现在,而时间绑定要求在语音干扰下仍选出画面正在发生的擀开面团,而非切开面团或来自其他视频的煎汉堡。观察时应注意波形只是示意语音存在,真正决定答案的是转写句义与画面动作的对应关系,绿色对勾仅标示基准设定的正确选项,不是模型输出。
六个任务各考什么机制?
全局语义对齐考的是整体是否匹配。做法是用原始对齐的语音视频对做正样本,用随机把另一视频的音频拼到当前视频上形成错配对做负样本,问题是语音是否描述视频中的视觉事件。正样本答是,负样本答否。若模型不真正推理对齐而默认语音描述画面,就会在负样本上大量答是,表现为高召回低精确率。细粒度语义对齐考的是具体物体接地。
做法是根据 YouCook2 的视频与音频标注,用语言模型找出可见物体与被叙述但不可见的物体,填入物体是否在视频中可见的模板,可见为正样本,不可见为负样本。这要求模型不只看整体氛围,还要把名词与画面区域对应起来。跨模态语义绑定考的是组合是否真实发生。
做法是先抽可见的动作物体对做正事件,再抽仅语音提及的动作、仅语音提及的物体、仅视觉的动作与物体,交叉组合成语音动作加视觉物体或视觉动作加语音物体等从未在视觉上出现的合理事件做负样本,并用语言模型过滤掉不合理组合。模型若把语音动作与画面物体拼贴,就会误答是。
全局语义对齐 × 细粒度语义对齐: 全局语义对齐负责判断整段语音是否在描述整个视觉事件,分工是粗粒度的是否匹配;细粒度语义对齐负责判断语音提到的某个具体物体在画面中是否可见,分工是细粒度的物体接地。搭配理由是从粗到细先发现整体错配再定位具体错配物,组合意义是区分模型是整体盲信对齐还是连具体物体也无法接地。
时间对齐考的是是否同时。做法是依据事件标注确定听到语音的时刻与叙述事件在视觉上发生的时刻,若接近则为对齐,若远离则为错配,问题是听到语音时所述事件是否正在同时发生。时间预测进一步要求输出过去、现在、未来中的一项,考的是沿时间线定位。跨模态时间绑定则在语音描述非当前事件时,要求模型仍答出听到语音时画面正在发生的动作,选项包括语音提及但发生在另一时间的事件、说话时正在发生的视觉事件和来自其他视频的干扰事件。
跨模态语义绑定 × 跨模态时间绑定: 跨模态语义绑定负责检验模型是否把语音里的动作和画面里的物体错误拼成一个不存在的事件,分工是语义组合正确性;跨模态时间绑定负责在语音描述非当前时刻时检验模型能否仍答出当前画面动作,分工是抗语音干扰的视觉接地。搭配原因是两者都考验模型不被语音牵引,组合后能分离语义拼贴错误与时间牵引错误。
时间对齐 × 时间预测: 时间对齐负责判断语音所述事件是否正在说话同时发生,分工是二选一的是否同时;时间预测负责进一步判断所述事件相对说话时刻属于过去、现在还是未来,分工是三选一的时间方向。搭配理由是由粗到细先判同时与否再判方向,组合意义是检验模型是否真正沿视频时间线推理而非只做当前时刻接地。
本研究训练了什么?数据流水线实际做了哪些计算?
本研究没有训练任何被测音视频大模型,该节承担的方法职责是基准构造流水线。必须明确:Qwen3-Omni、Qwen2.5-Omni、Video-SALMONN 系列、VideoLLaMA 2 与 Gemini-2.5-Pro 均为直接零样本调用,不更新参数,不存在梯度路径与优化步骤,论文也未报告冻结或微调细节,因此不能从模型名称推定实现。实际计算发生在数据构造侧。第一步是视频收集与预处理,从广泛使用的 YouCook2 数据集验证集取对齐良好的语音视频对,按标注剪成过程片段,再用广泛使用的 Whisper 模型做自动语音识别得到每段的转写文本。
第二步是语义任务样本构造,全局任务用原始对齐对做正样本、随机跨视频拼音频做负样本;细粒度任务用语言模型基于标注找可见与不可见物体填模板;语义绑定任务用语言模型抽动作物体对并交叉组合,再过滤不合理事件。第三步是时间任务样本构造,依据事件起止时间确定听到语音时刻与叙述事件视觉发生时刻,接近为现在对齐,远小于为过去,远大于为未来,并用事件标注做绑定题选项。
第四步是质量控制,先用语言模型过滤语音过短或未清楚描述视觉场景的样本,再做人工核验,保证样本清晰。下面的表格只整理论文直接报告的基准规模,不涉及模型训练量。表格比较的问题是基准规模与维度分布是否足以支撑分组评估,公平条件是同一 YouCook2 验证集来源与人工核验后的清晰样本,指标方向是样本量越大分组越稳定。
| 维度 | 代表任务举例 | 输入条件 | 样本量 | 备注 |
|---|---|---|---|---|
| 语义幻觉 | 全局与细粒度与绑定 | 语音视频配对问答 | 1422 | 语义子集总量 |
| 时间幻觉 | 对齐与预测与绑定 | 语音视频配对问答 | 983 | 时间子集总量 |
| 全部基准 | 6 个任务合计 | 同一构造流水线 | 2405 | 视频问答对总量 |
表格显示语义子集大于时间子集,总量为 2405。代价是该表未给出每个细任务的均衡选项分布细节,复现时仍需回到原文表 1 核对各任务计数与选项平衡,未胜出或未评测的边界是烹饪之外的场景与非英语语音均未覆盖。
评测条件:测谁、怎么问、怎么算分?
被测模型包括开源的 Qwen3-Omni、Qwen2.5-Omni、Video-SALMONN、Video-SALMONN-2、VideoLLaMA 2,以及商用的 Gemini-2.5-Pro,这些模型被描述为在全模态理解任务上表现突出。评测时按任务用不同问题提示,所有模型均为零样本,无额外训练。题目形式为二选一或多选。指标方面,二选一任务报告准确率、精确率、召回率与 F1,其中准确率是预测正确样本占全部样本的比例,精确率是真阳性占预测阳性的比例,召回率是真阳性占真实阳性的比例,F1 是精确率与召回率的调和平均,计算时把选是的样本当作正样本;多选任务报告全部样本上的准确率。
数据集划分上,论文沿用 YouCook2 验证集做评估,并保证每个任务各选项样本数均衡,随机选择基线在二选一上为 50%,在三选一上为 33.33%。动作与物体分布集中于烹饪领域,词云可帮助确认领域偏置。图前导读如下:该词云展示基准中动作与物体的词汇分布,字号越大表示出现越频繁,可用于判断基准的领域集中度与长尾覆盖,适合在复现前确认数据偏置。
看图路径: 1. 先确认词云中放大的核心词如 add、pan、salt、sauce 代表高频动作与物体;2. 再观察中等字号词如 pepper、onions、garlic、water 的分布密度;3. 注意边缘小字号词覆盖大量长尾食材与操作,说明场景多样但集中于烹饪
论文图 2。原论文 Figure 2:“Distributions of actions and objects from SVHalluc.”。
词云显示 add、pan、salt、sauce、pepper、onions 等烹饪核心词占主导,周围有大量小字号食材与操作词,说明动作物体多样但仍局限于厨房过程。这意味着在该基准上好的对齐能力未必直接迁移到户外或工业场景,复现时应保留领域条件,不把烹饪内结论推广为通用视频理解结论。论文未报告推理延迟与计算开销,因此不能承诺任何效率改善。
主结果:谁在语义与时间上 hallucinate 得最严重?
语义幻觉侧,论文报告所有开源模型出现严重失效。在全局语义对齐上,多数模型准确率在 50% 附近,接近随机选择,原因是模型倾向于相信语音在描述画面,即使语音与视频分属煮面与煎肉饼等明显不同场景仍选是,导致高召回低精确率,呈现高对齐偏置。Gemini-2.5-Pro 则达到较高准确率(%),显示数据集可解且开源与商用差距大。在细粒度语义对齐上,Qwen2.5-Omni 与 Qwen3-Omni 相对 Video-SALMONN 有明显提升,接近 Gemini 水平,表明细粒度物体接地能力较好。
在跨模态语义绑定上,所有模型都比细粒度任务更差,因为不仅要判断物体是否可见,还要判断动作缺失与动作物体组合是否真实。时间幻觉侧,所有开源模型在时间对齐与时间预测上接近随机,表明难以找到语音内容与视觉事件的正确时间对应。Qwen3-Omni 在跨模态时间绑定上相对此前开源模型有提升,而 Gemini-2.5-Pro 在全部时间任务上显著领先。
表格比较的问题是商用模型与开源模型及随机基线在可运行零样本条件下的准确率差距,公平条件是同一 SVHalluc 题目与同一二选一计分,指标方向是准确率越高对齐越好。
| 任务 | 模型 | 准确率 | 随机基线 | 运行方式 |
|---|---|---|---|---|
| 全局语义对齐 | Gemini-2.5-Pro | 93.10% | 50% | 零样本直接作答 |
| 全局语义对齐 | 多数开源模型 | 50% 附近 | 50% | 零样本直接作答 |
表格显示 Gemini 在全局语义对齐上远高于随机与开源模型的 50% 附近水平,支持商用模型跨模态对齐更强的判断。但限制是该表只呈现论文原句直接给出的代表性数字,未展开每个模型的精确率召回率全矩阵;未胜出项是多数开源模型在全局与时间任务上未超过随机,复现时应保留完整基线,不能只报最优模型。百分点差与相对百分比含义不同,此处仅为准确率百分点的直接对照。
反证:失败是因为听不清、看不准还是对不齐?
论文做了 4 组分析来定位失败原因。第一组测语音识别。给定 SVHalluc 视频,问模型音频中人在说什么,用 Whisper 生成伪真值对照,Qwen3-Omni 取得低词错率与高词信息保留,说明能听懂大部分语音内容,因此听不清不是主要瓶颈。第二组加语音转写文本。把 Whisper 转写拼到原问题后输入,发现细粒度与语义绑定准确率提升,说明文字形式有助于理解。
但在跨模态时间绑定上加转写反而下降,因为语音此时是描述另一时间的干扰,文字强化了干扰;全局、时间对齐与预测变化不大,说明这些任务超出单纯听清的难度。第三组测语音时刻定位。问模型语音在音频中的起止秒数,与 Silero-VAD 这一常用语音活动检测模型的预测算交并比,得到较高的一致性,说明模型能定位何时听到语音,时间定位能力不是主因。第 4 组做单模态消融。
只给语音时细粒度、绑定与时间绑定下降,说明有效用了视觉;只给视频时细粒度与绑定反而提升,因为语音在这些任务中是干扰,但时间绑定下降,因为缺了语音就无法做时间接地;而全局、时间对齐与预测在去掉任一模态后变化有限,暴露模型本就没有做好对齐。
语音识别 × 跨模态理解: 语音识别负责把音频转成文字内容,分工是单模态听懂说了什么;跨模态理解负责把听到的内容与看到的画面对应起来,分工是双模态对齐与推理。搭配理由是论文要排除听不清导致的失败,组合意义在于证明模型能听清却对不准,从而把失败定位到跨模态整合而非听觉本身。
下表整理论文直接报告的单模态能力数字,比较的问题是单模态听与定位是否已足够好,公平条件是同一 SVHalluc 视频与同一伪真值对照,指标方向是词错率越低越好、信息保留与交并比越高越好。
| 能力 | 模型与对照 | 指标 | 取值 | 含义 |
|---|---|---|---|---|
| 语音识别 | Qwen3-Omni 对 Whisper 伪真值 | 词错率 | 0.0915 | 听错少 |
| 语音识别 | Qwen3-Omni 对 Whisper 伪真值 | 词信息保留 | 0.8863 | 保留多 |
| 语音定位 | Qwen3-Omni 对 Silero-VAD 伪标签 | 交并比 | 0.8844 | 定位准 |
表格显示单模态听与定位均较强,支持失败来自跨模态整合的判断。代价与反例是伪真值本身来自 Whisper 与 Silero-VAD,并非人工逐词精标;加转写在时间绑定上带来下降,说明同一干预在不同任务上方向相反,不能一概认为加文字总是有益。论文未测量误判率分解与延迟成本,可能与待验证的因果区分仍需补验证。
边界:哪些结论不能推广?
首先是领域边界。数据来自 YouCook2 烹饪视频,动作物体集中于厨房,即使样本清晰且选项均衡,也不能把结论推广到户外、医疗或工业视频,更不能推广到非英语或强口音语音,因为论文未报告这些条件。其次是指标边界。二选一任务同时看准确率、精确率、召回率与 F1 才完整,只看准确率会掩盖高召回低精确率的盲信对齐问题;不同指标的差值不能混入模型列下比较,自动指标也不能当作人工评价。
第三是证据边界。语音识别与语音定位的定量对照依赖 Whisper 与 Silero-VAD 的伪标签,不是人工金标,论文报告显示单模态强,但这只是支持跨模态为瓶颈的有限解释,不是因果证明。第四是成本边界。论文未报告训练资源、推理开销、输出帧率与实际延迟,总体趋势不等于每组每步都成立,因此不能承诺部署效率或误判率改善。最后是资源边界。
本次未发现可用资源绑定,项目页本次未能确认可达,复现前应先确认数据与代码可达性,不默认已公开。
复现先做什么?关键信息条件有哪些?
复现应从数据与题目模板开始。先按论文取 YouCook2 验证集的过程片段,用 Whisper 得到转写,再按三加三任务模板生成问句:全局问是否描述,细粒度问某物体是否可见,语义绑定问组合事件是否可见,时间对齐问听到时是否同时发生,时间预测问过去现在未来,时间绑定问听到时画面动作是什么并配好 3 类选项。
负样本构造要保留原文条件:全局用跨视频随机拼音频,细粒度用被叙述但不可见物体,绑定用语音动作加视觉物体或视觉动作加语音物体的合理组合并过滤不合理项,时间用听到时刻与视觉发生时刻的远近划分过去现在未来。质量控制要保留语言模型初筛加人工终验,确保语音非过短且清楚描述视觉场景。评估时保持零样本、同一提示模板、二选一计分把是当正样本、多选计准确率,并保留随机基线。
关键超参数方面,论文未给出被测模型的解码温度等推理细节,这是具体缺项,复现时应固定并记录自己的解码设置以保证可比。先跑随机基线与一个开源模型核对是否复现出 50% 附近现象,再加入转写与单模态消融两组对照,观察细粒度提升与时间绑定下降是否同向出现。
何时值得尝试语音接地?还需补哪项验证?
当应用中语音会描述不在当前画面的内容,或会提前预告、事后回顾步骤时,值得用 SVHalluc 的思路做检验,例如烹饪助手、手术示教、操作指导视频,若模型盲信语音就会把未发生的动作当成已发生,带来安全风险。此时应先测全局语义对齐是否出现高召回低精确率,再测时间预测能否区分过去现在未来,最后用绑定任务检验是否拼贴出不存在的事件。
还需补的验证包括:换领域与换语言后的表现,人工精标下的语音识别与时间定位对照以替代伪标签,以及加转写干预在不同任务上的代价分解。总体判断是论文报告显示开源模型能听清、能定位语音时刻,但在跨模态语义对应与时间关系上接近随机,而商用模型显著更好,这支持跨模态理解为当前短板的解释,但仍属有限解释,需待跨领域与人工金标验证后才能确立因果。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

