英文题目:LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding.

会议身份:conference:acl:2026:conference-paper-id:2026.findings-acl.965

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #音视频 #音视频问答

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • ZhaoYang Han:机构信息未能从会议 PDF 纯文本可靠映射
  • Qihan Lin:机构信息未能从会议 PDF 纯文本可靠映射
  • Hao Liang:机构信息未能从会议 PDF 纯文本可靠映射
  • Bowen Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhou Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Wentao Zhang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

LongInsightBench 面向平均 539 秒的人类中心长视频,输入为视觉帧与音频语音及环境声,输出为多项选择答案,要求在数十分钟跨度上完成视听对齐与跨事件因果推理。构建链分四步推进,视频筛选先以时长大于 7 分钟与场景切换及语义话题数为条件保留高密度样本,转录与切分输出事件边界后进入多模态标注,视觉描述由 Ovis2.5-9B 生成而音频描述由 Gemini2.0-Flash 生成并一同送入问答合成,最后三阶段质检剔除单模态可解与低分样本。与以往短片段或纯视觉长视频基准的关键机制差异在于同时强制事件内定位与事件间排序演化因果六类任务,并显式要求双模态证据缺一不可。在 1001 个视频与 4781 道题的评测中 Gemini3-Pro 以 80.04% 总准确率居首并在跨事件因果上显著领先开源模型。结论仅适用于讲座访谈与旅行记录类英文高语言密度内容,对低语音密度与强动作依赖视频尚未验证。原文未披露训练成本,仅披露本地 16 卡 A800 约 250 GPU 小时与 Gemini2.5-Flash 约 700 美元调用费用。

🔗 开源与复现资源

  • 数据相关资源:https://huggingface.co/datasets/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文从哪些证据讲起?

本文解读的对象是 1 篇以人为中心的长视频全模态评测论文,目标读者是刚进入语音、音乐与音频方向的研究生。输入是论文正文给出的确定性证据,不引入外部评价。需要保留的关键信息包括数据规模与来源、6 类任务定义、3 步质检流程、主实验的模型层次、模态替换对照与帧数消融。输出是 1 篇可核对、可复述方法的技术解读。全文按学习依赖展开,先讲任务与相关路线,再讲构造全景与组件分工,然后讲实验条件、结果与反证,最后讲复现动作。

术语首次出现时先用白话解释,再给出英文名,后文固定简称。教学用的举例会明确标为例子,不虚构数值。资源状态方面,论文附带的数据集链接本次未能确认可达,因此不能写已公开可用,只能写本次未能确认可达,后续复现应以原文与可实际下载的 FineVideo 来源为准。

已有评测为何测不出长视频里的人?

先把白话讲清。视觉语言模型指只看图像与文本的模型,音频语言模型指只听声音与文本的模型,全模态模型指同时看画面、听声音、读文本并统一推理的模型,英文为 Omni-modal Models,简称 OLMs。已有短视频问答多在十几秒到一两分钟内考动作识别或片段问答,模型只需局部感知。长视频评测如 Video-MME 与 LoVR 把时长拉长,但原文指出它们没有关注音频信息。音视频问答如 AVQA 与 Music-AVQA 加入了声音,但时长仍短,考的是片段级对应。

LongVALE 做视觉音频语言事件理解,侧重时间 grounding 与描述,缺少对复杂人本推理的强调。WorldSense 需要昂贵人工标注,Daily-Omni 因固定时长切分带来语义断裂。情感与意图方向的工作多依赖静态图像或短对话,难以评估观点随时间演变。本文的切入点是把时长、人本线索与 3 模态融合放在一起,要求模型在讲座、访谈与生活记录类视频中跟踪人的观点、意图、行动与情绪,并把口播语言与视觉上下文对齐。理解这 1 对照,才能明白后文为何设置事件内与事件间两类任务。

六类任务分别要求模型做什么?

论文把考查分为事件内任务与事件间任务。白话是,事件指按语义切分出的一段连续片段,事件内是只看一个片段就能判断,事件间是必须联合多个远距离片段才能判断。事件内含 3 类。第一是事件内推理,英文为 Intra-event Reasoning,简称 IE-Rea,要求在约 1 分钟窗口内结合画面与声音推出因果或结论。第二是时间定位,英文为 Temporal Localization,简称 T-Loc,要求给出同时具有特定视觉动作与特定音频信息的时刻段。

第三是音画对齐,英文为 Audio-Visual Alignment,简称 AV-Align,要求由声音找到对应画面特征,或由画面找到对应声音。事件间也含 3 类。第四是时间线重建,英文为 Timeline Reconstruction,简称 T-Recon,要求把来自至少 3 个事件的多个子事件恢复为时间顺序。第五是话题观点演变,英文为 Topic/Stance Evolution,简称 Topic Evo&Sum,要求总结关键话题或人物立场如何发展。第六是跨事件因果,英文为 Cross-event Causality,简称 CE-Caus,要求跨越至少 3 个事件找到结果的先行原因。

题目采用选择题,单选与多选由生成模型按复杂度动态决定,判对标准是全部选项完全选对。 下面这段导读帮你带着问题看第一张任务示例图,重点是比较局部证据与全局证据的跨度。

看图路径: 1. 先看蓝色事件内示例的时间戳与四个选项分别依赖画面字幕还是语音陈述;2. 再看绿色事件间示例六个子事件中公式画面与口播关键词如何配对;3. 对照上下两题的正确选项,体会局部判断与全局排序的证据跨度差异

原论文 Figure 1:Task Samples in LongInsightBench.

论文图 1。原论文 Figure 1:“Task Samples in LongInsightBench. The upper one comes from IE-Rea(Intra-Event Reason- ing) subcategory and the lower one comes from T- Recon(Timeline Reconstruction) subcategory.”。

上图上半是事件内推理示例,给出起止时间戳与化妆师纠纷的 4 个选项,正确答案需要同时用到屏幕文字与解说评价,单看画面或单听声音都会选偏。下半是时间线重建示例,6 个子事件把小车过街、公式出现、椰子静置与滚落等画面线索与口播中位置能量、动量等关键词绑定,正确顺序要求把远距离锚点串起来。这张图说明事件内考的是同时性,事件间考的是顺序性与因果性,后文的性能差异正源于此。

从原始视频到可用题目,流水线经过哪四站?

把一个长视频变成一道可靠题目的过程可分为四站。第一站是来源选择与过滤,从公开 FineVideo 数据集中挑选讲座、访谈与生活记录类内容。第二站是切分与多模态标注,先做语义切分得到事件,再为每段生成视觉描述与音频描述。第三站是题目合成,用大模型按 6 类任务模板生成问答与参考推理链。第四站是 3 步质检,依次做可执行过滤、打分过滤与人工抽检。下面导读帮你按从左到右的顺序读总览图。

看图路径: 1. 沿左侧视频筛选三条箭头看到时长、场景切换与语言复杂度的并列要求;2. 比较左下视觉描述与音频描述两个气泡的关注对象有何不同;3. 看右侧三步质检如何从执行过滤走向打分过滤再到人工复核

原论文 Figure 2:Overview of the LongInsightBench construction workflow.

论文图 2。原论文 Figure 2:“Overview of the LongInsightBench construction workflow.”。

该图左侧第一栏用时长限制、场景切换与语言复杂度三支箭头指向约 1000 个视频,含义是时长大于 7 分钟、至少 3 次场景切换、至少 4 次话题转移才保留。左下第二栏把切分片段送视觉模型写画面描述,把音频轨送音频模型写语音内容、语气、音乐与环境声。中间第三栏展示事件内 3 类与事件间 3 类任务图标,并给出包含问题编号、类型、选项、所需事件、所需模态、正确答案与参考推理的数据范式。右侧第四栏展示先用单模态模型做可执行过滤,再用打分器按相关性、充分性与一致性过滤,最后人工替换模糊选项与删除重复题。这张图是后文所有复现动作的总地图。

筛选、标注与合成各自解决什么具体动作?

筛选的具体动作分 3 层。时长层要求大于 7 分钟,目的是逼模型保持长程上下文。视觉动态层用场景检测工具找镜头切换,只保留至少 3 次 distinct 场景变化的视频,保证画面不是静止讲头。语言复杂层先用语音识别转写并剔除非英语,再用大模型做段落级语义切分,只保留至少 4 次话题转移的视频,保证有可追踪的观点流。标注的具体动作是双路并行。

视觉路用 Ovis2.5-9B 写一段话,聚焦人物动作手势服饰表情、可见物体与屏幕文字、环境氛围与帧间变化,要求写成连续叙事而非孤立快照。音频路用 Gemini2.0-Flash 写一段话,按时间顺序描述语音内容与语气、音乐风格情绪乐器、背景声特征与环境推断,不写时间戳,不确定不猜。合成的具体动作是把视频全局摘要与随机抽取的 2 到 3 个事件及其视听描述一起交给 GPT-4o,按任务模板生成四选项题目。

事件内题只用一个事件编号,事件间题至少用 3 个事件编号,且明确要求单模态证据不足以作答。

事件内任务 × 事件间任务: 事件内任务负责约 1 分钟窗口内的局部感知与推理,分工是把同时出现的视觉动作与语音内容对齐并做因果判断;事件间任务负责跨越多个不连续事件的长程记忆与综合,分工是排序、追踪观点演变与建立因果链;二者搭配的理由是只测局部会漏掉长程依赖,只测全局会掩盖定位误差,组合后才能区分模型是看不清当前片段还是记不住远距离联系。

全模态模型 × 单模态可解性过滤: 全模态模型指同时输入视频帧与音频波形做统一推理的模型,分工是完成原始像素与声波的对齐融合;单模态可解性过滤指用纯视觉或纯音频模型能答对就删除该题,分工是保证剩余题目不是靠单一线索投机;搭配原因是只有先剔除单模态捷径,才能把全模态模型的得分解释为真正的融合能力,而不是单通道记忆。

时间定位 × 音画对齐: 时间定位负责在长达数百秒的时间轴上指出目标事件的起止段,分工是检验多模态时间 grounding 精度;音画对齐负责给定一端线索找出另一模态的对应表现,分工是检验跨模态内容匹配;搭配原因是定位回答何时发生,对齐回答何物对应何声,二者结合才能说明模型既找得准时刻又没有张冠李戴。

沿一个样本走一遍有助于复述。假设输入是一段 8 分钟的访谈,先转写发现有 5 次话题转移且有 4 次场景切换,通过筛选。然后切分为事件,某事件的视觉描述写明嘉宾手势与屏幕标题,音频描述写明主持人介绍与语气。合成时若生成时间定位题,则题干同时给出视觉标题与口播介绍,选项为 4 个时间段,只有同时对上两路证据的时段为正确。若生成跨事件因果题,则指定靠后事件中的名片特写为结果,要求从靠前事件中选出建立权威与呼吁联系的多个原因。这一遍走完,输入到表示到组件到目标到输出的链条就闭合了。

本研究训练了什么,没有训练什么?

本研究没有训练任何新模型,这是一个数据集与评测论文,不是模型训练论文。没有梯度更新、没有参数冻结与解冻、没有优化器步骤,也不能从模型名称推定其内部实现。真实的计算过程是构造、标注、过滤与调用评测。构造侧调用语音识别、场景检测、视觉描述、音频描述与题目生成模型,监督来源是视频本身的画面、声音与转写文本,以及生成模型给出的参考推理链。

评测侧按各模型官方推理管线输入视频帧与音频,本地开源模型统一抽取 64 帧,专有模型走官方接口的默认多模态设置。质检侧调用单模态模型做可执行判断,调用打分模型做 3 维评分,再投入约 120 人时的人工抽检。若按 10% 抽检且某类低质比例超 25% 则继续抽下一批,直到低于阈值。最终约 18% 题目被改写措辞或选项,约 13% 因模糊、错位、重复或过于简单被删除。下面看数据分布图有助于理解构造结果的偏向。

看图路径: 1. 先看横轴子类别名称区分讲座、访谈与生活记录三类来源;2. 再读每个柱顶数字比较 science_explainers 与 film_trailers 的数量落差;3. 结合柱高分布判断数据是否偏向讲解类而叙事类样本相对较少

原论文 Figure 4:The distribution of videos in LongInsightBench across all subcategories.

论文图 4。原论文 Figure 4:“The distribution of videos in LongInsightBench across all subcategories.”。

该柱状图横轴为子类别,纵轴为视频数,柱顶标出具体数量。可以看到讲解类柱较高而影视预告片类较低,例如科学讲解与软件教程数量明显多于预告片。这意味着评测更偏重口播密集的内容,对依赖快速剪辑与音乐的叙事类覆盖较少。复现或扩展时若想补齐短板,应优先补充该类低数量子类别,而不是均匀加量。

评测比较了谁,条件是否一致,指标如何算?

主实验比较 11 个全模态模型,包括 Unified-IO-2 的 3 种规模、VideoLLaMA2 与 VideoLLaMA3、Ola-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B,以及 Gemini2.5-Flash、Gemini2.5-Pro 与 Gemini3-Pro。附加对照把 Gemini2.5-Flash 分别作为纯视觉加音频描述、纯音频加视觉描述、纯文本加双描述来运行,以检验融合效果。帧数消融在 32、64 与 128 帧三档上测开源模型。公平条件是本地模型统一帧数与官方预处理,专有模型用默认接口设置。指标为准确率,方向是越高越好,判对要求多选题全部选项完全一致,属于严格评分。

数据划分为 1001 个视频与 4781 个高质量问答,平均时长 539 秒,讲座、访谈与生活记录 3 类分别约 517、258 与 230 个视频。成本方面,本地使用 16 块 A800 约 250 GPU 小时,云端 Gemini 调用约 700 美元。下面的数据规模表把分散在正文中的数量集中呈现,表中数字均来自原文连续句,单位保留原文写法。 比较的问题是数据是否足够长、足够密且覆盖人本场景,公平条件是同源 FineVideo 经同样三重过滤,指标方向是视频越长、话题转移越多则推理难度越大。

大类视频数子类别数内容举例平均时长
讲座5178学术报告与教程539 seconds
访谈2584名人专家与体育访谈539 seconds
生活记录与预告2304露营徒步与旅行539 seconds
总计100116约 1000 个视频4781 high-quality QA pairs

表后解释是,讲座类数量过半保证了口播密度,访谈类保证了观点追踪,生活记录类保证了动作与音画动态,但总数仍约千量级,子类别不均衡意味着按子类别聚合时小类方差会大。未胜出项是影视预告片等叙事类数量偏少,复现时不应只看总体准确率,还应按大类分别报告,避免被大类主导结论。

谁在全局领先,谁在定位与因果上掉队?

论文报告显示 Gemini3-Pro 总体准确率为 80.04%,在 6 类中 5 类最高或次高,是明确的性能上限。开源侧 Qwen3-Omni-30B 总体 58.84% 为开源最好,Ola-7B 总体 55.30% 紧随其后,Qwen2.5-Omni-7B 总体 53.22%。Unified-IO-2 L 总体仅 17.46%,是最低点。任务维度上,事件内好于事件间。音画对齐相对容易,Gemini3-Pro 达 88.55%。

时间定位分化最大,从 Unified-IO-2 L 的 3.49% 到 Gemini3-Pro 的 79.07%,说明它是区分模型的关键瓶颈。话题演变总结相对容易,Gemini3-Pro 达 94.12%,Qwen2.5-Omni-7B 达 88.24%。跨事件因果最难,Gemini3-Pro 仅 57.27%,Unified-IO-2 XXL 仅 0.91%。失败案例显示时间定位错误源于把相似线索误认为目标并幻觉时间戳,跨事件因果错误源于只抓住最近线索而丢掉早期链条。下面先看雷达图的总貌。

看图路径: 1. 先找到最外圈的 Gemini3-Pro 多边形确认其在六个轴上的包络最大;2. 再比较中心附近 Unified-IO-2 系列小多边形在时间定位轴的收缩程度;3. 观察跨事件因果轴整体内缩,确认该维度是所有模型的公共短板

原论文 Figure 3:Fine-grained performance across task cate- gories.

论文图 3。原论文 Figure 3:“Fine-grained performance across task cate- gories.”。

该雷达图有 6 个轴,分别为事件内推理、时间定位、音画对齐、时间线重建、话题演变与跨事件因果。外圈大面积多边形对应 Gemini 系列,中心小多边形对应 Unified-IO-2 系列。可见跨事件因果轴整体向内凹陷,时间定位轴的内外层间距最大。这支持论文判断,即叙事跟踪已较好,但精确定位与长程因果仍是短板。

时间线重建 × 跨事件因果: 时间线重建负责把打乱的子事件按发生顺序复原,分工是检验对远距离音画锚点的记忆与排序;跨事件因果负责从相隔至少 3 个事件的先行事件中找到结果的直接原因,分工是检验多步因果链的整合;搭配原因是排序只要求先后,归因还要求解释如何导致,二者一易一难,共同标定长程推理的上限与短板。

重提结果时增加适用条件是,上述层次在 64 帧与默认接口条件下成立,换帧数或换描述模型后相对顺序可能变化,不能把单点排名推广为所有配置下的必然胜负。

把一路模态换成文字为何反而变好?

论文用 Gemini2.5-Flash 做模态替换对照。白话是,文本代理指不直接喂原始像素或波形,而是喂另一模型写好的描述文本。视觉语言配置指看原始画面加音频描述文本,音频语言配置指听原始音频加视觉描述文本,大语言模型配置指只看双路描述文本。结果显示原始全模态为 69.02%,纯文本已达 70.69%,视觉语言与音频语言更高,音频语言最高达 75.05%。按提升幅度看,音频配置最多提升 6.03%,视觉配置提升 3.54%,纯文本提升 1.67%。

论文把这一现象称为融合缺失悖论,解释有三点。第一,文本代理过滤了原始流的噪声与冗余。第二,只剩一路原始模态时注意力可集中对齐。第三,底层大语言模型本就更擅长处理高质量文本。重要的是题目已过滤掉单模态可解,因此瓶颈不在证据缺失,而在长时程原始视听融合不完善。

相关工作对照也支持语言偏置的普遍性,但本文把结论扩展到文本视觉音频长视频与人本任务。

文本代理 × 融合缺失悖论: 文本代理指把一路原始模态换成视觉描述或音频描述文本再输入,分工是提供去噪后的预解析信息并减轻对齐负担;融合缺失悖论指原文观察到的用文本代理反而高于原始双模态直接融合的现象,分工是指出当前融合机制在长时程上引入信息损失;搭配意义在于用可运行的替换对照把融合质量与单通道能力分开,避免把语言偏置误读为多模态理解。

比较的问题是替换后是否公平,公平条件是同一题目、同一判分标准,只改变输入形态,指标方向仍是准确率越高越好。

配置输入形态总体准确率相对原始全模态提升论文给出的机制
原始全模态原始视频加原始音频69.02%基线直接融合有损失
音频语言原始音频加视觉描述75.05%6.03%视觉经文本去噪
视觉语言原始视频加音频描述待验证3.54%音频经文本去噪
纯文本双路描述文本70.69%1.67%语言模型擅长文本

表后解释是,主要收益来自把视觉换成文本,代价是引入描述模型的误差与信息压缩,不能理解为文本永远优于原始信号。

未胜出项是纯文本并未超过音频语言配置,说明保留一路原始信号仍有价值。未评测边界是换用不同描述模型后提升幅度是否稳定,原文只报告了部分组合,复现时应固定描述模型版本再比较。 帧数消融的比较问题是视觉密度增加是否有用,条件是同一开源模型分别抽 32、64 与 128 帧。

模型32 帧128 帧趋势论文判断
Ola-7B53.64%56.96%上升有效利用时序
VideoLLaMA337.83%43.45%上升有效利用时序
Qwen2.5-Omni-7B52.95%53.22%饱和容量或利用受限
Unified-IO-2 XXL30.98%31.39%几乎不变利用稠密证据困难

表后解释是,增加帧数总体有帮助但高度依赖模型,Ola 与 VideoLLaMA3 增益明显,Qwen2.5-Omni 很快饱和,Unified-IO-2 几乎无变化。代价是更多帧带来更大计算量,复现时应在同一硬件预算下权衡帧数与批量,不能把末点最优推广为全程单调。

哪些结论不能从现有证据推出?

论文明确报告的局限是依赖 GPT-4o 与 Gemini2.0-Flash 做过滤与生成,带来高 API 成本,限制扩展速度。未报告项包括推理延迟、逐题误判率统计显著性与人工评分一致性,不能承诺这些量得到改善。相关性不等于因果,例如帧数与准确率同升不能直接说成因果,还需排除解码策略与采样位置的影响。总体趋势不等于每组成立,例如话题演变的高分不代表每个子类别都高,小类样本少时波动会大。数据方面只覆盖英语转写内容,非英语与危险歧视内容被排除,因此结论不适用于多语场景。

题目虽经 3 步质检,但人工仅抽检约 10% 并按阈值追加,剩余题目仍可能存在措辞模糊。未来工作指向构建可规划检索与多步推理的训练数据,以及重新设计融合结构,但这些是待验证方向,不是已证明的修复方案。

要复现这套评测,先做什么,后补什么?

先做三件事。第一,准备 FineVideo 来源并复刻过滤,先转写并剔除非英语,再做 2 阶段语义切分,先让模型估计话题数与标题,再让模型输出边界前后原话并用正则提取,避免让模型直接重写长文本。第二,复刻双路标注,视觉路强调人物、物体文字、环境与变化并写成一段连续叙事,音频路按语音、音乐、背景声与其他声分类写成一段不带时间戳的描述。

第三,复刻题目合成与质检,合成时同时给全局摘要与 2 到 3 个事件描述并限定事件编号数量,质检时先用视觉模型与音频模型分别试答剔除单模态可解,再按相关性、充分性与一致性打分并只保留三项满分,最后按约 10% 抽检并在低质超 25% 时加抽。关键超参数是时长大于 7 分钟、至少 3 次场景切换、至少 4 次话题转移、本地评测 64 帧、判对要求全选一致。还需补的验证是固定描述模型版本后的融合对照、按大类与任务分别报告的细粒度表,以及多次采样的方差。

代码与权重方面,原文只说明合成数据与标注的发布意向,本次数据集链接未能确认可达,因此应把可运行性分为 3 层记录,即构造代码是否可跑、模型权重是否可下载、端到端评测是否可在本地复跑,不要混为一谈。

何时值得用它,何时不必强求?

当研究目标是长视频中人的观点跟踪、音画时间 grounding 或跨事件因果时,这套评测值得尝试,因为它同时给出定位精度与长程推理的分离信号,且提供可复述的构造与质检动作。当研究只做短片段分类或纯视觉问答时,不必强求全量运行,可只取事件内子集做快速验证。论文特有的误解有三点需要澄清。第一,总体高分不等于融合好,模态替换对照显示文本代理可能更高,应同时报告原始与替换两种配置。

第二,帧数增加不等于所有模型都受益,应按模型分别报告饱和点。第三,话题演变易、跨事件因果难,说明记住主线不等于建立因果,复现时不要用前者代替后者。收束一句话是,先用约千视频与近 5000 题标定长程人本理解的短板,再回到融合机制与采样策略上找可验证的改进。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 11 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 acl-2026 论文汇总