📄 AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs
#音视频理解 #多模态模型 #基准测试
7.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5
✅ 7.6/10 | 前25% | #音视频理解 | #多模态模型 | #基准测试 | arxiv
👥 作者与机构
- 第一作者:Yaoting Wang(复旦大学大数据学院)
- 通讯作者:Henghui Ding(复旦大学大数据学院)
- 作者列表:Yaoting Wang(复旦大学大数据学院)、Ziyi Zhang(华中科技大学)、Wenming Tu(上海交通大学)、Shaoxuan Xu(中国人民大学)、Wenjie Du(南洋理工大学)、Cheng Liang(上海交通大学)、Weijun Wang(清华大学智能产业研究院(AIR))、Yuanchao Li(爱丁堡大学)、Guangyao Li(清华大学)、Hao Fei(牛津大学)、Yuanchun Li(清华大学智能产业研究院(AIR))、Henghui Ding(复旦大学大数据学院)、Yunxin Liu(清华大学智能产业研究院(AIR))
💡 毒舌点评
这篇论文野心勃勃地构建了一个认知启发的音视频智能评测基准,四层分类法试图用精巧的数学公式来量化“类人”智能。然而,这套公式的惩罚系数(α=0.5)选择得相当随意,其理论或实证根据约等于零,更像是为了给一个朴素的直觉套上学术外衣。论文声称追求“类人”智能,却将与人类表现的巨大差距简单归因于模型能力不足,而对基准任务本身可能存在的、未对齐人类能力评估的深层问题避而不谈,这无疑是一种自我实现的预言。
📌 核心摘要
这篇名为“AVI-Bench”的论文提出了一个系统化的、认知启发的评测基准,旨在评估全模态大语言模型(Omni-MLLMs)的类人音视频智能。其核心方法是将音视频智能分解为感知、理解、推理三个认知阶段,并创新性地引入了一个“原始感知”(PriSe)阶段,专门评估模型对低语义、不熟悉数据的适应能力。与现有仅关注任务多样性的基准不同,AVI-Bench首次系统性地融入了跨模态平衡、阶段依赖和领域泛化能力的评估。实验对28个全模态大模型进行了评估,结果表明,即使最强的Gemini-2.5-Pro,其总体AVI得分(57.2%)也与人类水平(92.6%)差距巨大。一个关键发现是,简单的平均分具有欺骗性:例如,在平均分上相近的GPT-4o和Gemini-1.5-Pro,在四层分类法的领域自适应(L4)层面表现出了巨大鸿沟(GPT-4o仅为0.55,Gemini-1.5-Pro为23.28),深刻揭示了GPT-4o在音频感知任务上的严重缺陷。本工作提供了一个统一的诊断框架,可有效揭示当前全模态大模型的失败模式。其主要局限性在于,四层智能分类法中的惩罚系数设定缺乏充分的理论或实验校准,且对于模型在特定任务(如空间定位)上极低的表现,未能严格区分是视听智能缺陷还是输出格式解析失败所致。
🏗️ 方法概述和架构
本论文的核心贡献是提出了一个名为AVI-Bench的评测基准及其配套的四层智能分类法,而非一个具体的模型架构。
AVI-Bench的整体评估流程是一个多阶段、多任务的框架。其输入是包含视频和音频的多模态数据,辅以文本指令。模型需根据具体任务要求,生成文本、边界框、类别列表或数值等不同格式的输出,随后通过9种不同的指标进行评估。该基准包含5864个精心设计的样本,分布在14个不同任务中。
评测的核心架构围绕三个主要认知阶段和一个补充阶段展开,旨在模拟人类的认知处理过程:
感知阶段:评估模型从单模态或跨模态输入中检测和识别基本语义实体的能力。此阶段包含四个任务:
- 音频多实例分类(AMIC)和视觉多实例分类(VMIC):评估模型从一个输入中检测多个共存的声音或视觉实体的独立感知能力。
- 音视频定位(AVL):要求模型识别出声源在视觉场景中的空间位置,考察细粒度的跨模态对齐和局部感知能力。
- 音视频匹配(AVM):评估模型判断给定音频和视觉输入是否匹配的能力,属于全局感知层面的评估。
理解阶段:评估模型融合和推理多模态上下文的能力,这对于解读真实世界场景至关重要。此阶段包含三个任务:
- 音视频字幕(AVC):要求模型基于视觉和听觉信息生成一段连贯的场景描述,评估其叙事性理解。
- 视觉参考音频检索(VAR)和音频参考视觉检索(AVR):评估跨模态关联能力,要求模型在一种模态的线索引导下,从候选集中检索出与另一种模态内容在时间或语义上对齐的实体。
推理阶段:探究模型在整合多模态和文本信息基础上进行高阶推理的能力。此阶段包含四个任务:
- 音视频问答(AVQA):对音视频事件进行整体理解并回答相关问题,测试粗粒度推理。
- 音视频语言定位(AVLG):要求精确地定位出自然语言所描述的对象或事件,测试细粒度推理和空间-文本跨模态对齐。
- 音频引导的视觉幻觉检测(AVH)和视觉引导的音频幻觉检测(VAH):在输入中构造跨模态不一致信息,评估模型抵抗产生幻觉的能力,测试其在复杂或带噪环境下的鲁棒性。
原始感知(PriSe)阶段:此阶段独立于上述三个阶段,旨在评估模型在面对分布外、包含低语义信息的不熟悉数据时的适应能力。它试图解答“模型是否具备类似人类的低级感官处理能力,还是仅仅在做模式匹配”这一根本问题。包含三个任务:
- 音频感知问答(ASQA)、视觉感知问答(VSQA)和音视频感知问答(AVSQA)。这些任务使用受控的低语义刺激,例如探测模型对颜色、音量、纹理或几何形状变化的感知能力。
基于以上四个阶段的评估结果,论文进一步提出了四层级的AVI分类法。这是一个对评估结果进行“二次加工”的分析性框架,旨在从四个维度量化模型的类人智能程度:
- 层级一:任务自适应(L1):计算所有任务的平均性能,作为基础能力基线。公式为 \(S_T = \frac{\sum_{t_i \in T} F(t_i)}{|T|}\),其中 \(F(t_i)\) 是第 \(i\) 个任务的性能得分。
- 层级二:模态自适应(L2):针对当前模型普遍为“视觉专家”的现象,通过计算听觉主导和视觉主导任务性能的相对差异 \(\Delta_m\),对L1得分进行惩罚。公式为 \(S_M = (1 - \alpha \cdot \Delta_m) \cdot S_T\),其中 \(\alpha\) 设为0.5。
- 层级三:阶段自适应(L3):基于“感知和理解是推理的瓶颈”这一假设,对推理阶段的得分进行惩罚。首先使用“头归一化”公式 \(m̃_t = \max(0, \frac{m_t-c_t}{100-c_t}) \cdot 100\) 将不同难度任务的得分归一化(\(c_t\) 为任务的随机猜测基线)。然后计算推理阶段得分 \(\tilde{S}_R\) 是否超前于其前置阶段 \(\tilde{S}_P\) 和 \(\tilde{S}_U\),若有超前则施加惩罚。公式为 \(S_S = (1 - \alpha \cdot \Delta_s) \cdot S_M\)。
- 层级四:领域自适应(L4):计算熟悉领域(L3得分)和不熟悉领域(PriSe阶段经模态自适应处理后的得分)的调和平均数,以惩罚在新领域表现不佳的模型。公式为 \(S_D = \frac{2 \cdot S_{FD} \cdot S_{UD}}{S_{FD} + S_{UD}}\)。
💡 核心创新点
- 认知阶段化的评测框架:首次将音视频智能的评测明确划分为感知、理解、推理三个阶段,使得对全模态大模型失败模式的诊断可以从单纯的任务得分,深入到“模型是在哪一阶段的认知上出了问题”,提供了比现有基准更精细的诊断能力。
- “原始感知”(PriSe)的评测维度:创造性地引入了使用不熟悉、低语义刺激的评测任务,直接触及大模型泛化能力的核心软肋,探究其究竟是具备真正的感知能力还是仅依赖高级语义的模式匹配。
- 递进式的四层AVI分类法:构建了一个从任务集成到模态平衡、再到跨阶段依赖,最后到领域泛化的递进式分类方案。该方案超越了简单的得分排名,通过公式化的惩罚机制,意图构建一个与“类人智能”更相关的复合评估指标,并通过揭示GPT-4o等案例,证明了其相较于单一平均分的深刻洞察力。
📊 实验结果
论文对28个全模态大模型(含开源和闭源)在AVI-Bench上进行了全面评估。
关键发现与数据:
- 总体性能差距巨大:最强的模型Gemini-2.5-Pro总体得分仅为57.21%,与人类表现(92.6%)存在显著鸿沟。
- 细粒度视听对齐的根本缺陷:在需要跨模态空间定位的AVL和AVLG任务上,所有模型表现极差。即使最强的Gemini-2.5-Pro在这两项上也仅分别达到39.1%和35.1%,多数开源模型得分趋近于0。
- “视觉专家”现象普遍:视觉主导任务(如VSQA、VMIC)的得分普遍高于音频主导任务(如ASQA、AMIC),证实了现存模型的全模态能力发展极不均衡。
- 领域泛化能力脆弱:在PriSe阶段(低语义刺激),所有模型性能都远低于人类,且在AVSQA任务上,即使是Gemini-2.5-Pro也仅得16.5%,低于其自身在其他任务上的表现,也低于Gemini-2.5-Flash(24.74%),证明了模型在训练分布外领域的脆弱性。
- 平均分指标的欺骗性:四层分类法显著拉开了在平均分上看似接近的模型。例如,GPT-4o的L4得分仅为0.55,远低于Gemini-1.5-Pro的23.28,主要是因为GPT-4o在ASQA任务上得分几乎为0(0.4%),揭示出其音频感知能力的巨大缺陷。
关键数据表(来自论文Table 3 & Table 5):
Table 3: 各阶段任务得分 (部分)
| Omni-MLLMs | Params. | Perception avg. | Understand avg. | Reasoning avg. | PrimitiveSensation avg. | Overall avg. |
|---|---|---|---|---|---|---|
| Gemini-2.5-pro | - | 54.58 | 68.97 | 69.06 | 36.22 | 57.21 |
| Gemini-2.5-flash | - | 45.97 | 43.79 | 63.70 | 30.63 | 46.02 |
| Gemini-2.0-flash | - | 44.27 | 42.11 | 64.03 | 29.48 | 44.97 |
| Qwen2.5-Omni | 7B | 42.81 | 39.68 | 58.26 | 24.59 | 41.33 |
| GPT-4o | - | 40.45 | 48.60 | 56.87 | 16.81 | 40.68 |
| Gemini-1.5-pro | - | 41.69 | 35.33 | 61.19 | 23.30 | 40.38 |
| Human-Omni | 7B | 28.70 | 18.14 | 49.94 | 16.82 | 28.40 |
| Video-LLaMA2 | 7B | 32.45 | 16.32 | 39.95 | 20.34 | 27.27 |
| NExTGPT | 7B | 7.52 | 16.93 | 14.86 | 10.69 | 12.50 |
| Human | - | ~92.1 | ~90 | ~97.2 | ~89.6 | 92.6 (估算) |
Table 5: 四层分类法得分 (部分)
| Models | Params. | Level1 (L1) | Level2 (L2) | Level3 (L3) | Level4 (L4) |
|---|---|---|---|---|---|
| Gemini-2.5-pro | - | 64.20 | 62.80 | 57.08 | 32.97 |
| Qwen2.5-Omni | 7B | 46.92 | 45.93 | 37.61 | 25.89 |
| GPT-4o | - | 48.64 | 47.19 | 41.93 | 00.55 |
| Gemini-1.5-pro | - | 46.07 | 42.84 | 32.67 | 23.28 |
| Human-Omni | 7B | 32.26 | 29.79 | 19.62 | 16.96 |
| Video-LLaMA2 | 7B | 29.57 | 24.99 | 18.71 | 16.99 |
🔬 细节详述
- 训练数据:不适用(本论文为基准测试,非模型训练)。
- 损失函数:不适用。
- 训练策略:不适用。
- 关键超参数:对于L2和L3分类法中的惩罚系数α,均设定为0.5。对于L3分类法中的头归一化,每个任务的随机猜测基线 \(c_t\) 在附录G.2.2中定义。评估采用固定随机种子(seed=42)和标准化提示。为保证评测准确性,PriSe阶段采用了“双重确认”机制(Double-confirmation)来减少模型在低语义数据上的幻觉干扰。
- 训练硬件/推理细节:所有未通过API调用的模型评估均在单张80GB NVIDIA A800 GPU上执行。对于闭源API模型,GPT-4o系列采用级联方式,即先用纯音频版模型生成描述,再输入给视觉语言模型。输出格式通过GLM-4-Flash模型进行标准化后处理。
- 正则化或稳定训练技巧:不适用。
⚖️ 评分理由
创新性 (1.2/2):该基准在设计思路和评测维度上有明确创新,将认知阶段和“原始感知”概念引入评测,四层分类法提供了超越简单平均分的分析视角。但多数具体任务仍是已有任务的子集或重构,具体的任务设计层面根本性创新有限。
技术严谨性 (1.0/1.5):评测流程规范,样本经过人工验证,统计显著性分析充分,并且采用了输出格式标准化处理和双确认机制来保证评测准确性,工程上比较扎实。但四层分类法的数学结构是方法论上的薄弱环节。模态自适应中的α=0.5、阶段自适应中的瓶颈惩罚和调和平均组合选择等设计缺乏理论论证和鲁棒性分析(如α参数的影响),使得该分类法更像是一种启发式算法而非严谨的测量理论,其对最终排名的影响力过大而缺乏根基。
实验充分性 (1.3/1.5):实验评估了28个模型,覆盖了主流方案并报告了人类表现作为上限,规模可观。为消除随机性,进行了不同种子和输出格式的消融分析,并分析了单模态输入对多模态任务的影响,增强了结论的可靠性。主要不足在于,未对模型在特定任务(如AVL/AVLG)上得分趋近于零的现象进行更深层的归因分析,未能有效区分这究竟是视听智能的绝对上限问题还是输出格式解析的工程失败。
清晰度 (0.8/1):论文整体结构清晰,图例质量高,四阶段评测和分类法的概念易于理解。但分类法部分的数学公式表达不够直观,尤其是L3的瓶颈差异和头归一化组合在一起时,需要读者反复查阅才能理解其对排名的具体影响。
影响力 (1.0/1.5):作为一个聚焦于全模态大模型音视频智能的评测基准,它对特定子领域的研发和数据构建具有明确的指导意义,指出了“重视觉轻音频”和“零样本空间定位能力缺失”等关键痛点。但全模态模型本身仍处于发展初期,受众相对聚焦,其长期影响力高度依赖于该领域能否持续成为研究热点。
开源 (1.0/1.5):论文提供了项目主页链接,这是一个很好的起点。在论文提供的材料中,明确提及了数据集,但未直接提供代码和模型的独立仓库链接,导致“has_code”和“has_model”仍为“未说明”。由于主页或附录提供了数据集和相关细节,此项可得1.0分。
可复现性 (0.3/0.5):实验设置中提到了随机种子、标准化提示和响应格式掩码等,对复现评测过程有很大帮助。但对闭源模型API调用的具体参数(如温度值、max_tokens)未完全透露,且GLM-4-Flash格式化步骤的具体Prompt也未给出,这些都阻碍了严格意义上的精确复现。
工程/实践价值 (1.0/1.5):这项工作构建了一套完整的基准评测pipeline,包含了数据格式化、结果标准化后处理、多种指标计算和四层分析框架,这些工程组件对未来构建类似的全模态评估系统有直接参考和复用价值。但其主要产物仍是一个研究型评测工具,距工业级、持续的模型验证平台尚有距离。
🚨 局限与问题
论文明确承认的局限:
- 论文承认“类人”并不意味着直接比较模型性能和人类得分,并指出这种直接比较可能有误导性。
- 作者承认AVI-Bench构建于许多已有的经典视听任务之上,其贡献不在于创造新任务,而在于系统性组合和解释。
- 作者承认PriSe阶段的评测格式(MCQ)即使在采用双确认机制后,仍面临根本性挑战,未来应考虑更灵活全面的问答格式。
- 论文承认其数据规模(5864个样本)是精心策划的结果,旨在评估而非训练。
审稿人发现的潜在问题:
- 分类法的任意性:四层分类法的核心弱点在于其惩罚系数和聚合函数的选择过于任意。例如α=0.5和调和平均数的选择缺乏理论推导或系统性的实验校准。审稿人需要看到,改变这些参数在何种程度上会颠覆现有排名,以评估该方法论作为评价体系的鲁棒性。
- 低性能原因混淆:许多开源模型在定位任务(AVL/AVLG)上得分几乎为0。作者简单归因于能力不足,但论文自己的消融实验(Table 7)已证实,在单模态设置下或在更换输出格式后,模型性能会发生巨大变化。这有力地质疑了零样本得分是否真实反映了视听智能的缺陷,而非仅仅是模型在指令遵循或输出格式上的失败。未将此点作为核心局限性深入讨论是论文的重大疏漏。
- “类人”概念与方法的错位:论文反复强调“类人”智能,但其核心评估方法(四层分类法)是通过与随机基线比较的“头归一化”和对失衡的“惩罚”来构建的,这与认知科学中测量人类智能的方法几乎没有直接联系。这种错位使得“类人”更像一个营销口号而非科学指标。