📄 FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

#音视频问答 #指令微调

8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 1.1/1.5 | 开源 1.1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5

🔥 8/10 | 前25% | #音视频问答 | #指令微调 | arxiv

👥 作者与机构

  • 第一作者:Qian Chen(复旦大学,上海)
  • 通讯作者:Jinlan Fu(复旦大学,上海)
  • 作者列表:Qian Chen(复旦大学,上海)、Jinlan Fu(复旦大学,上海)、Changsong Li(复旦大学,上海;上海创新研究院)、Min Zhang(哈尔滨工业大学,深圳)、See-Kiong Ng(新加坡国立大学)、Xipeng Qiu(复旦大学,上海;上海创新研究院)

💡 毒舌点评

FutureOmni 精准地抓住了当前多模态 LLM 评估中“回顾性理解”泛滥而“前瞻性预测”缺失的真实痛处,尤其是首次将音频拉入未来预测评估的核心,这使得它天生比纯视觉的未来预测基准高出一个段位。然而,OFF 训练策略本质是标准指令微调加上因果推理数据,在方法论上缺乏令人惊喜的架构创新,更像是一次精心设计的数据集和评估框架贡献,而非全新的建模范式。

📌 核心摘要

  1. 要解决的问题:现有多模态大语言模型(MLLM)评估主要聚焦于回顾性理解,忽视了从音视频联合上下文中预测未来事件的能力,尤其是音频模态在预测中的关键作用长期未被系统性地评估。
  2. 方法核心:构建了首个面向 Omni-modal 未来预测的基准测试 FutureOmni(含 919 个视频、1,034 条多选 QA),并提出 OFF (Omni-Modal Future Forecasting) 训练策略。该策略基于 7, 761 条指令微调数据,训练模型基于历史音视频片段进行因果推理和预测。
  3. 与已有方法的不同:区别于纯视觉(VLEP、IntentQA)或纯文本的未来预测基准,FutureOmni 首次将音频模态作为预测的核心信息来源。引入了四种对抗性干扰项(仅视觉、仅音频、延迟、逆因果),迫使模型进行真正的跨模态因果推理。
  4. 主要实验结果:在 20 个模型上进行了评估,表现最佳的商用模型 Gemini 3 Flash 准确率仅为 64.8%,而最强开源 Omni 模型 Qwen3-Omni 为 53.05%。OFF 训练策略使得 Qwen2.5-Omni 在语音密集型场景中提升了近 10%(37.83% → 47.75%) ,video-SALMONN 2 提升了 3.87%。此外,OFF训练还展现了对通用音视频基准的泛化能力提升。
模型CartoonEduEmergSurvDailyMovieGameDocAvg
AVicuna 7B31.6239.0026.0935.2132.8128.1933.7320.8330.37
VideoLLaMA2 7B43.5947.0029.3553.5240.6232.6057.8331.9440.75
Qwen2.5-Omni 3B37.6151.0029.3557.7535.9432.1651.8125.0038.91
video-SALMONN 2 7B43.5955.0039.1357.0448.4440.9757.8334.7246.03
Qwen3-Omni 30B52.9468.0032.8862.7159.0545.6062.6549.2553.05
Gemini 3 Flash62.7175.0058.7080.2868.7559.0365.0653.4764.80
GPT-4o (video-only)44.0665.0034.7857.7452.3450.2251.8036.1149.70
  1. 实际意义:为多模态 LLM 的预测推理能力提供了标准化的评估框架,有望推动自动驾驶、人机交互等需要前瞻性感知的应用场景研究。
  2. 主要局限性:数据集规模相对较小(919个视频),视频时长分布不均,中长视频样本不足导致分析结论可能不稳定。OFF 训练策略创新性有限。评估仅限选择题形式,缺乏开放式生成评估,可能无法完整反映模型的预测能力。

🔗 开源详情

  • 代码:提供了 GitHub 链接:https://github.com/OpenMOSS/FutureOmni
  • 模型权重:未提供 OFF 微调后的模型检查点。
  • 数据集:FutureOmni 评测基准和 FutureOmni-7K 指令微调数据集可通过上述 GitHub 仓库获取。
  • Demo:未提及。
  • 复现材料:训练和推理配置见附录,代码仓库提供了实现脚本。论文本身未提供可直接运行的完整训练配置文件或详细的数据预处理脚本。

🏗️ 方法概述和架构

FutureOmni 的核心方法包括基准构建流水线、评估框架设计和 OFF 训练策略三大部分。

一、基准构建流水线(三阶段)

阶段1:音频协调的视频筛选 (Audio-Coordinated Video Selection)

  • 初始收集:从 YouTube 收集约 18K 视频,时长从 30 秒到 20 分钟不等。
  • 静态场景过滤:以 1 FPS 采样视频帧,使用 CLIP-ViT-B/32 提取视觉特征,计算相邻帧的余弦相似度。若视频的平均帧间相似度高于 70%,则被判定为静态场景过长而被丢弃,旨在保留动态内容丰富的视频。
  • 音频干预筛选:为解决音频仅作背景音或与视频内容弱相关的问题,使用 UGCVideoCaptioner 为每个视频分别生成含有/无音频输入的视频描述,利用 Sentence-BERT 计算两种描述的语义相似度。语义相似度差距越大,表明视频内容对音频的依赖性越强。最终保留差异程度位于前 50% 的视频,得到约 9K 个高质量视频。

阶段2:音视频时序定位与校准 (Audio-Visual Temporal Localization and Calibration)

  • 动态事件定位:使用 Gemini 2.5 Flash 对筛选后的视频进行全面扫描,识别与剧情相关的事件并忽略琐碎或静态的背景,并生成精确到秒的时间戳(MM:SS 格式),紧密限定每个事件的起止时间。
  • MFCC 时界校验:为确保时序边界的声学合理性,对每个事件的起始和结束点计算梅尔频率倒谱系数(MFCC)。通过验证起始点和结束点的 MFCC 差异是否超过预设阈值 2.0,来判断有效的事件转换是否与声学不连续性相关。
  • 音频充实:在边界验证后,再次提示 Gemini 2.5 Flash 识别并标注每个时间片段内的具体声学线索,如同步发生的对话、音效或背景音乐等,确保音频事件被完整捕获。

阶段3:音视频 QA 构建 (Audio-Visual QA Construction)

  • 因果对发现:使用 DeepSeek-V3.2 分析时间上相邻的事件段,并严格限制前提事件和目标事件的时间间隔不超过 30 秒,以确保预测的可靠性。模型被要求输出三个要素:前提事件(Premise)、目标事件(Target)以及解释两者关系的推理依据(Rationale)。
  • 音频因果因子评分:对于每个候选因果对,DeepSeek-V3.2 需要对音频的因果作用进行评分:0(无影响)、1(装饰性)、2(因果性),并将音频因素分类为语音(Speech)、声效(Sound)或音乐(Music)。
  • 四种对抗性干扰项设计:
    • 仅视觉感知:视觉上合理但与音频信息矛盾。
    • 仅音频感知:音频上合理但与视觉场景不匹配。
    • 延迟型:在视频中真实发生但在时间上早于前提事件,考验模型的时间精准度。
    • 逆因果型:描述前提事件的原因,而非结果,考验模型对时间箭头的理解。
  • 双阶段验证:为降低 QA 的歧义,候选 QA 首先被提交给 GPT-4o 进行自动逻辑校验,随后由两位专家注释员进行独立人工审查。人工审查的三项标准为:正确答案的逻辑唯一性、跨模态推理的必要性、以及干扰项的合理性。该过程的一致性 Fleiss‘ Kappa 为 0.73,约 20% 的候选样本被拒绝或修订。

二、评估框架 评估覆盖 20 个模型,分为开源 Omni-MLLM、开源 Video-MLLM 和商用 MLLM 三组。评测采用多选 QA 形式,并从领域类型、音频类型、视频时长、错误类型等多个维度进行深入分析。

三、OFF 训练策略 基于不与评测集重叠的视频,构建了包含 7,761 条指令样本的数据集 FutureOmni-7K 进行 LoRA 微调。其核心设计是训练时只输入目标事件发生前的视频帧和音频段,防止模型“看到未来”。每个样本都配备了详细的推理依据(Rationale),引导模型学习从音视频前提到未来结果的因果逻辑。训练时冻结视觉和音频编码器,仅更新文本骨干网络,使用 AdamW 优化器和余弦学习率调度器,学习率 1e-5,训练 1 个 epoch,在 8 块 H200 GPU 上进行。

设计与动机:整个流水线强调“音视频协同”的必要性,通过精心设计的干扰项和训练策略,迫使模型执行真正的跨模态因果推理,避免单模态捷径学习。

💡 核心创新点

  1. 首个 Omni-modal 未来预测基准:系统性地将音频模态纳入未来事件预测评估,填补了现有基准(VLEP、FutureBench 等)仅在视觉或文本模态上进行预测的空白,使评估更贴近真实世界。
  2. 四种对抗性干扰项设计:提出了仅视觉、仅音频、延迟、逆因果四类新型干扰项,比传统基于视觉相似性的干扰项更全面,能更有效地检验模型是否在进行真正的跨模态时序推理。
  3. 可扩展的 AI 辅助+人工审核流水线:引入了 MFCC 时界校验、音频因果因子评分等机制,并结合大模型自动化与双阶段人工验证,在保证数据质量(Fleiss’ Kappa=0.73) 的同时,实现了高效构建。
  4. OFF 训练策略及其泛化性发现:发现基于未来预测推理的指令微调不仅能在预测任务上带来增益,还能意外地泛化到通用音视频理解基准(如 WorldSense, DailyOmni) 上,并通过注意力可视化揭示了模型“主动信息寻求”机制。

📊 实验结果

主实验结果(Table 2):Gemini 3 Flash 以 64.8% 的总体准确率遥遥领先,而最优开源模型 Qwen3-Omni 为 53.05%。视频专用模型表现系统性低于同等级 Omni 模型,例如 GPT-4o 仅 49.70%,这验证了在未来预测中音频信息的不可或缺性。

领域差异(Table 2 细分):Cartoon 和 Game 领域表现较好,而 Documentary 和 Emergency 领域表现最差(例如,AVicuna 在 Doc 上仅为 20.83%),表明对叙述性语音的理解与混乱场景下的推理仍是重大挑战。

音频类型与时长分析(Fig. 5/Tab. 6):语音(Speech)是所有音频类型中最具挑战性的,性能远低于 Music 和 Sound。所有模型都存在“上下文冷启动”现象,即在最短视频片段(\(<\)120秒)中表现最差,表明预测需要足够的历史上下文。

模态消融实验(Table 3):完整 A+V 设置始终性能最优。以 Ola-7B 为例,去除音频后(V-only)性能下降 5.27% 至 43.27%。用字幕(V+S)替代原始音频,性能为 46.95%,未能完全恢复,表明原始音频信号中蕴含了文本无法捕捉的非语言信息(如语气、氛围)。

方法A+VVV+SAA+C
Qwen3-Omni 30B53.0551.50↓52.76↓50.92↓50.34↓
MiniCPM-o 2.6 8B48.5448.25↓49.80↑48.93↑48.54
Ola 7B48.5443.27↓46.95↓46.47↓46.85↓
Qwen2.5-Omni 7B47.4842.50↓43.85↓42.50↓44.24↓

错误分析(Fig. 6):对 Gemini 3 Flash 的 318 个错误案例分析显示,“视频感知错误”是最大瓶颈(占比 51.6%),其次是“音视频联合推理失败”(30.8%),而“缺乏知识”的错误仅占 2.5%,表明当前模型的短板主要在于动态感知和多模态因果融合,而非常识知识不足。

OFF 训练结果(Table 4):Qwen2.5-Omni 在 Speech 类别提升近 10% 至 47.75%,video-SALMONN 2 总体提升 3.87% 至 49.90,证实 OFF 有效增强了模型对复杂声学线索的解释能力。

泛化能力(Table 5):OFF 训练后,Qwen2.5-Omni 在 WorldSense 提升 2.55%,在 DailyOmni 提升 3.34%,甚至在纯视频基准 Video-MME 上也有提升(53.77% → 55.51%)。进一步的实验表明,这种泛化能力的本质是时间推理能力的定向增强,而不是数据量增加带来的通用性能提升,因为使用等量通用描述数据进行微调(Caption SFT)带来的增益远小于 OFF(Table 8)。注意力可视化(Fig. 7) 也显示,OFF 训练让模型对视频和音频关键帧的关注度显著提升,证实了“主动信息寻求”机制。

🔬 细节详述

  • 训练数据(FutureOmni-7K):包含 7,761 条指令样本,从与评测集不重叠的视频中生成。每条样本包含视频帧、音频段、前提事件描述、多选选项、正确答案及推理依据。训练时严格仅使用事件发生前的音视频片段。
  • 损失函数:论文未明确说明,应为标准的语言建模交叉熵损失。
  • 训练策略:使用 LoRA 微调。Qwen2.5-Omni 通过 LlamaFactory 实现,设置 rank=64。Ola 和 video-SALMONN 2 遵循其官方训练脚本。使用 AdamW 优化器搭配余弦学习率调度,batch size 设置为 1。
  • 关键超参数:学习率 1e-5,训练 epoch 为 1。Qwen2.5-Omni 的 LoRA rank 为 64。
  • 训练硬件:8×H200 GPU。
  • 推理细节:使用 vLLM 加速。多选问答的评估通过模型输出选项字母与正确答案的精确匹配进行。附录中提供了详细的视频、音频和纯文本模式的评估提示词(Prompt)。
  • 正则化或稳定训练技巧:未提及。仅说明在训练时冻结了视觉和音频编码器。

⚖️ 评分理由

  • 创新性 (1.3/2):作为首个 Omni-modal 未来预测基准,问题定义非常新颖,找准了当前多模态评估的盲区。四种对抗性干扰项设计颇具巧思。但方法本质上是“先进 LLM 辅助标注 + 指令微调”,缺乏新的模型架构或训练范式,创新高度集中在基准设计层面。
  • 技术严谨性 (1.2/1.5):三阶段流水线设计清晰,包含 MFCC 校验、双阶段验证等确保质量的工程步骤,Fleiss‘ Kappa 达 0.73,体现了较好的标注一致性。通过 Caption SFT 的对比实验很好地区分了预测推理与通用描述的效果。但 30 秒的时间窗口设定理由不够充分,音频因果因子的 0/1/2 三分级较为粗糙。
  • 实验充分性 (1.1/1.5):评估了 20 个模型,覆盖全面。消融实验设计合理,泛化能力分析是亮点。但缺少多次运行结果的统计显著性检验。评估仅限多选 QA,缺乏开放式生成评估。OFF 训练仅在 7B-30B 规模的模型上验证。
  • 清晰度 (0.7/1):整体结构清晰,图 3 的流水线图直观。但正文对于训练和推理细节描述过于简略,大量信息依赖附录(如关键的训练样本结构和评估提示词)。Table 2 数据密集,缺乏可视化对比。
  • 影响力 (1.1/1.5):为多模态 LLM 评估体系填补了一个关键的空白,有望成为未来预测任务的标准基准之一。来自国内外知名高校合作,有较好的社区影响力基础。但任务本身与实际应用场景(如自动驾驶的实时决策)尚有差距,短期影响力有限。
  • 开源 (1.1/1.5):论文声明公开了代码和数据集,并提供了 GitHub 链接。数据和代码的可用性对社区复现和跟进有价值。但未提供 OFF 微调后的模型权重,文档完整性未知。
  • 可复现性 (0.3/0.5):提供了关键的训练脚本和超参数(学习率 1e-5,epoch=1,batch size=1),硬件环境明确。但部分模型微调细节依赖外部官方仓库的配置,论文本身不足以独立完成复现。
  • 工程/实践价值 (1.2/1.5):文中建立的全链条自动化数据生成流水线,特别是 MFCC 时界校验等环节,工程参考价值高。但流水线严重依赖商用闭源模型,限制了完全开源复现的可能。

🚨 局限与问题

论文明确承认的局限:

  1. 当前 MLLM 在 Omni-modal 未来预测上整体表现不足,存在巨大提升空间。
  2. 语音是最具挑战性的音频类型,模型在对话密集场景下表现不佳。

审稿人发现的潜在问题:

  1. 未来预测的确定性问题:多选 QA 本质上将高度不确定的未来简化为唯一正确答案。题目中“最直接的结论”试图缓解此问题,但框架仍可能低估模型的预测能力,因为某些合理但非唯一的可能性会被判定为错误。
  2. 音频干预筛选的鲁棒性:使用 UGCVideoCaptioner 计算描述差异来筛选视频,其准确性高度依赖 caption 模型本身的质量。论文未对 caption 质量进行敏感性分析,也未尝试多种 captioner 进行交叉验证,筛选结果的鲁棒性存疑。
  3. 训练与评测集的数据泄露风险:虽然保证视频不重叠,但如果来源视频来自同一系列或 YouTube 频道,可能存在跨视频的隐性知识泄露(如对人物性格、世界设定的了解),论文未讨论此风险。
  4. 长视频评估的不稳定性:“上下文冷启动”现象主要揭示模型在短视频上的困难,但 Fig. 5b 显示在 [4,20) 分钟这个跨度极大的区间内,性能波动大且样本量可能不足,导致对长视频预测能力的结论说服力下降。
  5. OFF 泛化机制的解释不够彻底:注意力可视化的“主动信息寻求”可能只是相关性,不一定是因果。虽然通过 Caption SFT 对比排除了“更多数据带来通用提升”这一干扰,但 OFF 数据是否在数据多样性和复杂推理链的质量上对 Caption SFT 数据有系统性的优势,这一点尚未深入讨论,而这可能是 OFF 更有效的根本原因。

← 返回 ICML 2026 论文速递