📄 Native Active Perception as Reasoning for Omni-Modal Understanding
#多模态模型
6.8/10 | 创新 1.6/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.6/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5
✅ 6.8/10 | 前50% | #音视频理解 | #强化学习 | #多模态模型 | arxiv
👥 作者与机构
- 第一作者:Zhenghao Xing(香港中文大学)、Ruiyang Xu(上海交通大学)、Yuxuan Wang(阿里巴巴通义千问团队)
- 通讯作者:Jin Xu(jxu3425@gmail.com)、Pheng-Ann Heng(pheng@cse.cuhk.edu.hk)
- 完整作者列表:Zhenghao Xing1, Ruiyang Xu2, Yuxuan Wang3, Jinzheng He3, Ziyang Ma2,4, Qize Yang3, Yunfei Chu3, Jin Xu3, Junyang Lin3, Chi-Wing Fu1, Pheng-Ann Heng1 ( 共同一作;1 香港中文大学计算机科学与工程系;2 上海交通大学;3 阿里巴巴通义千问团队,Qwen Team;4 南洋理工大学)
💡 毒舌点评
这篇工作在“让MLLM学会像人一样主动看视频”的agentic范式上做出了优雅且扎实的尝试——将长视频理解重塑为POMDP中的迭代感知过程,并用TAURA解决了GRPO在多轮推理中的信用分配难题,让7B模型在LVBench上正面击败了10倍大的静态模型,这个结果本身具备足够的冲击力。然而,对于语音/音频领域的审稿人而言,这份工作的吸引力会打折扣:论文的核心卖点是交互范式和视频理解效率,音频在这里更像是个“锦上添花”的模态输入,而非被深入研究的感知对象。尽管“全模态”的旗号已经打出,但论文并未在诸如长播客理解、复杂声学场景对话、ASR等纯音频任务上验证方法的迁移性,其“Omni”的宣称尚缺乏来自音频社区的严苛审视。如果投到纯音频会议,这艘船可能因为“货物不对板”而吃水过深。
📌 核心摘要
为解决长视频理解中计算开销随视频时长超线性增长的核心痛点,本文提出OmniAgent——一个将主动感知内化为推理过程的全模态智能体框架。其核心洞见在于,将音视频探索形式化为一个部分可观察马尔可夫决策过程(POMDP),通过迭代的“观察-思考-动作”循环,让单一MLLM按需、选择性地从视频环境中获取并蒸馏高维感知数据为持久化文本记忆,从而将推理计算与原始视频时长解耦。为赋予模型这种原生智能体能力,论文设计了两阶段训练方案:先通过Agentic SFT(基于Best-of-N轨迹合成与双阶段质量控制)冷启动基础行为,再利用Agentic RL与提出的TAURA算法进行精细优化。TAURA针对标准GRPO在多轮轨迹中的“优势同质化”问题,利用轮次级token熵来重新分配信用,让关键决策步获得更强的学习信号。在10个基准的实验中,7B参数的OmniAgent在LVBench(50.5%)上以73%更少的帧数超越了10倍规模的Qwen2.5-VL-72B(47.3%),并展现了单调递增的测试时扩展特性。
🔗 开源详情
- 代码:论文声明代码将发布于 https://github.com/HarryHsing/OmniAgent
- 模型权重:论文声明模型权重将随代码一同发布在上述仓库,但未提供独立的Huggingface或ModelScope链接。
- 数据集:论文使用公开数据集的训练分割构建Agentic SFT轨迹,未创建新数据集。所用到的数据集为LongVideo-Reason, Video-Holmes, VSI-Train-10k, LongVALE, MultiHop-EgoQA,需遵照原论文获取。评估使用的10个基准(VideoMME, LVBench, MLVU, Minerva, VSI-Bench, DailyOmni, WorldSense, OmniVideoBench, LongVALE, VUE-TR)均为公开学术基准。
🏗️ 方法概述和架构
OmniAgent框架的核心是将被动的“观看”转变为主动的“探索”。它不将视频视为一堆待处理的帧序列,而是视为一个可供交互的环境。整个系统由两个核心实体构成:智能体策略和交互环境。
形式化定义(POMDP):OmniAgent将一个视频理解任务建模为一个有限时域的POMDP。其状态由两部分组成:短暂的原始多模态感知数据 E_k(由环境返回的帧、音频或视频片段)和持久化的文本记忆 M_k。M_k 累积了所有历史交互的文本蒸馏物(观察、思考、动作),是智能体进行推理的唯一上下文依据。初始状态 M_0 仅包含用户查询和视频元数据。
核心交互循环(OTA):智能体通过迭代的“观察-思考-动作”循环来探索。在每一步 k,智能体基于其持久化记忆 M_{k-1} 和新的原始感知 E_{k-1} 执行以下操作:
- 观察(Observation,
O_k):将环境返回的高维原始数据(如图像帧、音频片段)即时“蒸馏”为一结构化的文本摘要。这个摘要必须足够详尽,因为随后原始媒体数据即被清除。 - 思考(Thought,
T_k):这是一个内部推理过程,分析当前累积的证据和记忆,识别信息缺口,并推导出下一步应当探索哪个区域以填补该缺口。 - 动作(Action,
A_k):策略从四个原子动作中选择一个执行:a_frames(s, e, n): 在[s, e]时间区间内均匀采样n帧。a_audio(s, e): 提取[s, e]区间的原始音频。a_clip(s, e): 提取[s, e]区间包含同步音轨的视频片段。a_answer(y): 给出最终答案y,终止全部探索循环。
架构关键点:记忆巩固与上下文解耦:OmniAgent最精巧的设计在于其严格的上下文管理。一旦智能体生成了文本形式的观察 O_k 并将其存入持久化记忆 M_k,环境立即执行“上下文清除”,将 E_{k-1} 从活跃记忆中删除。随后的交互轮次中,策略看到的上下文是不包含任何原始媒体数据的纯文本历史。这保证了智能体的内存和计算开销仅随推理步数和观察文本长度线性增长,而与视频的物理时长几乎无关,从而实现了对超长视频的可扩展性。
两阶段训练:为赋予模型上述能力,论文构建了以下训练流程:
- Agentic SFT(冷启动):使用教师模型在环境中进行Best-of-N探索,生成成功的交互轨迹。这些轨迹经过“答案正确性验证”和“推理连贯性审核(使用GPT-4o打分)”双阶段质控后,构成58K条高质量冷启动数据,让基础模型学会基本的动作执行、错误恢复和信息蒸馏。
- Agentic RL with TAURA(精细优化):在SFT的基础上,针对困难样本(SFT中失败的样本)进行强化学习优化。论文指出了标准GRPO算法在多轮agentic轨迹中存在优势同质化问题——单轨迹标量的奖励/惩罚无法区分关键决策步(如决定“去哪里看”)和常规信息检索步。为此,提出了TAURA算法,其使用每轮生成token的平均熵作为该轮不确定性的代理,对GRPO中的优势函数进行重新缩放:高熵轮次的优势被放大,使其在策略优化中获得更强的学习信号。此设计有效地将信用分配集中到了信息密度更高的“探索”步。
[图像补充] 图1(原文figure 1)直观展示了OmniAgent的完整框架。左侧为“Agentic Training Pipeline”,明确勾勒了从Best-of-N轨迹合成到双阶段质控的Agentic SFT阶段,以及基于TAURA算法的Agentic RL阶段。右侧为“Native Active Perception (POMDP)”主循环,清晰描绘了智能体(Policy)与环境(Environment)之间的严格分工:智能体负责所有语义感知和决策,环境仅负责原始的媒体提取。图中强调了将高维“Transient Percept”蒸馏为“Text Observation”并存入“Persistent Memory”的关键解耦步骤,以及在每个OTA循环后清除原始媒体数据的机制。
💡 核心创新点
- 原生主动感知框架:首次将长视频理解形式化为一个端到端的POMDP,让单一MLLM通过与环境交互,以原生方式执行感知、推理和行动。此框架将“看/听什么、何时看/听”的决策作为思维链推理的一部分,实现了推理复杂度与视频时长的有效解耦,区别于所有需要全局预扫描或依赖外部工具/模块的agentic方法。
- 基于文本记忆的感知-推理解耦:提出了一种强制的上下文管理策略,要求智能体在每一步交互中将获取的多模态数据即时蒸馏为文本形式的“观察”并存入持久记忆,随后立即丢弃原始媒体数据。此设计是框架可扩展性的核心保障。
- TAURA(Turn-aware Adaptive Uncertainty Rescaled Advantage)算法:深刻洞察并形式化了标准GRPO在多轮agentic训练中的“优势同质化”问题。创新性地使用轮次级token熵作为该步推理关键性的连续代理信号,对优势函数进行细粒度缩放,从而更精准地引导模型学习“去哪里采集关键信息”。
- 双阶段Agentic训练流程:系统性地提出了一个从数据合成(Agentic SFT + Best-of-N + 双阶段质控)到策略精炼(Agentic RL with TAURA)的完整训练方案,为将被动MLLM训练成自主探索的智能体提供了一条可复现的路径。
📊 实验结果
OmniAgent在10个基准上进行了详尽的评估,覆盖通用视频理解、长视频理解、音视频推理和时序定位等任务。其主要结果如下表所示:
主要结果
| 模型 | 规模 | LVBench(长视频) | VideoMME-Long(长视频) | MLVU(长视频) | OmniVideoBench(音视频推理) | DailyOmni(音视频理解) | LongVALE(时序定位) |
|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-72B(被动) | 72B | 47.3 | – | – | – | – | – |
| Qwen2.5-Omni-7B(基线) | 7B | 43.0 | 54.8 | 65.2 | 29.3 | 60.1 | 5.7 |
| Zoom-Zero-7B(Agentic) | 7B | 45.7 | 54.8 | 70.8 | – | – | – |
| OmniAgent-7B | 7B | 50.5 | 59.6 | 71.1 | 37.1 | 64.8 | 39.1 |
关键发现:7B OmniAgent在LVBench上以50.5%的准确率,显著超越了10倍参数量的静态模型Qwen2.5-VL-72B(47.3%),且使用帧数减少约73%。在时序定位任务LongVALE上,其IoU得分(39.1%)是基线模型(5.7%)的6.8倍,提升巨大。
消融实验
消融实验清晰揭示了各训练阶段的贡献。基于Qwen2.5-Omni-7B,标准SFT(被动)在长视频任务上甚至会导致性能倒退(LVBench: 43.0% → 41.6%)。而Agentic SFT (SFT+A) 则带来显著提升(LVBench: 48.7%)。在RL阶段,标准GRPO (+RLV) 在一些任务上出现性能停滞或回退,而提出的TAURA (+TAURA) 实现了全维度一致的性能增益。这有力地证明了Agentic交互范式和TAURA信用分配机制的有效性。
| 训练范式 | VideoMME-Long | LVBench | MLVU | OmniVideoBench | DailyOmni |
|---|---|---|---|---|---|
| Qwen2.5-Omni-7B | 54.8 | 43.0 | 65.2 | 29.3 | 60.1 |
| + Standard SFT | 56.0 | 41.6↓ | 67.1 | 33.8 | 61.7 |
| + Agentic SFT | 57.3 | 48.7 | 69.9 | 35.2 | 63.3 |
| + Vanilla GRPO | 59.4 | 49.8 | 69.9 | 35.3 | 62.2↓ |
| + TAURA | 59.6 | 50.5 | 71.1 | 37.1 | 64.8 |
[图像补充] 图2(原文figure 2)展示了测试时扩展(Test-time Scaling)曲线。在VideoMME-Long基准上,随着最大交互轮次K从6扩展到52,模型准确率从53.4%单调递增至59.6%,呈现出显著的正向扩展特性。曲线同时显示,平均有效推理轮次在K=52时也仅达到约11.7,表明模型并非盲目扩展,而是根据查询需要动态调整探索深度。
🔬 细节详述
- 基座模型:Qwen2.5-Omni-7B。
- 训练数据:Agentic SFT阶段使用58K轨迹,来源于LongVideo-Reason, Video-Holmes, VSI-Train-10k, LongVALE, MultiHop-EgoQA的训练集。RL阶段聚焦于SFT中失败的困难样本,视频时长被限制在300秒以内。
- 训练超参数:
- SFT: AdamW优化器,学习率
1e-5,batch size 64,训练2个epoch,16块NVIDIA A100。 - RL: 学习率
1e-6,全局batch size 256(组大小8),优化150步,clip ratios 0.28/0.20,不使用KL或熵正则化,64块NVIDIA A100。
- SFT: AdamW优化器,学习率
- 上下文管理:最大上下文窗口64K token。每帧图像编码为768个token。最大交互轮次
K在SFT阶段为5-32(动态适配视频时长),RL阶段为5-10。 - 推理延迟:在LVBench的100样本子集上,OmniAgent的端到端推理耗时(模型+环境)约为66.8秒,优于Qwen2.5-VL-72B(75.1秒),但远高于Qwen2.5-Omni-7B的单次前向推理(34.8秒)。这表明顺序交互引入了延迟开销,但在计算资源(单卡vs 4卡)和最终精度上取得了有利平衡。
⚖️ 评分理由
- 创新性 (1.6/2):将视频理解重构为POMDP中的主动感知过程,并将感知蒸馏融入推理循环,方法论层面新颖性高。TAURA算法为解决多轮RL中的信用分配问题提供了简洁有效的方案。较之已有工作,摆脱了全局预扫描的束缚,在“原生性”上更进一步。
- 技术严谨性 (1.1/1.5):POMDP形式化清晰,TAURA算法动机(优势同质化)明确且有实验证据支持(79.2%的关键fork step熵高于均值)。但TAURA的有效性建立在“高熵≈决策关键”的假设之上,论文虽提供了经验证据,但缺乏对该假设在探索初期或模型未充分训练等噪声场景下失效风险的深入讨论。训练流程对环境工程依赖较高,部分实现细节(如记忆替换的prompt拼接)仍显简略。
- 实验充分性 (1.2/1.5):实验设计扎实,基准覆盖广泛且富有层次。7B击败72B模型的对比是强力的效率论证,消融实验清晰拆解了各组件贡献。明显的不足是缺乏与配备类似交互能力的强音视频基线的对比(如Gemini 2.5 Pro/Flash的实际测试),且声称“全模态/omni-modal”却未在纯音频任务(如长播客、音频问答)上进行验证。
- 清晰度 (0.6/1):核心思想与框架图(图1)非常清晰。然而,方法实现细节、数据合成流程的工程细节以及TAURA与GRPO结合的具体代码级描述仍存在跳跃,部分表格(如Table 1)的基线模型分类(Thinking vs Non-Thinking)略显混乱,增加了阅读与复现的负担。
- 影响力 (0.5/1.5):对视频理解领域,尤其是agentic和多模态RL范式的研究者,具有较高的启发价值。然而,其核心贡献在于交互范式和视频处理效率,对语音/音频领域的直接技术贡献有限。该工作未提出新的音频表征、感知机制,也未解决特定听觉任务瓶颈。其价值更多是观念上的启示,可能不如在纯视觉或NLP社区的影响力大,故在语音/音频领域视角下被显著扣分。
- 开源 (0.5/1.5):论文提供了GitHub仓库链接,但仅仅是一个预先声明的链接。仓库是否包含完整的SFT/RL代码、环境模拟器以及训练脚本,是否已开源模型权重,均在评审时不可验证。因此,当前只能给予一个“承诺”的基础分。
- 可复现性 (0.3/0.5):超参数和硬件需求清晰是优点。但整个系统的复现涉及复杂的分布式环境模拟、教师模型轨迹生成、双阶段质控流程等,核心细节严重依赖附录且仍不够详尽,从头复现难度极高。
- 工程/实践价值 (1.0/1.5):构建了一套端到端的agentic多模态流水线,具有很高的工程参考价值。7B模型在效率上击败庞大静态模型的实践成果,对资源受限场景下的应用部署颇具吸引力。但顺序交互带来的延迟问题是其走向实时应用的显著障碍。
🚨 局限与问题
- 作者明确承认的局限:顺序OTA循环引入了延迟开销,是阻碍实时应用的主要瓶颈,作者展望了并行化探索作为解决方案。此外,RL训练目前仅限于300秒以下的视频,其在数小时长视频上的扩展性训练尚未得到验证。
- 审稿人发现的潜在问题:
- “全模态/Omni”宣称与实验支撑不匹配:这是最核心的批评点。论文旗帜鲜明地声称自己是“Native Omni-Modal”框架,但主线实验全部集中在视频理解上。对于独立的、以音频为核心的任务(如长播客问答、会议转录、复杂声学场景推理),方法的效果是未知的。这削弱了其“全模态”宣称的普适性。
- TAURA假设的脆弱性:“高token熵=关键决策步”这一前提虽然统计上成立,但在某些情况下可能失效。例如,在探索初期,由于环境高度不确定,模型可能普遍产生高熵,此时的熵更多反映的是无知而非关键的推理分叉。TAURA如何区分这两种高熵状态未被讨论,这可能导致在训练的早期阶段引入噪声。
- 计算效率的隐忧:论文强调了与输入视频时长的解耦,但却引入了与推理步数和模型生成token数(思考、观察文本)的耦合。对于需要上百步复杂推理的极端任务,其端到端延迟和计算开销可能会超过使用更大上下文窗口的一次性处理的被动模型。论文仅在较小的子集上分析了延迟,缺乏在不同推理深度下的系统性成本效益分析。
- 对比基线缺失:虽然与多数开源模型进行了比较,但缺少与具备一定agentic能力的最新专有模型(如Gemini 2.5 Flash)的定量对比,这使得其SOTA声明的边界有些模糊。