📄 OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
标签:#音视频理解 #强化学习 #音频理解 #Transformer #模型评估
6.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5
✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #强化学习 | #音频理解 #Transformer | arxiv
👥 作者与机构
- 第一作者:Yu Chen (University of Chinese Academy of Sciences, Institute of Automation, CAS)(工作于实习期间完成于Shopee)
- 通讯作者:Haibo Zhang (Shopee)、Chaofan Chen (Beijing University of Technology)
- 作者列表:Yu Chen(University of Chinese Academy of Sciences, Institute of Automation, CAS)、Caorui Li(Southeast University)、Ziyu Xiong(Southeast University)、Yidong Wang(Shopee)、Mingqi Gao(Tsinghua University)、Shuman Liu(Shopee)、Biao Liu(Southeast University)、Chunfeng Yang(Southeast University)、Anxiang Zeng(Shopee)、Haibo Zhang(Shopee)、Chaofan Chen(Beijing University of Technology)
💡 毒舌点评
亮点:本文将主动工具使用范式创新性地引入长音视频推理,设计了一个两阶段(全局预览 + 局部聚焦)的端到端可训练框架。核心设计——TimeAnchor机制——通过简单的文本时间标记巧妙解决了跨采样粒度(稀疏全局预览 vs. 稠密局部片段)下工具参数的时间对齐难题,设计简洁有效。配套的“时间增强数据引擎”实现了工具使用轨迹的自动合成,减少了对昂贵人工标注的依赖。实验在多个音视频和视频基准上展现了稳定提升。 短板:论文对“音频”模态的处理深度严重不足。音频在框架中仅作为视频的附属信息被压缩编码(2秒区块内的token),未能作为独立的推理主体进行深入分析(如声音事件定位、语音内容理解)。这导致其核心贡献实质上是“长视频+辅助音频”的推理,而非真正的“音视频”联合推理。此外,工具类型单一(仅时间放大),依赖特定基座模型(Qwen-Omni的交织方案),评估基准存在偏好,这些都限制了其通用性和影响力。
📌 核心摘要
本论文旨在解决长音视频推理中,关键证据稀疏、跨模态且均匀处理成本高的问题。作者提出了OmniReasoner,一个工具使用后训练框架,使多模态大模型能够学习自适应地调用一个“放大”工具,在回答前对特定时间段进行更高保真度的音视频检索和检查。方法的核心创新在于:1)将工具调用行为形式化为可学习的策略;2)引入TimeAnchor机制,通过绝对时间戳标记解决在不同采样粒度(稀疏全局预览 vs 稠密局部片段)下工具参数的一致性问题;3)构建了一个时间增强数据引擎,通过视频编辑和组合自动合成带工具调用轨迹的训练数据。实验表明,在多个音频-视觉和通用视频基准上,OmniReasoner相比Qwen2.5-Omni-7B基线取得了全面提升,特别是在VideoHolmes上提升15.6点。其实际意义在于为长音视频理解提供了一种可训练的主动感知范式。主要局限包括工具类型单一、依赖特定基座模型、以及音频模态的潜力未被充分挖掘。
🔗 开源详情
- 代码:https://github.com/RockyChen0205/OmniReasoner
- 模型权重:论文中未提及
- 数据集:论文中未提及专门构建并公开发布的新数据集。训练和评估使用了多个现有公开数据集,具体名称及来源如下:
FineVideo:来自 HuggingFace(https://huggingface.co/datasets/HuggingFaceFV/finevideo)。AVQA-R1:参考文献[Xing et al., 2025]中提及的数据集,具体获取方式未说明。CG-Bench:参考文献[Queen et al., 2025]中提及的基准,具体获取方式未说明。LLaVA-Video-178K:在附录中提及用于异常插入任务,具体获取方式未说明。- 评估基准:
OmniVideoBench、LVOmniBench、Daily-Omni、WorldSense、VideoMME、VideoHolmes、Charades-STA。获取方式未明确给出。
- Demo:论文中未提及
- 复现材料:论文提供了详细的训练配置(如学习率、批大小、优化器)、使用的框架(LMMS-Engine, TRL)以及基于
Qwen-Omni-7B基座模型的信息。完整的检查点和复现脚本未提及是否开源。 - 论文中引用的开源项目:
- 基座模型:
Qwen-Omni-7B/Qwen2.5-Omni-7B(具体发布链接未提供)。 - 数据集:
FineVideo(https://huggingface.co/datasets/HuggingFaceFV/finevideo)。 - 评估框架:
LMMS-Eval(https://github.com/EvolvingLMMs-Org/lmms-eval)。 - 强化学习框架:
TRL(https://github.com/huggingface/trl)、veRL(https://github.com/volcengine/verl)。 - 其他引用模型:
Gemini-2.0-Flash、Gemini-2.5-Pro、Gemini-3-Pro、VideoLLaMA2-7B、MiniCPM-o-7B、VITA-1.5-7B、Ola-7B、HumanOmniV2-7B。这些为对比模型,未提供具体开源链接。
- 基座模型:
🏗️ 方法概述和架构
OmniReasoner的核心思想是将长音视频推理过程形式化为一个可学习的工具调用决策问题。它旨在解决长音视频输入中,关键证据稀疏且跨模态,而均匀处理整个流又成本高昂的矛盾。其整体架构是一个两阶段的主动感知框架,如图2(论文中存在该架构图)左侧所示,完整工作流程包括:首先对输入进行低质量的全局扫描,形成粗略的时间线理解;然后由模型自主决策,是否需要以及对哪个时间段进行高质量的局部聚焦检查;最后综合所有信息生成最终答案。该框架的核心组件包括全局观察器、策略网络(即多模态大语言模型本身)、媒体环境(MediaSandbox)与TimeAnchor机制、以及最终的推理与回答生成模块。
1. 整体流程概述
整个系统接收一个长音频-视频输入流 x 和一个问题 q 作为输入。输入流 x 的总时长为 T。
- 第一阶段:全局观察。输入首先通过一个全局观察器进行低计算成本的编码处理,生成一个保留完整时间结构但信息密度较低的全局观察
g = Φ_global(x)。 - 第二阶段:策略决策。多模态大语言模型(策略网络)接收全局观察
g和问题q,并输出一个动作决策a_1。这个决策有两种可能:- 直接回答 (
answer(y)):如果全局观察已包含足够证据,模型直接生成最终答案。 - 请求放大 (
zoom([s, e])):如果需要更精细的证据,模型会请求一个绝对时间区间[s, e](其中0 ≤ s < e ≤ T),要求媒体环境从原始高保真流中提取该区间的局部内容。
- 直接回答 (
- 第三阶段:工具调用与局部聚焦。当模型决策为请求放大时,系统调用媒体环境。媒体环境根据请求的绝对时间区间
[s, e],从原始音视频流中裁剪出更高保真度的局部观察z_{s:e} = Φ_local(x, [s, e])。此步骤依赖TimeAnchor机制来确保请求的时间参数在从低质量全局预览到高质量局部片段的不同采样粒度下指向同一物理时刻。 - 第四阶段:综合推理与回答。模型最终基于全局观察
g、原始问题q以及检索到的局部证据z_{s:e},生成最终答案y ∼ π_θ(· | g, q, z_{s:e})。
这个流程的关键在于,工具调用行为(是否调用、调用何处)不是固定的规则,而是模型通过后训练(SFT+RL)学得的可学习策略。
2. 核心组件详解 (1) 全局观察器 (Global Observation)
- 功能:以低计算成本接收完整的长音视频输入
x,并生成一个覆盖整个时间线的、低分辨率的全局表示,供模型进行初步的、全局性的时间推理。 - 内部结构与实现:该组件基于基座模型 Qwen2.5-Omni-7B 的多模态编码器实现。具体来说:
- 视觉编码器:以较低的帧率(例如,采样32帧)处理输入视频序列,生成一系列视觉token。这种低帧率采样在保留长视频整体叙事结构的同时,大幅降低了计算和内存开销。
- 音频编码器:处理完整的音频轨道,生成音频token。音频处理会覆盖整个时长,但同样会经过压缩和下采样。
- 生成的视觉token和音频token随后被送入大语言模型(LLM)骨干网络。这里利用了Qwen-Omni的“时间交织”编码方案:模型将整个音视频流按实际时间分割成2秒的区块,并在每个区块内将视频token排列在音频token之前。最终,LLM的输出隐式地融合了这些跨模态、低分辨率的token,形成了全局观察
g。
- 输入与输出:输入是原始音视频流
x。输出g是一个包含完整时间结构、低粒度信息的多模态token序列,它将作为后续策略网络决策的基础。
(2) 策略网络 (Policy Network)
- 功能:作为决策中枢,接收全局观察和问题,判断当前证据是否充足,并输出相应的动作(直接回答或请求放大)。
- 内部结构与实现:策略网络就是OmniReasoner的多模态大语言模型本身(即经过后训练的Qwen2.5-Omni-7B)。它接收全局观察
g和问题q的token序列作为输入。在推理时,模型通过自回归生成,输出一个特殊的动作token序列。其决策空间被明确约束为两种格式:- 如果模型认为证据足够,则输出
<answer>...`` 标签包裹的最终答案。 - 如果模型认为需要更多证据,则输出
<interval>[s, e]`` 标签,其中s和e是以绝对秒为单位的时间值,代表了它希望聚焦检查的物理时间段。这个决策过程a_1 ∼ π_θ(· | g, q)是一个基于当前上下文的条件概率采样。
- 如果模型认为证据足够,则输出
- 输入与输出:输入是全局观察
g和问题q。输出是一个明确的动作a_1,要么是答案,要么是一个绝对时间区间。
(3) 媒体环境与TimeAnchor (Media Environment & TimeAnchor)
- 功能:当策略网络请求放大时,媒体环境充当“工具执行器”,负责从原始媒体中提取高保真度的局部片段。TimeAnchor机制则是确保这一工具调用在时间参数上正确、一致的核心设计。
- 内部结构与实现:
- 媒体环境 (MediaSandbox):这是一个基于FFmpeg构建的音视频编辑沙箱环境。它暴露了与推理时相同的全局到局部接口。当接收到一个绝对时间区间
[s, e]的请求时,它直接调用FFmpeg等工具,从原始高保真音视频流中裁剪出对应时间段的视频和音频片段,生成局部观察z_{s:e}。这个环境是实现工具调用的具体执行层。 - TimeAnchor机制:这是解决“跨粒度时间对齐”问题的关键创新。问题在于:模型在请求放大之前观察的是低帧率、下采样的全局预览;而请求的局部片段则是高帧率、高保真度的。如果使用帧索引或区块索引作为工具参数,同一个物理时刻在两种采样网格下会对应不同的索引,导致工具返回错误的时间段。
- TimeAnchor的解决方案极其简洁:它依赖于基座模型的“时间交织”编码方案。在此方案的基础上,在每个2秒区块的开头,插入一个纯文本的绝对时间标记,例如
<0 seconds>,<2 seconds>, …。这些标记是普通的文本token,无需修改模型架构或引入新特殊token。 - 这一设计使得:1)策略网络在读取全局观察时,能明确感知每个2秒区块对应的绝对时间;2)策略网络在输出放大请求时,能输出基于绝对秒数的时间区间(如
[32, 38]),而非帧索引;3)媒体环境在接收请求后,依据相同的绝对时间轴进行裁剪。 - 由此,TimeAnchor保证了从稀疏全局观察到稠密局部片段的工具调用过程中,时间参数具有“往返一致性”:一个如
[32, 38]的请求,无论是在模型“看”全局预览时,还是在媒体环境“裁剪”局部片段时,都精确地指向源媒体中32秒到38秒之间的同一段物理内容。
- TimeAnchor的解决方案极其简洁:它依赖于基座模型的“时间交织”编码方案。在此方案的基础上,在每个2秒区块的开头,插入一个纯文本的绝对时间标记,例如
- 媒体环境 (MediaSandbox):这是一个基于FFmpeg构建的音视频编辑沙箱环境。它暴露了与推理时相同的全局到局部接口。当接收到一个绝对时间区间
- 输入与输出:输入是来自策略网络的绝对时间区间
[s, e]。输出是原始媒体x在该区间的高保真度局部观察z_{s:e}。
(4) 最终回答生成 (Final Answer Generation)
- 功能:在获得局部证据后,进行最终的综合推理并生成答案。
- 内部结构与实现:这一步由同一个策略网络(大语言模型)完成。此时,模型的输入上下文被更新为三部分:最初的全局观察
g、原始问题q,以及新检索到的局部观察z_{s:e}。模型基于这个更丰富的上下文,进行深度推理(如结合全局上下文和局部细节,验证假设等),最终生成答案y ∼ π_θ(· | g, q, z_{s:e})。 - 输入与输出:输入是
g,q,z_{s:e}。输出是最终的文本答案y。
3. 组件间的数据流与交互方式 数据流是清晰的顺序流与条件分支:
- 音视频流
x首先流入全局观察器,生成低分辨率全局观察g。 g与问题q一同输入策略网络。- 策略网络做出决策
a_1:- 分支A(直接回答):数据流直接通向最终回答生成模块,基于
g和q生成答案y,流程结束。 - 分支B(请求放大):数据流转向媒体环境。策略网络输出的绝对时间区间
[s, e]作为指令,触发媒体环境从原始x中裁剪出局部观察z_{s:e}。TimeAnchor机制在g的编码和[s, e]的生成与解析过程中确保时间一致性。
- 分支A(直接回答):数据流直接通向最终回答生成模块,基于
- 生成的局部观察
z_{s:e}被反馈给策略网络(此时模型进入第二轮推理)。 - 策略网络在拥有
g,q,z_{s:e的完整上下文下,执行最终回答生成,输出答案y。
4. 关键设计选择及其动机
- 将工具调用作为可学习的策略:这是OmniReasoner的核心范式。动机在于,对于长视频,决定“是否需要额外证据”和“从哪里获取证据”本身就是一个需要智能判断的难题。通过SFT和RL后训练来优化这一决策,使得模型能自适应地在时间覆盖和感知保真度之间进行权衡,将高成本的精细计算集中在信息量最大的时刻。
- 引入TimeAnchor机制:动机是解决工具调用在跨越不同采样粒度时的参数一致性难题。在全局(稀疏)和局部(稠密)两种观察模式下,使用帧索引作为工具参数是不可靠的。TimeAnchor通过绑定绝对时间,提供了一种简单、鲁棒且无需修改基座模型架构的解决方案,是整个工具调用流程能够正确、稳定工作的基石。
- 构建时间增强数据引擎:动机在于自动化地生成大规模、带监督信号的工具使用轨迹数据。手动标注长视频中需要聚焦的证据区间成本极高。该引擎通过多片段组合(植入问答)和异常插入(替换片段)两种视频编辑操作,在构造任务的同时自动获得证据区间的“金标准”。这为模型学习“何时调用工具”和“工具指向哪里”提供了可扩展的监督信号来源。
- 采用SFT+RL的两阶段训练流程:SFT阶段用于“冷启动”,让模型从高质量的、固定模式的工具使用轨迹中学会基本的交互协议和格式。RL阶段(使用GRPO算法)则在SFT的基础上,进一步优化决策质量,让模型在探索中学习如何通过调用工具来最大化最终答案的正确率,其奖励仅包含答案准确性和格式正确性,不直接奖励定位本身。
💡 核心创新点
- 可学习的音视频工具调用框架:创新性地将长音视频推理问题建模为工具调用决策问题。不同于以往固定规则或独立设计的检索方法,OmniReasoner通过后训练(SFT和RL)让模型自身学习“是否需要查看更清晰的版本”以及“查看哪个时间段”,实现了自适应的证据获取。
- TimeAnchor时间对齐机制:解决了不同采样粒度下时间参数不一致的核心难题。通过在音视频流中插入绝对时间文本标记,使得模型请求的放大区间在稀疏全局预览和稠密局部片段下均指向原始流的同一时刻,保证了工具调用的“往返一致性”,且无需额外特殊标记或架构修改。
- 时间增强数据引擎与轨迹合成:为了解决昂贵的人工区间标注问题,构建了自动化数据生成引擎。通过视频编辑(多片段组合、异常插入)构造具有已知证据区间的长视频任务,并利用教师模型合成完整的“全局扫描-决策放大-局部检查-最终回答”的工具使用轨迹,为策略学习提供了规模化监督。
- 面向工具使用的强化学习训练策略:在SFT冷启动建立基本格式和工具使用行为后,采用GRPO进行策略优化。奖励设计简洁,仅基于答案准确性和格式正确性,不单独为放大操作设奖励,让模型在优化最终任务表现的过程中间接学习到何时及何处使用工具的价值。
📊 实验结果
论文在多个音频-视觉和通用视频推理基准上进行了评估。主要结果如下表所示,OmniReasoner相较于基座模型Qwen2.5-Omni-7B在所有测试基准上均有提升,尤其在VideoHolmes上提升显著。
表1:音视频和通用视频推理基准性能对比
| 方法 | 音频-视觉 | 通用 |
|---|---|---|
| OmniVideoBench | LVOmniBench | |
| 闭源模型(参考) | ||
| Gemini-2.0-Flash | 41.5 | 42.9 |
| Gemini-2.5-Pro | 58.9 | – |
| 开源模型 | ||
| VideoLLaMA2-7B | 29.2 | 27.2 |
| MiniCPM-o-7B | 29.7 | – |
| VITA-1.5-7B | 30.5 | – |
| Ola-7B | – | – |
| HumanOmniV2-7B | – | – |
| Qwen2.5-Omni-7B | 29.3 | 32.0 |
| OmniReasoner | 34.8 (+5.5) | 35.4 (+3.4) |
表2:在OmniVideoBench上按音频类型和视频时长细分的准确率对比
| 方法 | 音频类型 | 视频时长(分钟) |
|---|---|---|
| 音乐 | 声音 | |
| 闭源模型 | ||
| Gemini-2.0-Flash | 29.7 | 40.3 |
| Gemini-2.5-Pro | 38.5 | 57.7 |
| Gemini-3-Pro | 56.2 | 54.1 |
| 开源模型 | ||
| VideoLLaMA2-7B | 26.4 | 30.7 |
| MiniCPM-o-7B | 27.5 | 28.6 |
| HumanOmniV2-7B | 20.9 | 31.1 |
| Qwen2.5-Omni-7B | 23.1 | 25.3 |
| OmniReasoner | 34.1 (+11.0) | 29.3 (+4.0) |
消融实验:
- **表3(数据、配置、训练阶段消融)**显示,移除自构建数据(-3.8, -5.6)、移除工具使用数据(-2.0, -2.1)、移除音频输入(-3.9, -4.1)、移除工具返回结果(-2.2, -1.5)、以及仅用SFT或仅用RL训练,均会导致性能显著下降。
- **表4(TimeAnchor消融)**显示,TimeAnchor的引入对时序定位能力提升巨大,在Charades-STA的IoU@0.3上提升11.6点,在OmniVideoBench上提升2.5点,在LVOmniBench上提升2.6点。
分析:工具使用行为随视频时长增加而更频繁(OmniVideoBench: 0-1分钟视频工具调用率33.3%,10-30分钟升至84.8%),且工具使用模式在长视频上通常比直接回答更准确。注意力可视化(图5)表明模型在推理时确实关注了放大的局部片段。
🔬 细节详述
- 训练数据:SFT混合数据包含25,839条样本,来自多片段组合(13,222)、异常插入(5,319)、FineVideo(2,581)、AVQA-R1(2,988)、CG-Bench(1,729)。RL数据包含2,731条样本。
- 损失函数:SFT阶段使用标准的序列到序列损失。RL阶段使用GRPO算法,奖励函数为
\(R = R_{acc} + R_{fmt}\),其中\(R_{acc}\)检查答案准确性,\(R_{fmt}\)检查输出格式(包含`<answer>`标签、`<interval>`标签(当触发放大时)以及有效的基于秒的区间)。 - 训练策略:
- SFT:2 epochs,batch size 128,学习率
\(5 \times 10^{-6}\),AdamW优化器,余弦学习率调度。 - RL:基于TRL框架实现,batch size 64,每个提示采样8个rollout,KL系数为0,最大响应长度8192 tokens,学习率
\(1 \times 10^{-6}\)。
- SFT:2 epochs,batch size 128,学习率
- 关键超参数:基座模型为Qwen2.5-Omni-7B。TimeAnchor区块为2秒。
- 训练硬件:8块NVIDIA H100 (80GB) GPU,总计约480 H100 GPU小时。
- 推理细节:论文提供了完整的推理提示模板(附录B),定义了严格的输出格式(
,<interval>,<answer>`` 标签)。 - 正则化技巧:在RL中未使用KL惩罚。数据筛选阶段使用了基于LLM(DeepSeek-AI)的评判模型对合成的轨迹质量进行评估。
⚖️ 评分理由
创新性 (1.2/2):提出面向长音视频的可学习工具调用框架,将是否放大及放大何处建模为通过SFT和RL学习的策略;TimeAnchor通过在2秒区块插入纯文本绝对时间戳标记巧妙解决跨采样粒度的时间参数往返一致性;时间增强数据引擎通过多片段组合和异常插入自动合成工具使用轨迹,减少人工标注依赖。整体范式创新显著,但各组件(时间标记、轨迹合成、SFT+RL)单独看并非全新。
技术严谨性 (1.0/1.5):方法整体数学形式化清晰(全局观察、策略决策、工具调用、综合推理四阶段),TimeAnchor机制逻辑自洽且与Qwen-Omni时间交织编码方案兼容。但RL奖励仅包含答案准确性和格式正确性,缺少定位奖励项;TimeAnchor强依赖特定基座模型的时间交织编码方案,对其他架构需重新设计,通用性受限。SFT+RL两阶段训练流程中SFT冷启动对RL稳定性至关重要,论文通过消融充分验证。
实验充分性 (1.0/1.5):在六个基准(OmniVideoBench、LVOmniBench、Daily-Omni、WorldSense、VideoMME、VideoHolmes)上评估,消融实验涵盖数据配方、输入配置、训练阶段和TimeAnchor四大维度,按时长和音频类型的细分分析有洞察力。但未报告统计显著性检验;未与同期思路相近的强基线(如LongVT、TimeSearch-R)对比;VideoHolmes上+15.6的提升部分归因于基线仅使用32帧,论文也承认此点,归因不够清晰;合成数据偏差未通过额外真实场景验证。
清晰度 (0.8/1):论文结构清晰,从问题定义到方法到实验层次分明;符号使用一致,图2架构图和图3数据流程图表达直观;推理示例(图1)有助理解。但整个框架包含多阶段流程和多个组件,流程细节较复杂;标题承诺音视频推理而音频实际仅作为2秒区块内的附属token被压缩处理,标题与实质贡献之间存在落差,可能误导读者预期。
影响力 (0.4/1.5):工具使用后训练方向对长视频理解有启发价值,但音频在框架中仅作为视频附属信息被压缩编码,独立的时间结构和语义信息被削弱,实质贡献是视频推理加辅助音频而非真正的音视频联合推理。对于语音和音频研究领域读者而言相关性有限。相比基座模型在音频视觉基准上提升幅度为1.1至5.5点,属于渐进式改进。论文承认仅实现单一感知类工具,处理需外部知识的任务能力受限。
开源 (1.0/1.5):代码已在GitHub公开发布,论文提供了详细训练配置和复现材料。但模型权重未公开发布,未构建并发布专门的新数据集,部分评估基准(如LVOmniBench、Daily-Omni、WorldSense、VideoHolmes)获取方式未明确给出,基座模型Qwen-Omni-7B的具体发布链接未提供。属于只开放部分核心产物。
可复现性 (0.3/0.5):训练配置披露充分:SFT使用batch size 128、学习率5e-6、AdamW优化器、余弦调度、2个epoch;RL使用batch size 64、8个rollout、学习率1e-6、KL系数0。硬件为8块H100 GPU共480小时。数据混合比例明确(多片段组合13,222条、异常插入5,319条等)。但多个评估基准的具体获取路径未说明,基座模型获取方式不明确,存在少量配置缺失。
工程/实践价值 (1.2/1.5):基于FFmpeg构建MediaSandbox音视频编辑沙箱,实现与推理时相同的全局到局部接口,工程设计实用。时间增强数据引擎通过视频编辑自动合成大规模训练数据,可扩展性好。工具调用率随视频时长增加(0-1分钟33.3%到10-30分钟84.8%),自适应路由行为合理。LLM评判器用于轨迹质量筛选,数据管道较完善。作者坦承RL框架自研成熟度不足,体现了工程诚实。
🚨 局限与问题
论文明确承认的局限:
- 基础设施和模型容量:受限于现有RL框架不支持多模态工具交互,作者基于TRL自研了框架,但成熟度不足。基座模型(Qwen2.5-Omni-7B)较小,上下文窗口有限(32K),且未预训练工具使用能力,导致RL冷启动困难,只能采用两步固定模板。
- 工具范围:仅实现了一个感知类工具(时间放大),未探索检索外部知识、执行代码、查询数据库等更广泛的工具类型,限制了模型处理需要跨模态+外部知识任务的能力。
- 团队限制:因计算资源和工程经验限制,未尝试更新的Qwen-Omni-3模型。
审稿人发现的潜在问题:
- 音频模态的深度处理不足:音频在整个框架中似乎被高度压缩(作为2秒区块内的token),其独立的时间结构和语义信息可能被削弱。论文未探讨音频本身作为定位依据(如通过关键词、声音事件)进行工具调用的能力,将“音视频推理”简化为了“视频推理+辅助音频”。
- TimeAnchor的通用性依赖:该机制强烈依赖于基座模型(Qwen-Omni)的“时间交织”编码方案。对于其他不采用此方案或音频视频编码分离的多模态模型,TimeAnchor需要重新设计,削弱了其即插即用的普适性。
- 评估基准偏向:主要评估基准(OmniVideoBench, LVOmniBench)可能对长视频和稀疏证据定位有偏好,使得工具调用方法容易获得提升。在更多样化或音频主导的基准上表现如何未知。
- 合成数据的潜在偏差:训练数据很大程度依赖自动合成(多片段组合、异常插入)。这些任务可能无法完全覆盖真实世界中复杂、模糊的音视频推理场景,且异常插入任务的监督信号(异常区间)可能过于明确。
- 因果归因不清:Table 1中,OmniReasoner相比基线在VideoHolmes上提升巨大(+15.6),论文部分归因于基线只使用32帧。但这暴露了基线方法的薄弱,而非完全体现OmniReasoner的绝对能力,可能夸大了该基准上的性能增益。
- 与强基线对比不足:论文仅与基座模型和几个开源模型对比,缺乏与同期提出的、思路相近的强工作(如LongVT, TimeSearch-R)的直接比较,难以评估其相对优势。