OmniReasoner: Thinking with Long Audio-Video via Native Tool Use
📄 OmniReasoner: Thinking with Long Audio-Video via Native Tool Use 标签:#音视频理解 #强化学习 #音频理解 #Transformer #模型评估 6.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #强化学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Yu Chen (University of Chinese Academy of Sciences, Institute of Automation, CAS)(工作于实习期间完成于Shopee) 通讯作者:Haibo Zhang (Shopee)、Chaofan Chen (Beijing University of Technology) 作者列表:Yu Chen(University of Chinese Academy of Sciences, Institute of Automation, CAS)、Caorui Li(Southeast University)、Ziyu Xiong(Southeast University)、Yidong Wang(Shopee)、Mingqi Gao(Tsinghua University)、Shuman Liu(Shopee)、Biao Liu(Southeast University)、Chunfeng Yang(Southeast University)、Anxiang Zeng(Shopee)、Haibo Zhang(Shopee)、Chaofan Chen(Beijing University of Technology) 💡 毒舌点评 亮点:本文将主动工具使用范式创新性地引入长音视频推理,设计了一个两阶段(全局预览 + 局部聚焦)的端到端可训练框架。核心设计——TimeAnchor机制——通过简单的文本时间标记巧妙解决了跨采样粒度(稀疏全局预览 vs. 稠密局部片段)下工具参数的时间对齐难题,设计简洁有效。配套的“时间增强数据引擎”实现了工具使用轨迹的自动合成,减少了对昂贵人工标注的依赖。实验在多个音视频和视频基准上展现了稳定提升。 短板:论文对“音频”模态的处理深度严重不足。音频在框架中仅作为视频的附属信息被压缩编码(2秒区块内的token),未能作为独立的推理主体进行深入分析(如声音事件定位、语音内容理解)。这导致其核心贡献实质上是“长视频+辅助音频”的推理,而非真正的“音视频”联合推理。此外,工具类型单一(仅时间放大),依赖特定基座模型(Qwen-Omni的交织方案),评估基准存在偏好,这些都限制了其通用性和影响力。 ...