video-SALMONN-R: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding
📄 video-SALMONN-R\(^3\): Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding #多模态模型 #强化学习 #参数高效微调 8.2/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前10% | #多模态模型 | #强化学习 | #参数高效微调 | arxiv 👥 作者与机构 一作:Yixuan Li (清华大学 liyixuan25@mails.tsinghua.edu.cn);通讯作者:Chao Zhang (清华大学 czhang1@tsinghua.edu.cn);其他作者:Guangzhi Sun (剑桥大学), Yudong Yang (清华大学), Wei Li (字节跳动), Zejun Ma (字节跳动)。机构包括清华大学、字节跳动和剑桥大学。 💡 毒舌点评 这篇论文抓住了“视频LLM推理时算力分配不均”这个痛点,提出了一个“先粗后精”的重看范式,核心卖点是跳过了昂贵且可能有害的“链式思维”冷启动,直接通过强化学习(RL)从指令微调基座模型上训练重看策略,这确实是个讨巧且有效的工程思路。重答和重问两个机制设计简单但作用关键,实验也充分证明了其有效性。不过,论文的“首提”声称需要谨慎看待,相关工作已很丰富。整体看是一篇扎实、工程优化到位的工作,但理论新颖性有提升空间,且其成功严重依赖高质量的基座模型和精心设计的奖励函数。 ...