📄 OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
#音视频问答 #强化学习 #后训练 #对比学习 #自监督学习
7.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5
✅ 7.5/10 | 前25% | #音视频问答 | #强化学习 | #后训练 #对比学习 | arxiv
👥 作者与机构
- 第一作者:Zhangquan Chen(清华大学,THU;实习于腾讯HY)
- 通讯作者:Ruqi Huang(清华大学深圳国际研究生院,sz.tsinghua.edu.cn)、Jiale Tao(腾讯HY,jialetao.std@gmail.com)
- 作者列表:Zhangquan Chen(清华大学)、Jiale Tao(腾讯HY)、Ruihuang Li(腾讯HY)、Yihao Hu(湖南大学,HNU)、Ruitao Chen(腾讯HY)、Zhantao Yang(腾讯HY)、Xinlei Yu(新加坡国立大学,NUS)、Haodong Jing(西安交通大学,XJTU)、Manyuan Zhang(香港中文大学,CUHK)、Shuai Shao(腾讯HY)、Biao Wang(腾讯HY)、Qinglin Lu(腾讯HY)、Ruqi Huang(清华大学深圳国际研究生院)
💡 毒舌点评
这篇论文精准地抓住了“多模态模型一加音频就变傻”的痛点,提出的两阶段RL框架,特别是用自监督时间-字幕对齐来驱动查询密集型局部定位,设计思路相当巧妙,拿掉了过程级标注这个昂贵的门槛。然而,死穴和亮点一样突出:整个奖励函数几乎把身家性命都押在了外部judge模型的质量上,论文对judge偏差传播和reward hacking的风险几乎没有展开讨论,这让人对训练信号的可靠性打上一个大大的问号;更致命的是,所有代码、模型权重和训练数据均未开源,号称“第一个RL框架”却把复现门槛拉满,使得那些漂亮的SOTA数字目前只能被视为“纸上SOTA”,在第三方验证之前说服力大打折扣。
📌 核心摘要
- 要解决的问题:当前全能模型在处理音视频任务时存在模态偏差,加入音频后反而损害视觉推理能力,且传统的SFT或vanilla RL等后训练方法无法显式训练跨模态协同推理行为。
- 方法核心:提出OmniVideo-R1,一个两阶段强化学习后训练框架。第一阶段通过自监督的查询密集型局部定位(Query-Intensive Grounding, QI),使模型在回答前先生成关键视频片段的
<时间戳-字幕>对,以显式定位与问题相关的音视频证据;第二阶段通过对比式模态注意力融合(Modality-Attentive Fusion, MA),惩罚“只用单模态信息就能答对”的捷径行为,强制模型利用融合信息获得更高置信度。 - 与已有方法相比的新意:不同于仅对最终答案进行RL的现有工作,OmniVideo-R1是首个将“think with omnimodal cues”行为结构化,并通过跨模态对比奖励驱动深度融合的后训练框架,无需任何过程级标注。
- 主要实验结果:在基于Qwen3-Omni-30B-A3B训练后,模型在Daily-Omni上达82.8(超越Gemini-2.5-Pro和Video-SALMONN 2+-72B),OmniVideoBench上达44.8(较基座提升7.8%),同时在视觉-only基准上(如Video-MME 73.6, MLVU 74.1, LVBench 51.9)保持稳健甚至提升。
- 实际意义:为音视频大模型的后训练提供了一套无需昂贵过程级标注的推理行为注入范式,其数据清洗pipeline和分阶段RL设计对工业级应用有直接参考价值。
- 主要局限性:极度依赖外部judge模型进行奖励计算,训练和复现成本极高;所有代码、模型及数据均未开源,可复现性差;MA阶段数据量偏小,在长音频/纯音频任务上的泛化性未被验证。
🔗 开源详情
- 代码:论文中未提及代码链接。
- 模型权重:论文中未提及模型权重链接或发布方式。
- 数据集:论文使用公开数据集LLaVA-Video和Video-Vista构建训练集,但未提供处理后的数据集或下载链接。评估所用基准均为公开数据,文中亦未提供链接:OmniVideoBench, Daily-Omni, WorldSense, IntentBench, VideoHolmes, Video-MME, MLVU, LVBench。
- Demo:论文中未提及。
- 复现材料:论文在第4节和附录中给出了训练配置(如学习率、batch size、奖励权重等)与部分judge prompt,但未提供训练代码、检查点或配置文件。
- 论文引用的开源项目:Qwen3-Omni, Qwen2.5-Omni, Qwen3-VL, Qwen2.5-VL, MiniCPM-o, Video-LLaMA系列, InternVideo系列, Video-SALMONN系列, DeepSeek-R1, VITA-1.5, Baichuan-Omni, Ola, HumanOmniV2等,但文中均未给出直接的项目链接。
🏗️ 方法概述和架构
OmniVideo-R1的核心是一个基于强化学习的两阶段后训练框架,旨在使预训练的多模态大模型学会“带着全模态线索思考”。其整体流程是:输入一段带有音频轨道的视频和一个用户问题,模型需要生成一个结构化的输出。该输出首先通过多组<time>...</time>
...训练分两个阶段,均采用Group Sequence Policy Optimization (GSPO)作为RL算法,以避免在MoE架构中因token分布剧变导致的重要性采样高方差问题。GSPO直接在序列层面进行优化,其优化目标基于组标准化优势函数和序列似然比进行梯度更新,形式化表述为 \(J(\theta) = \mathbb{E}_{x \sim \mathcal{D}, \{y_i\}_{i=1}^G \sim \pi_{\theta_{old}}(\cdot|x)} [P_{\theta}]\),其中重要性比 \(s_i(\theta)\) 基于序列似然计算。
[图像补充] 图2清晰地展示了OmniVideo-R1的训练框架示意图。模型输入为视频、音频和问题,输出为结构化的时间-字幕对和答案。第一阶段(QI)通过“自监督一致性评估 (\(r_{cons}\))”和“完整性评估 (\(r_{comp}\))”等奖励,训练模型的定位行为。第二阶段(MA)则通过对比单模态输入下的答案奖励,计算“注意力奖励 (\(r_{attn}\))”,强化跨模态融合。
第一阶段:查询密集型局部定位(QI)。该阶段的核心是自监督地建立查询意图与视频片段的对应关系,无需任何人工标注的时间戳。模型被强制要求输出多组时间-字幕对,奖励信号由多个部分构成:
- 格式奖励 (\(r_{format}\)):确保输出符合
<time></time></caption>的结构化模板,完全符合则得1.0分。 - 一致性奖励 (\(r_{cons}\)):将模型预测的第 \(i\) 个时间戳 \(T_i\) 所对应的真实音视频片段 \(G(A,V;T_i)\) 提取出来,与模型同时生成的第 \(i\) 个文本描述 \(C_i\),一同送入外部judge模型(Qwen3-VL-235B-A22B-Instruct)进行一致性评估。评估基于 \(L\) 个预定义规则,输出软评分。该奖励定义为 \(r_{cons} = \frac{1}{N} \sum_{i=1}^N \mathbb{E}_{cons}^{(L)}\big( G(A,V;T_i), C_i \big)\),迫使模型生成精准对齐的片段-字幕对。
- 完整性奖励 (\(r_{comp}\)):将所有预测出的 \(N\) 个时间片段 \(T_i\) 按序拼接成一个复合视频 \(G(A,V; \bigcup_{i=1}^N T_i)\),再次由外部judge模型评估该复合视频是否包含回答问题所需的完整且精确的音视频信息,其评估基于 \(M=3\) 条预定义规则。该奖励定义为 \(r_{comp} = \mathbb{E}_{comp}^{(M)}\big( G(A,V;\bigcup_{i=1}^N T_i), Q, R \big)\)。
- 答案奖励 (\(r_{ans}\)):对模型最终输出的答案文本 \(R\) 进行软评分,具体评估规则在附录中给出。 该阶段的总体奖励函数为 \(R_{QI} = r_{format} + r_{ans} + \frac{1}{2}(r_{cons} + r_{comp})\)。
第二阶段:模态注意力融合(MA)。在第一阶段建立的定位行为基础上,为解决模型可能忽略关键音频线索(如微弱的决定性声响)而走视觉捷径的问题,该阶段引入了对比式的奖励塑形机制。对同一训练样本,模型在三种输入条件下并行生成rollout:(i) 完整音视频输入,(ii) 纯视频输入,(iii) 纯音频输入。分别获得各自的答案奖励 \(r_{ans}^1, r_{ans}^2, r_{ans}^3\)。若完整输入下的答案奖励同时不低于两个单模态输入下的奖励(即 \(r_{ans}^1 \ge r_{ans}^2\) 且 \(r_{ans}^1 \ge r_{ans}^3\)),则给予一个额外的注意力奖励 \(r_{attn}=\alpha\)(\(\alpha=0.3\)),否则为0。该机制显式强制模型从多模态信息融合中获益。该阶段的总体奖励函数为 \(R_{MA} = r_{format} + r_{ans} + r_{attn}\)。
[图像补充] 图5展示了论文中关键奖励函数的数学公式,与主方法描述完全对应。图中明确显示,\(R_{QI}\) 由 \(r_{format}\)、\(r_{ans}\) 和 \(r_{cons}\) 与 \(r_{comp}\) 的平均值线性组合而成。\(R_{MA}\) 的公式则清晰展示了条件性的注意力奖励项 \(r_{attn}\),即仅在 \(r_{ans}^{av} \ge r_{ans}^v\) 且 \(r_{ans}^{av} \ge r_{ans}^a\) 时生效。
💡 核心创新点
- 自监督的查询密集型局部定位(QI):在无任何人工过程标注的情况下,通过强制模型生成时间-字幕对并与外部judge模型进行一致性和完整性校验,成功地为“在回答前定位关键证据”这一难以直接监督的中间行为,提供了可计算、无标注的奖励信号。这为解决多模态推理中证据追踪的可监督性问题提供了一条巧妙的新思路。
- 对比式的模态注意力融合(MA):通过并行比较“完整音视频”与“单模态”输入下的模型答案质量,设计了一个简单有效的对比奖励项,直接鼓励模型从跨模态协同中获取性能增益,而非依赖单模态捷径。该机制从奖励塑形的角度干预并缓解了模态偏差。
[图像补充] 图4以柱状图直观展示了消融实验的关键结果。移除MA阶段的对比奖励 (\(r_{attn}\)) 后,OmniVideoBench得分从44.8降至43.7;而移除QI阶段的关键意图监督信号 (\(r_{intent}\)) 后,分数更是大幅降至38.4。此外,QA SFT (39.1)、CoT SFT (42.2) 和 Vanilla RL (41.5) 的性能均显著低于完整的OmniVideo-R1,有力地支撑了论文核心设计(两阶段RL及奖励组件)的有效性。
- 面向MoE模型的GSPO训练范式:针对Qwen3-Omni这类MoE模型中,因专家激活导致token分布剧烈变化从而引发传统GRPO重要性采样高方差的问题,采用序列级优化的GSPO算法,为大型MoE多模态模型在后训练中实现稳定、有效的RL训练提供了工程实践参考。
- 兼顾单模态性能的鲁棒训练:证明了增强音视频融合的RL训练,不一定以牺牲模型原有的单模态能力为代价。实验结果显示,模型在纯视觉基准上不仅未退化反而略有提升,验证了框架的“无损”增益特性。
📊 实验结果
论文在多个音视频和纯视觉基准上评估了基于Qwen3-Omni-30B-A3B训练的模型,主要结果如下:
音视频理解基准对比(部分)
| 方法 | Daily-Omni | WorldSense | IntentBench | VideoHolmes |
|---|---|---|---|---|
| Gemini-2.5-Pro | 81.4 | 64.6 | 67.2 | 64.9 |
| Gemini-3-Pro | 81.1 | 66.4 | 71.5 | 67.0 |
| video-SALMONN 2+-72B | 79.4 | 56.5 | — | 57.8 |
| Qwen3-Omni-30B-A3B-Instruct | 63.6 | 54.0 | 65.7 | 49.0 |
| Qwen3-Omni-30B-A3B-Thinking | 75.8 | 48.0 | 68.5 | 57.3 |
| OmniVideo-R1 | 82.8 | 65.8 | 74.2 | 62.9 |
OmniVideoBench按音频类型与视频时长细分
| 方法 | 音乐 | 声音 | 语音 | (0,1]min | (1,5]min | (5,10]min | (10,30]min | Avg |
|---|---|---|---|---|---|---|---|---|
| Gemini-2.5-Pro | 38.5 | 57.7 | 61.7 | 57.8 | 64.4 | 55.0 | 55.9 | 58.9 |
| Qwen3-Omni-30B-A3B-Instruct | 30.8 | 35.8 | 38.0 | 46.8 | 37.4 | 37.7 | 29.7 | 37.0 |
| OmniVideo-R1 | 40.7 | 38.1 | 46.6 | 53.8 | 43.5 | 43.9 | 41.4 | 44.8(+7.8) |
[图像补充] 图3以分组柱状图的形式直观呈现了OmniVideoBench的细分结果。它不仅强化了表格数据,还更清晰地展示了模型在不同时长视频上的性能趋势。值得注意的是,OmniVideo-R1在所有音频类型和大部分时长区间均优于其基座模型,尤其在长视频区间(10-30分钟)优势显著(41.4 vs. 29.7),但在“声音”类别(38.1)上仍落后于Gemini-2.5-Pro(57.7),这揭示了模型在该特定子任务上仍有较大提升空间。
纯视觉基准对比
| 方法 | Video-MME | MLVU(Dev) | LVBench |
|---|---|---|---|
| Qwen3-Omni-30B-A3B-Instruct | 70.5 | 75.2 | 50.2 |
| Qwen3-Omni-30B-A3B-Thinking | 69.7 | 72.9 | 49.0 |
| OmniVideo-R1 | 73.6 | 74.1(-1.1) | 51.9 |
关键消融与训练策略实验 在OmniVideoBench基准上:移除意图奖励(w/o \(r_{intent}\))导致性能从44.8降至38.4;移除注意力奖励(w/o \(r_{attn}\))降至43.7;移除整个QI阶段(仅MA,使用88K数据)降至41.0。对比训练策略,QA SFT、CoT SFT和Vanilla RL的性能分别为39.1、42.2和41.5。此外,将MA数据量从1K增至12K,Daily-Omni性能从82.4提升至82.8呈饱和趋势;注意力奖励超参数\(\alpha=0.3\)优于\(\alpha=0.1\)或\(\alpha=0.8\)。
🔬 细节详述
- 训练数据:原始数据来自LLaVA-Video和Video-Vista,经过结构化清洗后,再由Gemini-2.5-Pro进行四维质量评分(视频依赖性\(s_v\)、音频依赖性\(s_a\)、问题逻辑\(s_q\)、答案准确性\(s_r\),满分均为1),并使用Qwen-3-32B进行16类分类。保留满足\(s_r=1\), \(s_q\ge0.8\), 综合得分\(s_c\ge0.7\)的样本,并对长尾类别进行修剪,最终得到88,173个训练样本用于QI阶段。随后,进一步筛选出具有高音视依赖(\(s_v\ge0.7\)且\(s_a\ge0.7\))的12,887个样本用于MA阶段。未提及额外数据增强。
- 损失函数与奖励:训练基于GSPO的序列级策略优化目标,使用组标准化优势函数和序列似然比进行梯度更新。奖励函数明确为:QI阶段 \(R_{QI}=r_{format}+r_{ans}+(r_{cons}+r_{comp})/2\);MA阶段 \(R_{MA}=r_{format}+r_{ans}+r_{attn}\)。
- 训练策略:使用128块H20 GPU进行训练,全局batch size为256,学习率\(1\times10^{-6}\),预热比例0.05,采样rollout数量为8,最大序列长度32768。KL正则化系数\(\beta=0.03\),MoE辅助损失系数\(1\times10^{-3}\),GSPO的截断阈值\(\epsilon=3\times10^{-4}\)和\(\epsilon_{high}=4\times10^{-4}\)。两个阶段顺序进行。
- 关键超参数:视频帧数上限
FPS_MAX_FRAMES=64。MA阶段的注意力奖励系数\(\alpha=0.3\)。 - 训练硬件:128张NVIDIA H20 GPU用于模型训练,外部的judge模型部署在64张H20 GPU上。
- 推理细节:推理时遵循训练时的结构化输出格式,生成时间-字幕对后执行思维链推理。未详述解码策略。
- 正则化技巧:使用KL散度惩罚项约束模型不要偏离参考策略太远,并使用MoE的负载均衡损失。
⚖️ 评分理由
创新性 (1.5/2):将音视频推理后训练解耦为“定位”和“融合”两个可独立优化的RL子阶段,并通过自监督对齐和对比奖励实现了无需昂贵标注的推理行为注入,这一组合是具有洞察力和新颖性的。虽然其组件(自监督定位、对比学习)本身并非全新,但在音视频推理这一特定问题下的系统化整合构成了显著贡献。
技术严谨性 (1.3/1.5):奖励函数设计清晰,每个组件的职责和目标明确;为MoE模型选择GSPO提供了合理的理论动机。然而,整个框架的奖励信号重度依赖外部judge模型(Qwen3-VL-235B等)的质量,论文仅在附录中以Cohen’s Kappa系数简要说明了跨judge一致性,未深入分析judge偏差可能对策略优化方向产生的系统性影响,对潜在的reward hacking问题也缺乏分析和防御机制的讨论,这在RL训练中是一个值得关注的疏漏。
实验充分性 (1.3/1.5):实验设计较为全面,在多个主流音视频及纯视觉基准上对比了大量强基线(包括闭源模型),关键组件、奖励项、数据量和超参数的消融实验也基本完整,结论与实验数据吻合。但论文未汇报多次运行的方差或进行统计显著性检验,对QA SFT、CoT SFT等基线的对比规模偏小。虽然展示了向Qwen2.5-Omni-7B等架构的泛化能力,但仅在OmniVideoBench一个基准上进行了快速验证,说服力稍显不足。
清晰度 (0.8/1):正文整体结构逻辑清晰,图文并茂地对数据pipeline和两阶段方法进行了说明,奖励函数和公式定义明确。缺陷在于,部分细节严重依赖附录,例如数据过滤中15个类别的具体定义、各judge评估的具体规则等,影响正文独立阅读的完整性。
影响力 (1.0/1.5):作为工作,该工作在音视频理解和多模态后训练领域具有推动作用,其在多个基准上取得的优异性能证明了方法的潜力。但影响力会受到完全闭源的严重制约,社区的即时跟进和快速扩散难度很大。此外,方法仅在Qwen3-Omni系列模型上进行了深度验证,其通用性和跨架构迁移的潜力尚未被充分证明。
开源 (0.0/1.5):论文未提供任何代码仓库、模型权重或处理后的数据集下载链接,也未在文中给出未来开源的承诺。所有核心资源均不可公开获取。
可复现性 (0.4/0.5):论文在正文和附录中提供了主要的超参数、训练硬件配置、奖励权重以及部分judge的prompt,具备了不依赖作者介入尝试复现的大部分配置信息。但关键细节仍有遗漏(如optimizer选择、解码策略、judge模型的完整部署环境等),且由于核心资产未开源,复现仍需巨大的工程投入。
工程/实践价值 (1.2/1.5):论文提供了一套从多维评分数据清洗到两阶段RL训练的完整工业级pipeline描述,其中包含数据过滤机制、自监督定位与对比融合的设计,这些对构建实际音视频理解系统具有较高的工程参考价值。但受限于完全闭源,其可直接复用的价值被打了折扣。
🚨 局限与问题
论文明确承认的局限
- 当前方法仍依赖最终答案的真值标签(outcome-based ground-truth)进行训练,未来的一个方向是探索如何在完全无标注的条件下提升模型。
- 所提多模态训练范式(意图查询和模态注意力)不限于音视频,理论上可扩展到3D等其他模态,但当前工作未进行验证。
审稿人发现的潜在问题
- 奖励模型偏差与reward hacking风险:尽管论文通过Cohen’s Kappa系数说明judge一致性,但这不能完全等同或替代对训练动态的分析。所有过程奖励(\(r_{cons}\)、\(r_{comp}\))均由外部judge产生,其自身的系统性偏见(比如对特定视觉场景或音频类型的判断倾向)将直接塑造策略的优化方向。论文未讨论在长期RL训练中策略可能找到并利用reward model弱点(即reward hacking)的风险及缓解措施。
- 数据污染与评测公平性:强模型(Gemini-2.5-Pro、Qwen3-VL-235B)被深度用于数据过滤、CoT标注生成和奖励计算,而这些模型或其同系列模型也出现在对比基线中。论文未讨论这种做法可能带来的数据泄露或评测不公风险,尤其当评估基准可能与这些模型预训练数据存在重叠时。
- MA设计的不对称性:MA阶段的对比训练要求完整模态输入下的表现不低于任一单模态,这本质上是惩罚了任何形式的有效单模态推理,即使在音频或视频单独即可完美解决问题的场景下。这种不对称的设计是否会导致模型在单一模态信息支配的场景下产生幻觉或过度解读,论文未做探讨。
- 泛化性验证不足:所有实验均在包含视频的数据上进行,未展示该方法在纯音频理解(如音频字幕、音频问答)任务上的零样本或少样本能力。这导致方法的适用边界不清晰,其是否是一个真正的“全模态”推理框架,还是仅适用于音视频混合场景,有待验证。
- 纯视觉性能的微小下降:尽管论文声称视觉性能稳健,但在MLVU(Dev)基准上,OmniVideo-R1(74.1)相比其基座模型(75.2)出现了1.1个百分点的下降。虽然幅度很小,但论文对此避而不谈,将其笼统地归为“保持稳健甚至略有提升”的做法不够严谨。