📄 VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

标签:#音视频生成 #强化学习 #Transformer #模型评估

8.3/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5

🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #强化学习 | #Transformer #模型评估 | arxiv

👥 作者与机构

Yinming Huang、Shuyuan Tu(共同一作)、Xi Yan、Zihan Yang 来自复旦大学与上海创新研究院,Jianhua Han、Xu Hang 来自银旺智能科技,Yu-Gang Jiang 与 Zuxuan Wu(通信作者)来自复旦大学。代码已在 GitHub 公开,数据构建使用 Gemini 3.1 与 Qwen3.5-Omni 等商业及开源模型。

💡 毒舌点评

这篇论文补上了联合视听生成后训练链路里最缺的一环:当 OmniNFT 们还在用五个独立指标拼奖励时,作者指出人类偏好根本不可分解为逐模态判断——同步分再高也可能演错事件,视觉分再强也可能配上情绪不符的声音。为此他们从数据(VAPref-10K 一万对人工偏好比较)、评测(含闭源模型输出的域外基准)到模型(思维链全模态奖励模型)做了全栈建设,再用 GRPO 做维度级强化学习把稀疏的二元标签拆成密集奖励。最有力量的证据是下游人类评估:VA-Judger 后训练的 LTX-2 拿到 62.3% 的人类偏好,是 OmniNFT 的两倍多、基座的六倍多——改进可被人感知而非只刷指标。但有三处需要保留。其一,冷启动与困难对的思维链由 Gemini 3.1 生成,即便经过拒绝采样的人类校验,推理风格的先验仍来自商业模型,奖励模型的「人类对齐」实际是「Gemini 风格加人类过滤」。其二,维度级奖励的归因假设(C 维给音频、D 维给视频、A/B/E 共享)是人工设定的路由规则,其合理性未经消融验证。其三,偏好标注只有选择与理由维度,没有强度信息,配对比较的传递性一致性也未报告。

📌 核心摘要

论文针对联合视频-音频生成强化学习后训练中奖励信号的关键瓶颈,提出人类对齐的全模态奖励模型 VA-Judger。现有方法用视频质量、音频质量、文本对齐与音画同步等独立指标拼装奖励,既无法捕捉文本-视频-音频之间的整体语义与时序连贯,也与人类判断严重不对齐,优化这类奖励会催生刷分而不讨好的奖励劫持。作者首先构建 VAPref-10K 人类偏好数据集:约九千条来自带字幕网络视频的提示词,三个开源先进模型生成候选,标注者在同提示成对比较中选择偏好并标记支撑维度,共得一万零三百个细粒度比较;同时推出 VA-Judger-Bench 基准,域外切分采用 Kling、Wan、Veo 与 Sora 等闭源模型的输出。模型训练采用三阶段渐进策略:先在质量差距明显的对上用评分表格式思维链做冷启动,再通过拒绝采样为质量接近的困难对蒸馏经人类标注校验的偏好解释,最后以 GRPO 做维度级强化学习。实验显示 VA-Judger 在域内与域外偏好预测上均超过指标基线;用于后训练 LTX-2 时在 JavisBench 子集上全面改进生成质量,人类偏好率达 62.30%。

这项工作的意义需要放在视听生成的产业背景下理解:当视频生成模型纷纷补齐音频能力,后训练的对齐质量直接决定产品体验的上限,而奖励信号恰恰是整条强化学习链路中最薄弱的一环。VAPref-10K 的成对比较协议规避了绝对打分的主观校准问题,维度勾选则让每条偏好自带可解释的归因,这两点设计使数据集本身成为可复用的基础设施——即便后续奖励模型架构更迭,这套数据与评测协议仍可持续服务社区。

🔗 开源详情

  • 代码:官方仓库已公开:https://github.com/ShareLab-SII/VA-Judger 。
  • 模型权重:论文中未明确说明 VA-Judger 权重的发布状态。
  • 数据集:VAPref-10K 与 VA-Judger-Bench 的公开下载渠道未在正文中给出;场景种子源自公开的 JavisBench 与 AVGenBench。
  • Demo:论文中未提及在线演示。
  • 复现材料:附录提供了完整的数据构建流水线、评分维度定义与训练配置说明。
  • 论文中引用的开源项目:LTX-2、OVI、DaVinci-MagiHuman、Qwen3.5-Omni 等开源生成与理解模型。

🏗️ 方法概述和架构

数据构造层解决偏好监督的稀缺。真实视听片段先由 Qwen3.5-Omni 打字幕,再经大语言模型改写为文本提示,送入 LTX-2、OVI 与 DaVinci-MagiHuman 三个开源模型生成候选片段;这一协议设计是全文数据贡献的基石。标注环节刻意回避绝对标量打分——不同专家的主观校准差异会使绝对分不稳定——改为同提示成对强制选择并勾选支撑决策的质量维度,这一设计同时获得了偏好方向与可解释的维度归因。VA-Judger-Bench 的域外切分从 AVGenBench 抽取闭源模型配对并完全排除在训练之外,用于检验奖励模型的真实泛化。

模型训练层分三阶段递进。第一阶段冷启动:对质量差距清晰的跨模型对,由 Gemini 3.1 生成包含维度级分数、解释与最终偏好的评分表思维链答案,让模型习得结构化比较格式与基础判别力。第二阶段拒绝采样:对质量接近的困难对,同样先生成思维链,但只保留最终偏好与人类标注一致的答案,使模型在结构化推理轨迹上学习的同时被人类判断锚定,从而关注区分相似输出的细微同步、语义与连贯失败。第三阶段维度级强化学习:单一二元偏好标签过于稀疏,改用 GRPO 以经验证的奖励评估驱动试错更新,精炼推理过程与最终偏好。

下图展示了 VA-Judger 的三阶段渐进训练管线全貌。

Figure 2: Overview of the VA-Judger training pipeline. Stage 1 cold-starts the model on easy preference pairs. Stage 2 aligns the model on harder pairs through human rejection sampling. Stage 3 performs GRPO using answer-level and dimension-level rewards grounded in human reasons.

从冷启动阶段的评分表思维链生成、困难对的拒绝采样过滤,到维度级 GRPO 强化学习,每个阶段的输入来源与监督信号在图中一目了然;值得注意的是 Gemini 仅出现在左侧的离线数据构建路径中,在线奖励调用完全由本地模型承担,这是算力与成本约束下的务实架构选择。

后训练应用层保持 OmniNFT 的强化学习框架但替换其五个独立专家奖励:每个提示由旧策略生成八个候选构成二十八对,VA-Judger 对每对按五个评分维度打分,候选取七次比较的平均分;C 维作音频奖励、D 维作视频奖励、A/B/E 均值作共享跨模态奖励,组内归一化后分别路由到对应分支。LTX-2 主干冻结,仅优化 LoRA 参数;Gemini 仅用于离线数据构建,付费远程 API 无法承受后训练期间的频繁奖励调用。

💡 核心创新点

  1. 联合视听生成领域首个大规模人类偏好数据集与奖励基准,填补了该方向对齐后训练的基础设施空白。VAPref-10K 的成对强制选择加维度勾选协议兼顾了标注一致性与可解释性,VA-Judger-Bench 的域外闭源切分为奖励对齐设立了此前不存在的检验标准,也使过拟合域内风格的行为无处遁形。
  2. 渐进式思维链训练配方,三个阶段分别解决格式习得、困难判别与密集奖励三个学习瓶颈。从易对的格式习得、困难对的人类校验拒绝采样到维度级 GRPO,三阶段各自解决一个明确的学习瓶颈,其中「人类标注过滤机器生成的推理链」在监督成本与可靠性之间取得了务实的平衡,避免了纯合成数据训练的分布漂移。
  3. 维度级奖励分解的后训练方案,直接回应了独立指标拼装带来的奖励劫持问题。把整体偏好拆解为可分别路由到音频支路、视频支路与共享跨模态支路的密集信号,替代五个独立指标的机械拼接,直接回应了奖励劫持问题;共享跨模态奖励同时更新两条支路的设计也保证了音画协调不会被单模态优化牺牲。

📊 实验结果

奖励模型评测在 1150 对的 VA-Judger-Bench 上进行,报告总准确率与可解析准确率,不可解析响应计为错误。单维指标基线的总体准确率全部落在 50% 到 56% 区间:VideoAlign 54.29、AudioBox 50.43、CLIP Score 54.50、ImageBind 文本-音频 54.29、ImageBind 音视 55.94、SynchFormer 52.71,证实了指标与人类判断的低对齐;VA-Judger 在简单、域内、域外与总体四档上全面领先这些基线,也优于现有全模态模型。

评测对象Easy (%)域内 (%)域外 (%)总体 (%)
VideoAlign(视频质量)62.3952.9748.3554.29
AudioBox(音频质量)58.7050.0044.0050.43
CLIP Score(文本-视频)55.5654.6653.5854.50
ImageBind(文本-音频)58.4852.9751.4854.29
ImageBind(音频-视频)61.3055.5151.8355.94
SynchFormer(同步)61.3046.6148.3552.71
VA-Judger四档均最优四档均最优四档均最优四档均最优

下游后训练在从一万零一百四十条 JavisBench 提示池中均匀随机抽取的二百条子集上进行,覆盖基座 LTX-2、OmniNFT 后训练版与 VA-Judger 后训练版。自动指标显示 VA-Judger 版在视频质量、AudioBox 质量与跨模态对齐各列取得多数最优或次优,两项增量行给出相对 OmniNFT 的原始变化。最关键的人类评估中,VA-Judger 后训练模型获得 62.30% 的人类偏好,OmniNFT 为 27.63%、基座仅 10.08%——前者是后两者的两倍多与六倍多,直接证明改进可被人类感知而非局限于指标得分。

下图概括了 VA-Judger 的三层评估结果。

Figure 1: Evaluation of VA-Judger. (a) VA-Judger selects the preferred clip through structured dimension-wise reasoning, whereas separate evaluation metrics disagree with human judgment. (b) VA-Judger achieves the highest agreement with human preferences. (c) VA-Judger provides the reward for post-training LTX-2, improving quality over the base model and OmniNFT.

面板 (a) 展示了结构化维度推理如何选出人类偏好的候选而单项指标判断失误;(b) 汇总了与人类偏好的一致率对比;(c) 则是后训练收益的总览。三张子图合起来构成了「判得准、对得齐、用得上」的完整证据链。

下图给出了三个系统的定性对比样例。

Figure 3: Qualitative comparisons of LTX-2, OmniNFT, and our VA-Judger post-trained model. VA-Judger better follows the requested temporal actions in both examples.

可以看到基座 LTX-2 生成的画面常伴随声音缺失或与画面的语义错位,OmniNFT 后训练版改善了同步但仍有情绪不匹配的情况,而 VA-Judger 后训练版在事件对应与声音氛围上明显更贴合提示词意图——这正是人类偏好评估数字背后的直观来源。

🔬 细节详述

数据侧细节:源视频分布横跨六个大类,声音类型与空间构成为多标签字段故百分比合计不为百;提示词改写环节隔断了真实字幕与生成内容的直接泄漏。VA-Judger 自身的 GRPO 以人类偏好与支持维度为可验证目标,对生成回答的最终选择及维度分数逐项核对;下游 LTX-2 后训练才把 VA-Judger 作为奖励模型。奖励模型以 Qwen3-Omni-30B-A3B-Instruct 初始化,各训练阶段使用八张 GPU;LTX-2 后训练冻结主干、仅训练 LoRA,并使用六张 GPU 训练、另两张托管奖励推理服务,论文未声称消费级硬件可完成。评测协议方面,VA-Judger-Bench 的域内部分来自 VAPref-10K 的留出对,域外部分来自 AVGenBench 的闭源模型输出且严格排除于训练;JavisBench 子集均匀随机抽样且不做类别过滤或分层。未披露的信息包括标注者人数与一致性指标、VAPref-10K 是否随代码开放下载,以及各阶段训练总时长。VA-Judger-Bench 的总准确率把不可解析响应计为错误;人类偏好评估让对比模型在相同提示下生成后由人选择,62.30% 对 27.63% 的差距因此直接反映感知层面的优劣。附录 A 展示了完整判断样例:系统提示定义五个维度,模型必须逐维比较两个候选后才允许给出最终偏好。

数据构建链路的每一环都值得注意:真实视听片段先由 Qwen3.5-Omni 打字幕,再由大语言模型改写为不含原字幕词汇的文本提示,这一改写步骤切断了生成内容与源字幕的直接泄漏路径;三个开源生成模型的输出构成候选池,难度感知的配对策略让简单对与困难对各司其职。VA-Judger-Bench 的域外切分来自 AVGenBench 中 Kling、Wan、Veo 与 Sora 等闭源模型的输出并严格排除于训练,使「对齐人类偏好」的主张经受住了分布外检验。附录 A 展示了完整的判断样例:系统提示定义五个维度,模型必须逐维比较后才允许给出最终偏好,强制结构化输出是维度级奖励可分解的前提。

⚖️ 评分理由

  • 创新性 (1.3/2):问题定位准确且数据-基准-模型-应用的全栈建设在该方向具有开创性,维度级奖励分解是对奖励稀疏性的务实回应;扣分在于渐进训练的三阶段均为社区成熟做法的组合,思维链监督依赖外部商业模型也削弱了方法自足性。
  • 技术严谨性 (1.2/1.5):域外闭源切分、不可解析计错、均匀无分层抽样与冻结主干加 LoRA 的受控对比体现了良好纪律;扣分在于 Gemini 思维链的系统性偏差无法被拒绝采样完全消除,维度路由规则缺乏消融。
  • 实验充分性 (1.3/1.5):奖励评测、自动指标与人类偏好三层验证闭环完整,62.30% 对 27.63% 的人类偏好差距说服力强;不足是缺少标注者一致性报告与多种子方差。
  • 清晰度 (0.8/1):动机、方法与应用的叙事线清楚,图示丰富;五维度定义推到附录增加了正文阅读成本。
  • 影响力 (1.1/1.5):为快速成长的联合视听生成领域提供了对齐后训练的基础设施,开源代码会加速后续工作;方向尚处早期,范式影响有待观察。
  • 开源 (1.2/1.5):代码已在 GitHub 公开(https://github.com/ShareLab-SII/VA-Judger),复现路径明确;但 VAPref-10K 数据集的开放状态未在正文中确认,权重发布亦未说明,因此未给满分。
  • 可复现性 (0.4/0.5):训练三阶段、评测协议与后训练配置披露完整且有代码背书,主要门槛是 Gemini 数据构建成本与标注复刻。
  • 工程/实践价值 (1.0/1.5):维度级奖励路由可直接接入现有 RL 后训练框架,LoRA 参数化控制了部署成本;但奖励调用的推理开销未被量化。

🚨 局限与问题

  1. 作者承认 Gemini 仅能用于离线数据构建,其 API 吞吐无法支撑在线奖励调用,暗示奖励模型的效率仍是瓶颈。
  2. 冷启动与困难对的思维链均由 Gemini 3.1 生成,人类校验只能过滤结论错误而无法消除推理风格与评价维度的先验偏差。
  3. 维度 C/D/E 到音频、视频与共享奖励的路由为人工设定,未提供该分配相对于其他路由方案的消融证据。
  4. 偏好标注不含强度信息,配对比较的传递性与标注者间一致性均未报告,数据质量只能间接推断。
  5. 人类评估的 200 提示子集虽随机抽取但规模有限,62.30% 的偏好率缺少置信区间。
  6. 奖励模型自身参数量与推理延迟未披露,难以评估其在更大规模后训练中的可行性。
  7. VAPref-10K 的候选仅来自三个开源模型,风格分布窄于闭源前沿系统,域外泛化的长期有效性待观察。

← 返回 2026-08-21 语音/音乐/音频论文速递