📄 AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

7.6/10 | 创新 1.1/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5

7.6/10 | 前25% | #音视频生成 | #多模态模型 | arxiv

👥 作者与机构

  • 第一作者:Ziwei Zhou(复旦大学)、Zeyuan Lai(中国科学技术大学)(共同一作)
  • 通讯作者:Yifan Yang(Microsoft Research Asia)
  • 其他作者:Rui Wang(复旦大学)、Yuqing Yang(Microsoft Research Asia)、Qi Dai(Microsoft Research Asia)、Lili Qiu(Microsoft Research Asia)、Chong Luo(Microsoft Research Asia)

💡 毒舌点评

这篇工作用一个设计良好的任务驱动基准和混合评估框架,把当前 T2AV 模型在音乐音高、文本渲染、物理推理等方面的“车祸现场”系统地曝光了出来,对领域极具诊断价值。然而,评测在音高维度因模型全面崩盘而存在地板效应,区分度与人类一致性均较低;对闭源 MLLM 的过度依赖和对评估模块自身的敏感性分析缺失,让这一精细指标的长期可靠性存疑。

📌 核心摘要

本文针对文本到音视频生成(T2AV)缺乏细粒度联合评估的现状,提出了任务驱动的基准 AVGen‑Bench 及配套的多粒度评估框架。核心思路是基于真实用户意图构建涵盖 11 个日常类别的 235 条复杂提示,并将评估解耦为基础质量(视觉美学、音频生产质量、音视频同步、唇音同步)与六个细粒度维度(场景文本渲染、面部一致性、音高准确度、语音可懂度与连贯性、物理合理性、整体语义对齐),采用轻量专家模型与多模态大模型(MLLM)的混合流水线执行“检测‑验证”。与现有仅看整体嵌入相似度的粗粒度评估相比,AVGen‑Bench 首次系统量化了 T2AV 模型在精确语义控制上的普遍失败模式。对 13 个主流 T2AV 模型的实验表明:所有系统的音高控制得分均低于 12/100,文本渲染(尤其是偶然文字)普遍出现乱码,且音视频同步误差仍在 0.2–0.44 s;同时,自动指标与专家判断在五个维度上 Pearson 相关>0.82。该基准为诊断 T2AV 模型弱点、引导未来研究提供了标准化工具,主要局限在于对闭源 MLLM 的依赖,且音高维度因模型能力不足而存在地板效应。

🔗 开源详情

🏗️ 方法概述和架构

AVGen‑Bench 是一个不参与生成、仅做评估的基准与框架,整体流程分为“任务驱动提示构造”与“多粒度混合评估”两阶段。

提示构造:先定义覆盖专业媒体制作(商业广告、电影预告)、创作者经济(ASMR、烹饪、游戏、乐器教学)及世界模拟(物理、化学、运动、动物)三大领域的 11 个子类别。采用 GPT‑5.2 根据场景定义批量生成候选提示,再经人工审核保证复杂性、清晰度与多样性,最终得到 235 条高难度提示(平均 88.5 个 token)。其中“物理/化学”类别故意采用“欠指定提示”——只描述实验装置而不交代结果,迫使模型依赖内在世界知识正确生成物理现象。值得注意的是,提示的构造完全独立于评估指标,确保了基准的用户导向性和可扩展性。

展示了提示的分类示例。

评估套件采用“轻量专家模型 + 多模态大模型”的混合架构,分为两大类模块:

  1. 基础评估模块(直接给出分数)

    • 视觉质量:采用 Q‑Align,一个基于 MLLM 的美学评分器,输出视频技术质量分数。
    • 音频质量:使用 Audiobox‑Aesthetic 的 Production Quality 子指标,衡量音频的清晰度与制作水平。
    • 音视频同步(AV Sync):使用 Syncformer,通过估计视觉动态与声音 onset 的时间偏移来计算同步误差。
    • 唇音同步:使用 SyncNet 计算口型与语音的帧级别偏移。
  2. 细粒度评估模块(采用“检测‑聚合‑验证”或“提取‑推理”管道)

    • 场景文本渲染:采用“检测-聚合-验证”管道。首先用 PaddleOCR 逐帧提取文字及其边界框,接着通过时空聚类将相近区域内连续出现的文本合并为文本序列,最后将序列送入 Gemini 3 Flash 进行双重验证——一是检查显式提示文字是否准确生成,二是判断偶然文字是否语义连贯。

展示了该模块的具体流程。 - 面部一致性:采用“检测-跟踪-聚类”管道。首先用 InsightFace 提取每帧人脸嵌入与边界框,随后基于交并比(IoU)与余弦相似度构建短时跟踪片段(tracklet),最后应用 DBSCAN 聚类得出独立身份。该指标由“身份计数准确度”和“身份稳定性”两部分加权(40%和60%)构成,前者与 Gemini 从提示中预测的角色数进行比较。

详细说明了此过程。 - 音高准确度:采用“符号-神经验证”管道。先用 Gemini 从提示中提取结构化的音乐理论约束(如和弦、音阶)并过滤掉模糊提示,随后使用 Basic‑Pitch 将音频转为 MIDI 音符事件,最后再由 Gemini 对 MIDI 符号序列进行严格的理论符合性验证。

描绘了评估管道。 - 语音可懂度与连贯性:采用“ASR-推理”管道。使用 Whisper‑large‑v3 结合 VAD 转录音频,随后由 Gemini 在两种自适应模式下进行审计:“逐字模式”(当提示给出具体台词时,强制进行严格的字词匹配)或“语境模式”(当提示暗示有语音但无确切内容时,判断语义是否与上下文合理)。

展示了两种模式的流程。 - 物理合理性:采用“双流评估”。低层运动合理性由 VideoPhy‑2 AutoEval 对视频进行运动平滑度和轨迹真实性打分;高层因果推理则采用两阶段语义验证,先由 Gemini 从提示中提取可观察期望,再对照视频证据进行逐项判定。

对此进行了可视化说明。 - 整体语义对齐:采用“分解-验证”管道。由 Gemini 作为多模态审计员,将提示分解为叙事节拍、视觉属性、音频事件和摄影手法四维约束,然后逐维扫描视频/音频证据进行评分,输出一个超越简单语义相似度的整体对齐分数。

展示了整体框架与评估流程的概览。

该框架的设计动机是“提示驱动而非指标驱动”,提示来源于真实用户意图,评估面向失败模式,专家模型保证信号层面精确性,MLLM 负责高层次语义比对,从而避免单一粗粒度嵌入分数。

💡 核心创新点

  1. 任务驱动的 T2AV 联合评估基准:首次将评估从“为指标凑提示”转变为以真实创作意图为中心的 11 类任务分类,并使用“欠指定提示”考察模型的内在物理知识,区别于现有粗粒度、单维或仅嵌入相似度的基准。
  2. 多粒度混合评估框架:将评价细粒化为基础质量、跨模态同步和六项具体语义控制能力,并通过专家模型(OCR、ASR、AMT、人脸识别、物理检查器)与 MLLM 的管道式组合,在信号层与语义层同时获得高精度和高解释性。
  3. 系统诊断 T2AV 失败模式:大规模实验系统揭示出音高控制全局崩溃(所有模型<12/100)、偶然文字普遍乱码、脸部在切换镜头时身份漂移,以及声画同步仍显著落后等定量弱点,为改进方向提供了清晰依据。

到 提供了这些失败模式的直观案例。 4. 用户研究与稳定性验证作为方法学背书:开展了包含10名专家对85个任务的用户研究,证明自动指标在五个维度上 Pearson 相关 >0.82,并通过重复运行与子集重采样验证了 MLLM 辅助评分和基准规模的稳定性,提升了评估的可信度。

和 展示了相关性分析和稳定性验证的结果。

📊 实验结果

主要结果见 Table 2,汇总了 13 个 T2AV 系统在 AVGen‑Bench 各维度的得分(AV Sync 和 Lip Sync 数值越低越好,其余越高越好,Total 按方案加权:\(Total = 0.2S_{basic} + 0.2S_{cross} + 0.6S_{fine}\),其中 \(S_{basic} = mean(Vis \times 100, Aud(PQ) \times 10)\),\(S_{cross} = mean(100 \cdot max(0, 1-AV/0.5), 100 \cdot max(0, 1-Lip/8))\),\(S_{fine} = mean(Text, Face, Music, Speech, Lo-Phy \times 20, Hi-Phy, Holistic)\))。

为该结果表的截图。以下表格根据论文 Table 2 还原:

ModelVis↑Aud(PQ)↑AV↓Lip↓Text↑Face↑Music↑Speech↑Lo-Phy↑Hi-Phy↑Holistic↑Total↑
Seedance2.00.9457.150.154.1474.8360.9528.1294.093.8983.1689.6172.07
Veo3.1-fast0.9606.640.212.3975.1052.773.1394.533.6867.4386.2767.87
Veo3.1-quality0.9546.770.243.5976.5352.905.0096.093.7468.5384.1066.28
Sora-20.8485.910.254.5074.8451.177.8188.634.0578.9588.8964.16
Wan2.60.9597.150.304.3276.9549.271.7589.333.6966.9280.9862.97
Seedance-1.5Pro0.9707.480.263.4338.2854.421.8893.453.7266.8877.3862.55
Kling-V2.60.9066.930.212.3014.5257.335.0089.623.8463.9276.7461.82
LTX-2.30.8587.110.362.0054.1745.061.3886.663.9964.3165.2259.97
NanoBanana2 + MOVA0.8906.710.442.7068.2641.330.5982.453.9160.9572.4858.10
LTX-20.8286.840.234.7624.7648.535.7587.074.0560.2066.5956.62
Emu3.5 + MOVA0.9116.800.384.8364.7248.440.6281.743.8955.8566.5556.12
Wan2.2 + HunyuanVideo-Foley0.9366.600.235.3848.4636.233.4453.403.9054.1160.6353.29
Ovi0.8396.310.375.4041.3649.0511.2576.493.9352.9257.4552.02

关键发现:所有模型音高控制(Music)近乎零分;偶然文本渲染普遍乱码;音视频时间偏移普遍>0.2 s;物理高层因果推理最高约83.16(Seedance2.0);语音可懂度上 Veo3.1 系列强势,开源模型在无指定台词时大量出现胡言乱语。用户研究给出自动指标与专家评分的 Pearson 相关:Text 0.9657, Face 0.8270, Speech 0.8300, Physical 0.8290, Holistic 0.8402,仅 Pitch 因地板效应低至 0.5544。重复评测稳定性实验(Table 5)及子集重采样(Figure 6)证明评分和基准规模均稳定。[图22] 和 [图23] 直观展示了这些相关性与稳定性分析。

🔬 细节详述

(因论文为基准研究工作,不涉及自研生成模型训练,故训练相关部分标记“未说明”)

  • 训练数据:未说明(评测框架不涉及模型训练)
  • 损失函数:未说明
  • 训练策略:未说明
  • 模型规模 / 关键超参数:Dual‑stream 评估组件使用第三方模型,如 Q‑Align、Audiobox‑Aesthetic、PaddleOCR、InsightFace (Buffalo‑L)、Basic‑Pitch、Whisper‑large‑v3、Syncformer、SyncNet、VideoPhy‑2 AutoEval、Gemini 3 Flash/Pro 等,均使用原有公开配置。此外,音高评估中 AMT 结果聚合使用了 80ms 的窗口。
  • 训练硬件:未说明
  • 推理细节:生成模型统一设定分辨率 720p(MOVA级联管道为360p),目标时长 10 s(Veo3.1 8 s,Sora2 12 s,Wan2.2 5 s),开源模型使用官方默认采样参数;评估过程无额外搜索策略。论文附录提供了不同生成模型的输出分辨率与时长设定对比。
  • 正则化或稳定训练技巧:未说明,但评测运行稳定性通过三次重复和子集重采样验证。

⚖️ 评分理由

  • 创新性 (1.1/2):问题定义清晰,将 T2AV 评估从粗粒度的整体相似度拉向任务驱动的细粒度语义控制,这在领域内具有相当的新意。多维度混合评估流程(OCR+AMT+物理检查器+MLLM)将不同层次能力审计有机组织起来,并非简单排列现有工具,而是提供了可扩展的模块化方法论。不过,每一单项自动指标本身并无技术创新,整体贡献偏向基准设计和对现有工具的工程组合,缺少完全原创的评估算法或模型,因此未达到范式级创新。
  • 技术严谨性 (0.9/1.5):各细粒度模块的设计考虑了合理的“检测‑验证”逻辑,对物理模块更分出了低阶运动与高阶因果两条路径,方案整体无明显逻辑漏洞。但部分验证步骤(如音高符号逻辑验证、物理高阶语义推理)高度依赖 MLLM 的解读,论文虽通过了稳定性实验,但并未深入分析 MLLM 判定错误的具体类型或 biases,也未讨论当不同 MLLM 版本或提供商表现波动时的影响。此外,对于系统组件的超参数(如时空聚类阈值、DBSCAN 参数)缺乏消融研究或敏感性分析,这构成了一个稳健性缺口。
  • 实验充分性 (1.0/1.5):覆盖 13 个模型(含商业与开源、端到端与级联流水线),横跨基础与细粒度多维指标,展示了丰富的定量诊断和定性案例。用户研究、评分稳定性与子集重采样实验进一步增强了评测的可信度。主要不足是缺少关于各评估模块自身重要性的消融分析(例如移去某个细粒度维度对总体排名的扰动),以及缺少与已有相关基准(如 VBench、T2AV‑Compass)的横向一致性或排名相关性分析,使框架的增量价值对比不够直观。
  • 清晰度 (0.9/1):论文结构化良好,图 3 概览清晰,每个细粒度模块都有独立的流程图解释。正文对提示分类、评估管道和定性案例的描述具体,文本整体易于跟随。仅在某些评估公式中对加权系数(如 Total 分数的 0.2/0.2/0.6)的选择依据未做充分论证。图 2 的整体框架图和各模块子图(图 4-8)显著提升了方法部分的可理解性。
  • 影响力 (1.0/1.5):该基准直接指向 T2AV 模型真实使用中的痛点,系统性暴露了音高、文本、物理推理等长期被忽略的失败维度,对于指导下一阶段多模态生成模型的改进方向有直接参考价值。团队来自有影响力的研究机构,且发布了基准资源,有望成为 T2AV 领域的核心评测之一。由于其核心贡献落在音视频生成,与音频/语音社区高度相关,影响力正常。但基准所揭示的“全局失败”(如音高)暂时无法提供细粒度梯度,其区分度需待模型能力提升后才能完全显现;此外,缺乏与同期基准的直接横向比较,使得其在领域内的相对优势不够清晰。
  • 开源 (1.2/1.5):论文声明代码与基准资源将在 http://aka.ms/avgenbench 提供,包含提示集和评估管道,这属于基准的核心内容。已给出链接,但暂无法确认该地址下文档的完整程度(README、使用说明等),视作核心资源可获取但文档细节未详述,扣分在文档充分性上。
  • 可复现性 (0.3/0.5):提示构造流程(GPT‑5.2 生成+人工审查)、评估组件选用(具体模型版本、推理设置)以及生成模型的统一设定(分辨率、时长等)均作了较详尽的报告,使得其他人有能力复现大部分评估。但部分基于闭源商业 API 的模块(Gemini 3 Flash/Pro)和商业生成模型使得某些评测无法完全脱离特定供应商,且未提供评估结果的原始日志或详细运行脚本参数,可复现性受到一定限制。
  • 工程/实践价值 (1.2/1.5):提供了可直接运行的 T2AV 评测系统,含完整的模块化评估流水线和任务提示集,工业界可直接用于新模型的多维安全与质量审计,实际落地参考价值高。整个框架的高度组件化设计也便于业务方替换或增加新的评估模块,具有较好的扩展性。未给满分是因当前某些模块仍依赖第三方闭源服务,对纯离线部署或私有化改造有一定阻碍。

🚨 局限与问题

论文明确承认的局限

  • 某些细粒度评估(如音高)因当前模型能力整体过低而出现地板效应,此时自动指标和人类评分的一致性与区分度均受限。
  • 评测中使用了闭源 MLLM(Gemini 3 系列),作者承认这会引入一定偏差,但通过多次运行和子集重采样来缓解波动。

审稿人发现的潜在问题

  • 缺乏横向基准对比:论文未与同期 T2AV 基准(如 VABench、T2AV‑Compass、HarmonyBench)进行任何横向对比或排名关联验证,这使得读者难以判断 AVGen‑Bench 在模型排名上的增量信息究竟有多大,也无法评估其相对优势。
  • MLLM 偏见的级联风险:物理合理性、语义对齐等多个关键模块严重依赖 Gemini 进行高层推理。论文未分析 MLLM 自身对复杂物理现象或音乐理论的理解是否可靠,存在“算法偏见套模型偏见”的风险。若能使用多个不同 MLLM 进行交叉验证会更具说服力。
  • 模块超参数未消融:对每个细粒度模块内部的超参数(如时空聚类参数、DBSCAN 设置、AMT 的 80 ms 窗口、身份计数准确度与稳定性的 4:6 权重等)的选择缺乏消融或敏感性分析,这些阈值的选择可能显著影响分数分布。
  • “用户意图实现度”的距离:论文强调“提示驱动而非指标驱动”,但评估框架本身未考虑音频‑视觉指代歧义或部分情节合理性,仍是一个静态参照评估,离真正的“用户意图实现度”尚有距离。
  • 权重设定的主观性:Total 分数的组合权重(0.2/0.2/0.6)及各模块内子指标的加权方式(如面部一致性中 40%/60% 的分配),仅由作者设定,未提供用户调研或实验数据来支撑其合理性,可能影响最终排名的公信力。

← 返回 ICML 2026 论文速递