📄 T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

#基准测试 #多模态模型 #音视频生成

7.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.7/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5

7.9/10 | 前25% | #音视频生成 | #多模态模型 | #基准测试 | arxiv

👥 作者与机构

  • 第一作者:Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang(并列一作,均标注为南京大学)
  • 通讯作者:Jiaheng Liu(南京大学)
  • 其他作者:Yuanxing Zhang(快手科技 Kling Team)、Jiahao Wang(南京大学)、Jialu Chen(快手科技 Kling Team)、Miao Deng(南京大学)、Chenxi Liao(南京大学)、Yize Zhang(南京大学)、Yubin Guo(南京大学)、Zhaoxiang Zhang(中国科学院自动化研究所)

💡 毒舌点评

这篇论文在 T2AV 评估领域迈出了扎实的一步:500条高复杂度prompt配合同一框架下的双层级评估,确实暴露了SOTA模型在“音频真实感”和“长时叙述”上的系统性瓶颈,诊断价值明确。但MLLM-as-a-Judge的可靠性验证仅覆盖50个样本且音频Realism一致性较弱(L1高达1.420),若不能规模化解决judge bias,这套框架的权威性就只能停留在“参考级”而非“标准级”。

📌 核心摘要

  1. T2AV-Compass 旨在解决文本到音视频(T2AV)生成领域评估碎片化的问题,现有基准要么聚焦单一模态、要么缺乏对指令遵循和感知真实感的细粒度诊断。
  2. 方法核心是构建了包含500条高复杂度prompt的基准,并通过双层级评估框架将客观信号指标(视频/音频质量、跨模态对齐)与基于MLLM-as-a-Judge的主观诊断(指令遵循、真实感)相结合。
  3. 与 VABench、JavisBench 等同期基准相比,T2AV-Compass 在prompt复杂度(平均154 tokens vs. 50-68)、评价维度覆盖(增加指令遵循与真实感)以及诊断颗粒度(基于QA checklist的错误归因)上有明确区分。
  4. 实验评估了15个代表性T2AV系统,发现最强闭源模型Veo-3.1在总体平均分上领先,但音频真实感是所有模型的普遍瓶颈;在长时叙述(4+事件)任务上,失败率飙升至63-80%;Gemini 2.5 Pro作为judge与人类在视频指令遵循上的L1距离为1.012,但在音频真实感上高达1.420。
  5. 实际意义在于为T2AV模型开发者提供了首个系统化、诊断性的测试平台,尤其能精确定位视频动态性、跨模态同步、音频材质一致性等以往难以量化的失效模式。
  6. 主要局限包括:MLLM judge的音频评估可靠性不足、prompt套件未覆盖极端长尾场景、以及评估的计算成本较高。

🔗 开源详情

  • 代码:论文声明代码已开源,代指为 NJU-LINK/T2AV-Compass。经查证,具体GitHub仓库地址为 https://github.com/NJU-LINK/T2AV-Compass
  • 模型权重:未提及(本文为评估基准,未提出新模型权重)。
  • 数据集:T2AV-Compass 基准数据集(500 条复杂提示),论文声明可在 HuggingFace 获取。经查证,HuggingFace地址为 https://huggingface.co/datasets/NJU-LINK/T2AV-Compass
  • Demo:未提及。
  • 复现材料:论文提供了数据集构建流程、评估框架细节及所有提示模板(见附录 H、I),并报告了预处理与评估配置(如音频采样率 48kHz、视频帧率 2 FPS、MLLM 温度=0 等),但未单独提供训练配置或检查点。
  • 论文中引用的开源项目:
    • VBench (https://github.com/Vchitect/VBench)
    • EvalCrafter (https://github.com/EvalCrafter/EvalCrafter)
    • AudioCaps (https://github.com/cdjkim/audiocaps)
    • AudioLDM-Eval (https://github.com/haoheliu/AudioLDM)
    • JavisBench (未提供链接)
    • UniAVGen (未提供链接)
    • VABench (未提供链接)
    • TTA-Bench (未提供链接)
    • DOVER++ (https://github.com/VQAssessment/DOVER)
    • Aesthetic Predictor V2.5 (https://github.com/discus0434/aesthetic-predictor-v2-5)
    • CLAP (https://github.com/LAION-AI/CLAP)
    • VideoCLIP-XL-V2 (未提供链接)
    • ImageBind (https://github.com/facebookresearch/ImageBind)
    • Synchformer (未提供链接)
    • NISQA (https://github.com/gabrielmittag/NISQA)
    • LatentSync (未提供链接)
    • AudioLDM2 (https://github.com/haoheliu/audioldm2)
    • MMAudio (https://github.com/hkchengrex/MMAudio)
    • HunyuanVideo-Foley (未提供链接)
    • Wan2.1 (https://github.com/Wan-Video/Wan2.1)
    • CogVideoX (https://github.com/THUDM/CogVideoX)
    • VidProM (https://github.com/WangWenhao0716/VidProM)
    • Shot2Story (未提供链接)
    • Gemini-2.5-Pro 与 Gemini-2.5-Flash 等非开源 MLLM 仅作为调用工具,不属于开源项目。

🏗️ 方法概述和架构

T2AV-Compass 本质上是一个系统化的基准评测框架,而非生成模型。其整体流程分为三大阶段:数据构建、客观评测、主观评测。

  1. 数据构建阶段 采用三流并行的prompt生成管道。
  • 流一:多源数据采集与语义去重。 从 VidProM、Kling AI 社区、LMArena、Shot2Story 等源聚合原始prompt。所有prompt经 all-mpnet-base-v2 编码后进行去重(余弦相似度阈值0.8),再通过平方根采样(采样概率 \(P(c) \propto 1/\sqrt{|S_c|}\))抑制高频主题,确保长尾语义场景的可见性。
  • 流二:LLM重写与人类精炼。 采样后的prompt送入 Gemini-2.5-Pro 进行重写,强制注入视觉、运动、声学、电影摄影等多维约束。这使得平均prompt长度从54 tokens扩张到154 tokens,平均约束点数从约5个增加到10个。重写后的prompt再经人类筛选,剔除不合规或逻辑混乱的案例,最终保留400条。
  • 流三:真实视频反演。 为平衡纯文本生成可能带来的幻觉并确保物理合理性,从YouTube精选100个4-10秒的高保真视频片段。利用 Gemini-2.5-Pro 为这些片段生成密集的时序描述,再通过人在回路验证,修正生成描述与原始画面的偏差。此流确保100条prompt锚定在真实世界动态上,为评估提供了“真实性上限”参考。
  • 最终合并与QA Checklist生成。 流二和流三共构成500条prompt的最终基准套件。每条prompt随后被自动派生两类QA checklist:一类用于指令遵循(Instruction Following),通过槽位提取和维度映射将抽象指令转化为可判定的二值问题;另一类用于感知真实感(Perceptual Realism),专注检测时序连贯性、对象完整性、材质-音色一致性等内部失真。
  1. 客观评测层级 将系统性能解耦为三个独立支柱。
  • 视频质量:视频技术分(VT) 利用 DOVER++ 量化噪声、模糊等低保真伪影;视频美学分(VA) 用 Aesthetic Predictor V2.5 评估构图、光照、色彩和谐度。
  • 音频质量:音频美学分(AA) 是感知质量(PQ)和内容有用性(CU)的算术平均,即 \(AA = (PQ + CU) / 2\),其中PQ评估信号保真度和音色真实感,CU评估语义密度和可识别事件;语音质量分(SQ) 通过 NISQA 框架预测主观MOS分,捕捉传统信噪比指标忽略的细微退化。
  • 跨模态对齐:分别用 CLAP、VideoCLIP-XL-V2、ImageBind 计算文本-音频(T-A)、文本-视频(T-V)、音频-视频(A-V)在共享嵌入空间中的余弦相似度;时间同步误差(DS) 通过 Synchformer 检测音视频事件起始时间的绝对偏移;在说话人脸场景额外补充 LatentSync 唇动同步指标(LS)。
  1. 主观评测层级 采用双轨MLLM-as-a-Judge协议,强制要求Judge先阐述推理理由再给出1-5分评分,以提升可解释性和错误归因能力。
  • 指令遵循轨(IF):覆盖7个主维度和17个子维度:属性(外观和数量)、动态性(运动、交互、变换、镜头运动)、电影摄影(光照、构图、色彩分级)、美学(风格与情绪)、关系(空间与逻辑)、世界知识(事实性)、声音(音效、语音、音乐、非语音惩罚项)。最终IF-Audio分数计算公式为 \(IF\text{-}Audio = (S_{speech} - P + S_{sfx} + S_{music}) / 3\),其中 \(P = 1 - S_{nonspeech}\) 为对非必要语音的惩罚项。
  • 真实感轨:从视频和音频两方面独立评估。视频真实感分解为运动平滑度(MSS)、物体完整性(OIS)、时序连贯性(TCS);音频真实感分解为声学伪影分(AAS)和材质-音色一致性(MTC)。 所有MLLM评分经5点归一化后转化为百分制报告。

💡 核心创新点

  1. 面向T2AV评估的统一 taxonomy 与高复杂度 benchmark:构建了首套针对T2AV场景的系统化评估框架,填补了以往基准仅覆盖单一模态或弱多模态的空白。500条prompt经过 LLM重写和视频反演双重质量控制,平均token长度(154)和平均约束点数远超 VABench(50 tokens)、JavisBench(65 tokens)等同期基准,能有效对SOTA模型施加压力测试。

  2. 双层级评估框架的有机结合:将客观信号指标与基于QA checklist的MLLM-as-a-Judge诊断统一到同一框架内,既能给出可量化的信号级对比,又能提供细粒度的语义错误归因(如指出声画不同步的具体声源、动态行为执行失败的具体动作),大幅提升了评估的可解释性。

  3. 系统化的“音频真实感瓶颈”与“动力学瓶颈”发现:通过大规模对比实验首次量化了当前T2AV系统普遍存在的“视频强、音频弱”的非对称能力分布,并揭示出视频指令遵循中的“Dynamics(动力学)”维度是最具挑战性和区分度的短板。结合材质-音色一致性(MTC)、声学伪影(AAS)等新指标,为后续研究指明了具体的攻关方向。

  4. 多维难度切片与边际效应分析:设计了沿视觉主体数量、事件时序结构等轴的复杂度阶梯,揭示了长时叙述(4+事件)场景下失败率的急剧攀升(达63-80%),为T2AV模型的时序组合泛化能力提供了清晰的诊断工具。

📊 实验结果

论文在500条prompt上对15个T2AV系统(7个闭源端到端、3个开源端到端、5个级联/组合式流水线)进行了全面评测。结果分为客观指标与主观指标两大类。

客观指标结果:下表为主要模型在视频质量、音频质量、跨模态对齐上的对比。封闭源模型中,Veo-3.1在视频技术分(VT 13.39)和音频-视频对齐(A-V 0.2856)上表现突出,但Seedance-1.5在音频美学(AA 7.403)和唇同步(LS 1.560)上最优。级联管道Wan-2.2+Hunyuan-Foley凭借T2V骨干获得最高VT(13.43),但时间同步误差(DS)高达0.89以上。

方法开源VT↑VA↑AA↑SQ↑A-V↑T-A↑T-V↑DS↓LS↑
T2AV(端到端)
Veo-3.113.395.4256.8181.5970.28560.23350.24380.67761.509
Sora-27.5684.1125.5841.4850.24190.24840.24320.81001.331
Kling-2.611.415.4176.6661.7830.24950.24950.24490.78521.502
Wan-2.611.874.6056.4401.4760.21490.25720.24510.88181.081
Seedance-1.512.745.0077.4031.7660.28750.23200.23700.86501.560
LTX-27.1604.6616.7421.5970.18510.23650.24110.87561.339
Ovi-1.19.3364.3686.5311.5920.16200.17560.23910.96241.191
JavisDiT6.8503.5754.7520.12840.12570.23201.322
T2V + TV2A
Wan-2.2 + Hunyuan-Foley13.435.6056.3530.25750.20760.24550.7935
Hunyuan1.5 + MMAudio11.344.8046.1010.22100.24660.24360.9427
T2A + TA2V
AudioLDM2 + MTV8.0663.4586.2531.2640.16390.26980.23941.1590.6835

主观指标结果:下表为主观评测的指令遵循与真实感评分。Veo-3.1总体平均分最高(70.29),但音频真实感仅为49.95。开源端到端模型LTX-2总体63.72,视频真实感89.95为所有模型中最高,但音频真实感仅36.23,进一步验证了视觉与听觉真实感之间的显著断层。

方法开源IF Video↑IF Audio↑Video Realism↑Audio Realism↑Average↑
T2AV(端到端)
Veo-3.176.1567.9087.1449.9570.29
Sora-274.9372.8685.5346.0169.83
Kling-2.673.7263.8987.9847.0368.16
Wan-2.678.5274.9582.0535.1867.68
Seedance-1.560.9661.2288.9453.8466.24
LTX-263.9764.7489.9536.2363.72
JavisDiT32.5615.2634.9714.8524.41
T2V + TV2A
Wan-2.2 + Hunyuan-Foley64.5437.1089.6341.2558.13
T2A + TA2V
AudioLDM2 + MTV47.1354.3956.7331.9047.54

维度级诊断与边际效应:

  • IF Video子维度分析(图6)显示,Dynamic(运动与交互)是最具挑战性维度,即使最强模型在此维度分数也显著低于属性、电影摄影等静态维度,揭示了时序连贯性瓶颈。
  • IF Audio子维度分析(图7)指出Sound Effects是最大短板,而Speech/Music相对容易,说明模型在“物理音效-视觉事件”的语义接地上存在根本性困难。
  • 复杂度边际分析(图9)表明,随着视觉主体数量从1增至4+,失败率从8-10%升至21-44%;随事件数量从1增至4+,失败率从22%激增至63-80%,确认长时序一致性为当前系统核心瓶颈。

MLLM-as-a-Judge可靠性验证: 在50个prompt子集上计算MLLM评分与人类评分间的L1距离,发现Gemini 2.5 Pro在Video Realism上接近人类水平(L1 0.937 vs. 人类间0.926),但在Audio Realism上显著变差(L1 1.420 vs. 人类间1.042)。Qwen3-Omni在IF Audio上出现灾难性失败(L1 1.887)。

评估者IF Video↓IF Audio↓Video Realism↓Audio Realism↓Overall↓
Inter-Human0.9170.9110.9261.0420.949
Gemini-2.5-Pro1.0120.9800.9371.4201.087
Gemini-2.5-Flash1.2121.0271.3971.1931.207
Qwen3-Omni1.0261.8871.2971.6801.473

补充验证与分析:

  • 成对比较排名验证:在Arena50子集上,通过Bradley-Terry模型对人类成对比较偏好进行拟合,得出的Elo排名(Veo-3.1 > Wan-2.6 > PixVerse-V5.5 > Ovi-1.1 > JavisDiT)与Gemini 2.5 Pro的判断完全一致,验证了Judge对模型相对排序的捕捉能力。
  • 健壮性分析:重复3次完整评估,Gemini 2.5 Pro的各维度变异系数(CV)均低于1.02%,表明评分高度稳定。
  • 校准测试:使用100个真实世界视频作为输入,MLLM给予的指令遵循得分显著高于所有生成模型(如Relations 97.44 vs 模型最高77.81),证明了QA Checklist的区分度和判别力。
  • 客观指标与人类一致性验证:音频-视频同步的客观指标与人类平均评分之间的Spearman秩相关系数(SRCC)达到0.9172。

🔬 细节详述

  • 训练数据:论文为基准测试本身,不涉及模型训练数据。500条prompt来源包括VidProM、Kling AI社区、LMArena、Shot2Story以及100条经Gemini-2.5-Pro重描述并人工验证后的YouTube片段。所有prompt经 all-mpnet-base-v2 去重(阈值0.8)和平方根采样。
  • 损失函数:未说明(本论文不涉及模型训练)。
  • 训练策略:未说明。
  • 关键超参数:为MLLM judge配置了确定性解码(do_sample=False, temperature=0),帧采样率为2 FPS。同步检测工具desync的默认 offset_sec 设为-2.0。
  • 训练硬件:未说明(本论文不涉及模型训练)。
  • 推理细节:15个被评测T2AV系统均使用其原生配置。空间分辨率多为720p(Javis 480p,Kling-2.6 1080p)。对于Ovi-1.1和级联生成系统,用Gemini-2.5-Pro对原始prompt做了解析重述以适配其特定的推理和指令遵循管道。
  • 正则化或稳定训练技巧:未说明。

⚖️ 评分理由

  • 创新性 (1.2/2):论文提出了一套高度系统化、针对T2AV的评估基准和诊断框架。其核心创新在于将双层级(客观+主观)评估与QA checklist驱动的错误归因相结合,在T2AV领域填补了明确空白。与VABench、JavisBench等同期工作相比,在prompt复杂度、维度覆盖上具有清晰区分度。但核心模块(LLM重写prompt、MLLM-as-a-Judge、标准信号指标)均非本工作首创,其贡献主要体现在整合、工程化以及对T2AV场景的深度定制上,属于扎实的系统性贡献,而非方法论上的根本性突破。

  • 技术严谨性 (1.1/1.5):评估框架的维度定义、指标公式(如IF-Audio的惩罚项)和统计方法(L1距离、Spearman ρ、Bradley-Terry模型)描述清晰。冗余度分析也体现了对指标依赖性的审慎考量。主要失分点在于:MLLM-as-a-Judge的音频部分验证薄弱,音频真实感上的MLLM-人类一致性较差(L1 1.420),论文虽将其作为发现,但未充分讨论此偏差对整体排名(尤其是音频依赖型模型)的潜在混淆效应。此外,提示重写环节可能引入的偏差(如对特定模型风格的偏好)未做消融分析。

  • 实验充分性 (1.2/1.5):实验规模宏大且分析维度丰富:覆盖15个系统(含端到端、级联式等多种架构);主客观指标共13项;提供了详尽的子维度对比、复杂度边际效应分析、裁判一致性验证及健壮性分析。但主观评测的人类验证局限于50个样本的Consistency50子集,且音频真实感的人类间一致性本身也偏低(L1 1.042),在该子维度上的结论稳健性存疑。未提供模型间分数差异的统计显著性检验(如t检验或bootstrap分析),难以确认小分差是否具有统计意义。

  • 清晰度 (0.9/1):论文结构和叙述逻辑清晰,图表质量高,尤其是数据构建流程、评测示例和雷达图,能有效传达复杂信息。核心评估维度的定义和QA checklist生成逻辑明确。附录内容详实,提供了全部prompts模板。但主文中对部分技术细节(如平方根采样的具体实现、DOVER++和Aesthetic Predictor的版本与使用方式)的解释可更直接,少量关键描述依赖引用而非自包含阐述。

  • 影响力 (1.2/1.5):T2AV生成是当前多模态AI的活跃前沿,本工作提供的系统化评估与诊断能力对领域具有明显的推动作用:不仅为模型横向比较设立了公共标准,更暴露了“音频真实感瓶颈”、“Dynamics瓶颈”和“长时叙述困难”等明确的研究靶点。来自南京大学、快手、中科院自动化所的合作,以及所覆盖的SOTA模型,也增强了其社区关注度。不过,MLLM judge的成本和稳定性问题若不能有效解决,可能限制其在工业界快速迭代中的实用性。

  • 开源 (0.7/1.5):论文声明代码和数据可在GitHub和HuggingFace获取,核心benchmark(500 prompts)提供下载,符合数据集论文的核心开放原则。但论文中仅提供了组织名 NJU-LINK/T2AV-Compass,未给出具体的、可直接访问的URL。开源状态的最终确认依赖于外部搜索引擎(审校提示),因此给予中等偏上分数,但未达到满分。

  • 可复现性 (0.3/0.5):评估pipeline的多数步骤在附录中给出,MLLM judge的推理配置(temperature=0)也明确。但关键的可复现障碍在于:强依赖Gemini-2.5-Pro等闭源LLM作为重写器和Judge,其版本更迭可能直接导致评分分布漂移;此外,人类验证的细节、客观指标的具体调用参数未完全标准化描述,可能在不同实现下产生微小偏差。

  • 工程/实践价值 (1.3/1.5):这是一篇典型的benchmark工程论文,其核心价值完全体现在工程实践上。T2AV-Compass建立了一套从prompt生产、质量校验到双层级自动评测的完整pipeline,组件化设计使其具备良好的可维护性和可扩展性。对于T2AV模型开发的工业界团队而言,这套框架不仅能用于模型选型,更能直接集成到日常回归测试中,快速定位动态性、同步、音色等方面的退化,具有很高的工程复用价值。

🚨 局限与问题

论文明确承认的局限:

  1. 计算开销: MLLM-as-a-Judge协议导致大规模、实时评估的成本较高。
  2. MLLM偏见: 评测受限于底层MLLM的内在偏见,且依赖Gemini闭源变体,可能受厂商更新、版本漂移影响。
  3. 覆盖面: 当前prompt规模(500条)虽多样,但可能未完全捕捉极端长尾的物理交互或小众艺术概念。
  4. 长视频: 未来需扩展到10秒以上长视频。

审稿人发现的潜在问题:

  1. 音频评测过于依赖MLLM: 客观声学指标(AA中的PQ/CU、NISQA)提供的是低保真度参考,而主观音频评测完全交由MLLM。鉴于Gemini-2.5-Pro在音频真实感上的人类一致性很差(L1=1.420),且Qwen3-Omni在IF Audio上完全失效,当前框架的音频评测结论可靠性不足。如果MLLM不能很好地“听”懂声音,那么所有围绕“音频指令遵循”和“音频真实感”的诊断都存在系统性偏差。论文虽将此作为发现,但并未提出任何缓解策略,使得框架在音频维度上的权威性大打折扣。
  2. Prompt构建的分布偏差: 论文通过LLM重写显著拉长了prompt并注入约束,这使得基准更偏向测试模型遵循“密集、长指令”的能力,可能低估在典型用户使用的短prompt下的实际表现。生成的QA checklist也可能继承了LLM对任务的理解偏差。
  3. 基线比较的公平性: 为Ovi-1.1和级联系统使用Gemini-2.5-Pro重述prompt以适配其输入,虽然动机是好的,但引入了一个混杂变量:这些模型得到的是“二次优化”后的输入,而端到端模型直接使用原始重写prompt。两者输入的信息量和指令明晰度可能不处同一起跑线,影响了对比的公平性。
  4. 主观评测的覆盖度与深度: 人类评估仅基于50个样本的Consistency50子集,这对于得出“MLLM Judge接近人类水平”的结论来说样本量偏小。此外,人类评估仅提供了量化分数和排名,并未对MLLM推理过程的质量(如合理性、忠实度)进行定性分析,使得对Judge可靠性的理解停留在表面。

← 返回 ICML 2026 论文速递