📄 T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
#基准测试 #多模态模型 #音视频生成
7.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.7/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5
✅ 7.9/10 | 前25% | #音视频生成 | #多模态模型 | #基准测试 | arxiv
👥 作者与机构
- 第一作者:Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang(并列一作,均标注为南京大学)
- 通讯作者:Jiaheng Liu(南京大学)
- 其他作者:Yuanxing Zhang(快手科技 Kling Team)、Jiahao Wang(南京大学)、Jialu Chen(快手科技 Kling Team)、Miao Deng(南京大学)、Chenxi Liao(南京大学)、Yize Zhang(南京大学)、Yubin Guo(南京大学)、Zhaoxiang Zhang(中国科学院自动化研究所)
💡 毒舌点评
这篇论文在 T2AV 评估领域迈出了扎实的一步:500条高复杂度prompt配合同一框架下的双层级评估,确实暴露了SOTA模型在“音频真实感”和“长时叙述”上的系统性瓶颈,诊断价值明确。但MLLM-as-a-Judge的可靠性验证仅覆盖50个样本且音频Realism一致性较弱(L1高达1.420),若不能规模化解决judge bias,这套框架的权威性就只能停留在“参考级”而非“标准级”。
📌 核心摘要
- T2AV-Compass 旨在解决文本到音视频(T2AV)生成领域评估碎片化的问题,现有基准要么聚焦单一模态、要么缺乏对指令遵循和感知真实感的细粒度诊断。
- 方法核心是构建了包含500条高复杂度prompt的基准,并通过双层级评估框架将客观信号指标(视频/音频质量、跨模态对齐)与基于MLLM-as-a-Judge的主观诊断(指令遵循、真实感)相结合。
- 与 VABench、JavisBench 等同期基准相比,T2AV-Compass 在prompt复杂度(平均154 tokens vs. 50-68)、评价维度覆盖(增加指令遵循与真实感)以及诊断颗粒度(基于QA checklist的错误归因)上有明确区分。
- 实验评估了15个代表性T2AV系统,发现最强闭源模型Veo-3.1在总体平均分上领先,但音频真实感是所有模型的普遍瓶颈;在长时叙述(4+事件)任务上,失败率飙升至63-80%;Gemini 2.5 Pro作为judge与人类在视频指令遵循上的L1距离为1.012,但在音频真实感上高达1.420。
- 实际意义在于为T2AV模型开发者提供了首个系统化、诊断性的测试平台,尤其能精确定位视频动态性、跨模态同步、音频材质一致性等以往难以量化的失效模式。
- 主要局限包括:MLLM judge的音频评估可靠性不足、prompt套件未覆盖极端长尾场景、以及评估的计算成本较高。
🔗 开源详情
- 代码:论文声明代码已开源,代指为
NJU-LINK/T2AV-Compass。经查证,具体GitHub仓库地址为https://github.com/NJU-LINK/T2AV-Compass。 - 模型权重:未提及(本文为评估基准,未提出新模型权重)。
- 数据集:T2AV-Compass 基准数据集(500 条复杂提示),论文声明可在 HuggingFace 获取。经查证,HuggingFace地址为
https://huggingface.co/datasets/NJU-LINK/T2AV-Compass。 - Demo:未提及。
- 复现材料:论文提供了数据集构建流程、评估框架细节及所有提示模板(见附录 H、I),并报告了预处理与评估配置(如音频采样率 48kHz、视频帧率 2 FPS、MLLM 温度=0 等),但未单独提供训练配置或检查点。
- 论文中引用的开源项目:
- VBench (
https://github.com/Vchitect/VBench) - EvalCrafter (
https://github.com/EvalCrafter/EvalCrafter) - AudioCaps (
https://github.com/cdjkim/audiocaps) - AudioLDM-Eval (
https://github.com/haoheliu/AudioLDM) - JavisBench (未提供链接)
- UniAVGen (未提供链接)
- VABench (未提供链接)
- TTA-Bench (未提供链接)
- DOVER++ (
https://github.com/VQAssessment/DOVER) - Aesthetic Predictor V2.5 (
https://github.com/discus0434/aesthetic-predictor-v2-5) - CLAP (
https://github.com/LAION-AI/CLAP) - VideoCLIP-XL-V2 (未提供链接)
- ImageBind (
https://github.com/facebookresearch/ImageBind) - Synchformer (未提供链接)
- NISQA (
https://github.com/gabrielmittag/NISQA) - LatentSync (未提供链接)
- AudioLDM2 (
https://github.com/haoheliu/audioldm2) - MMAudio (
https://github.com/hkchengrex/MMAudio) - HunyuanVideo-Foley (未提供链接)
- Wan2.1 (
https://github.com/Wan-Video/Wan2.1) - CogVideoX (
https://github.com/THUDM/CogVideoX) - VidProM (
https://github.com/WangWenhao0716/VidProM) - Shot2Story (未提供链接)
- Gemini-2.5-Pro 与 Gemini-2.5-Flash 等非开源 MLLM 仅作为调用工具,不属于开源项目。
- VBench (
🏗️ 方法概述和架构
T2AV-Compass 本质上是一个系统化的基准评测框架,而非生成模型。其整体流程分为三大阶段:数据构建、客观评测、主观评测。
- 数据构建阶段 采用三流并行的prompt生成管道。
- 流一:多源数据采集与语义去重。 从 VidProM、Kling AI 社区、LMArena、Shot2Story 等源聚合原始prompt。所有prompt经
all-mpnet-base-v2编码后进行去重(余弦相似度阈值0.8),再通过平方根采样(采样概率 \(P(c) \propto 1/\sqrt{|S_c|}\))抑制高频主题,确保长尾语义场景的可见性。 - 流二:LLM重写与人类精炼。 采样后的prompt送入 Gemini-2.5-Pro 进行重写,强制注入视觉、运动、声学、电影摄影等多维约束。这使得平均prompt长度从54 tokens扩张到154 tokens,平均约束点数从约5个增加到10个。重写后的prompt再经人类筛选,剔除不合规或逻辑混乱的案例,最终保留400条。
- 流三:真实视频反演。 为平衡纯文本生成可能带来的幻觉并确保物理合理性,从YouTube精选100个4-10秒的高保真视频片段。利用 Gemini-2.5-Pro 为这些片段生成密集的时序描述,再通过人在回路验证,修正生成描述与原始画面的偏差。此流确保100条prompt锚定在真实世界动态上,为评估提供了“真实性上限”参考。
- 最终合并与QA Checklist生成。 流二和流三共构成500条prompt的最终基准套件。每条prompt随后被自动派生两类QA checklist:一类用于指令遵循(Instruction Following),通过槽位提取和维度映射将抽象指令转化为可判定的二值问题;另一类用于感知真实感(Perceptual Realism),专注检测时序连贯性、对象完整性、材质-音色一致性等内部失真。
- 客观评测层级 将系统性能解耦为三个独立支柱。
- 视频质量:视频技术分(VT) 利用 DOVER++ 量化噪声、模糊等低保真伪影;视频美学分(VA) 用 Aesthetic Predictor V2.5 评估构图、光照、色彩和谐度。
- 音频质量:音频美学分(AA) 是感知质量(PQ)和内容有用性(CU)的算术平均,即 \(AA = (PQ + CU) / 2\),其中PQ评估信号保真度和音色真实感,CU评估语义密度和可识别事件;语音质量分(SQ) 通过 NISQA 框架预测主观MOS分,捕捉传统信噪比指标忽略的细微退化。
- 跨模态对齐:分别用 CLAP、VideoCLIP-XL-V2、ImageBind 计算文本-音频(T-A)、文本-视频(T-V)、音频-视频(A-V)在共享嵌入空间中的余弦相似度;时间同步误差(DS) 通过 Synchformer 检测音视频事件起始时间的绝对偏移;在说话人脸场景额外补充 LatentSync 唇动同步指标(LS)。
- 主观评测层级 采用双轨MLLM-as-a-Judge协议,强制要求Judge先阐述推理理由再给出1-5分评分,以提升可解释性和错误归因能力。
- 指令遵循轨(IF):覆盖7个主维度和17个子维度:属性(外观和数量)、动态性(运动、交互、变换、镜头运动)、电影摄影(光照、构图、色彩分级)、美学(风格与情绪)、关系(空间与逻辑)、世界知识(事实性)、声音(音效、语音、音乐、非语音惩罚项)。最终IF-Audio分数计算公式为 \(IF\text{-}Audio = (S_{speech} - P + S_{sfx} + S_{music}) / 3\),其中 \(P = 1 - S_{nonspeech}\) 为对非必要语音的惩罚项。
- 真实感轨:从视频和音频两方面独立评估。视频真实感分解为运动平滑度(MSS)、物体完整性(OIS)、时序连贯性(TCS);音频真实感分解为声学伪影分(AAS)和材质-音色一致性(MTC)。 所有MLLM评分经5点归一化后转化为百分制报告。
💡 核心创新点
面向T2AV评估的统一 taxonomy 与高复杂度 benchmark:构建了首套针对T2AV场景的系统化评估框架,填补了以往基准仅覆盖单一模态或弱多模态的空白。500条prompt经过 LLM重写和视频反演双重质量控制,平均token长度(154)和平均约束点数远超 VABench(50 tokens)、JavisBench(65 tokens)等同期基准,能有效对SOTA模型施加压力测试。
双层级评估框架的有机结合:将客观信号指标与基于QA checklist的MLLM-as-a-Judge诊断统一到同一框架内,既能给出可量化的信号级对比,又能提供细粒度的语义错误归因(如指出声画不同步的具体声源、动态行为执行失败的具体动作),大幅提升了评估的可解释性。
系统化的“音频真实感瓶颈”与“动力学瓶颈”发现:通过大规模对比实验首次量化了当前T2AV系统普遍存在的“视频强、音频弱”的非对称能力分布,并揭示出视频指令遵循中的“Dynamics(动力学)”维度是最具挑战性和区分度的短板。结合材质-音色一致性(MTC)、声学伪影(AAS)等新指标,为后续研究指明了具体的攻关方向。
多维难度切片与边际效应分析:设计了沿视觉主体数量、事件时序结构等轴的复杂度阶梯,揭示了长时叙述(4+事件)场景下失败率的急剧攀升(达63-80%),为T2AV模型的时序组合泛化能力提供了清晰的诊断工具。
📊 实验结果
论文在500条prompt上对15个T2AV系统(7个闭源端到端、3个开源端到端、5个级联/组合式流水线)进行了全面评测。结果分为客观指标与主观指标两大类。
客观指标结果:下表为主要模型在视频质量、音频质量、跨模态对齐上的对比。封闭源模型中,Veo-3.1在视频技术分(VT 13.39)和音频-视频对齐(A-V 0.2856)上表现突出,但Seedance-1.5在音频美学(AA 7.403)和唇同步(LS 1.560)上最优。级联管道Wan-2.2+Hunyuan-Foley凭借T2V骨干获得最高VT(13.43),但时间同步误差(DS)高达0.89以上。
| 方法 | 开源 | VT↑ | VA↑ | AA↑ | SQ↑ | A-V↑ | T-A↑ | T-V↑ | DS↓ | LS↑ |
|---|---|---|---|---|---|---|---|---|---|---|
| T2AV(端到端) | ||||||||||
| Veo-3.1 | ✗ | 13.39 | 5.425 | 6.818 | 1.597 | 0.2856 | 0.2335 | 0.2438 | 0.6776 | 1.509 |
| Sora-2 | ✗ | 7.568 | 4.112 | 5.584 | 1.485 | 0.2419 | 0.2484 | 0.2432 | 0.8100 | 1.331 |
| Kling-2.6 | ✗ | 11.41 | 5.417 | 6.666 | 1.783 | 0.2495 | 0.2495 | 0.2449 | 0.7852 | 1.502 |
| Wan-2.6 | ✗ | 11.87 | 4.605 | 6.440 | 1.476 | 0.2149 | 0.2572 | 0.2451 | 0.8818 | 1.081 |
| Seedance-1.5 | ✗ | 12.74 | 5.007 | 7.403 | 1.766 | 0.2875 | 0.2320 | 0.2370 | 0.8650 | 1.560 |
| LTX-2 | ✓ | 7.160 | 4.661 | 6.742 | 1.597 | 0.1851 | 0.2365 | 0.2411 | 0.8756 | 1.339 |
| Ovi-1.1 | ✓ | 9.336 | 4.368 | 6.531 | 1.592 | 0.1620 | 0.1756 | 0.2391 | 0.9624 | 1.191 |
| JavisDiT | ✓ | 6.850 | 3.575 | 4.752 | – | 0.1284 | 0.1257 | 0.2320 | 1.322 | – |
| T2V + TV2A | ||||||||||
| Wan-2.2 + Hunyuan-Foley | ✓ | 13.43 | 5.605 | 6.353 | – | 0.2575 | 0.2076 | 0.2455 | 0.7935 | – |
| Hunyuan1.5 + MMAudio | ✓ | 11.34 | 4.804 | 6.101 | – | 0.2210 | 0.2466 | 0.2436 | 0.9427 | – |
| T2A + TA2V | ||||||||||
| AudioLDM2 + MTV | ✓ | 8.066 | 3.458 | 6.253 | 1.264 | 0.1639 | 0.2698 | 0.2394 | 1.159 | 0.6835 |
主观指标结果:下表为主观评测的指令遵循与真实感评分。Veo-3.1总体平均分最高(70.29),但音频真实感仅为49.95。开源端到端模型LTX-2总体63.72,视频真实感89.95为所有模型中最高,但音频真实感仅36.23,进一步验证了视觉与听觉真实感之间的显著断层。
| 方法 | 开源 | IF Video↑ | IF Audio↑ | Video Realism↑ | Audio Realism↑ | Average↑ |
|---|---|---|---|---|---|---|
| T2AV(端到端) | ||||||
| Veo-3.1 | ✗ | 76.15 | 67.90 | 87.14 | 49.95 | 70.29 |
| Sora-2 | ✗ | 74.93 | 72.86 | 85.53 | 46.01 | 69.83 |
| Kling-2.6 | ✗ | 73.72 | 63.89 | 87.98 | 47.03 | 68.16 |
| Wan-2.6 | ✗ | 78.52 | 74.95 | 82.05 | 35.18 | 67.68 |
| Seedance-1.5 | ✗ | 60.96 | 61.22 | 88.94 | 53.84 | 66.24 |
| LTX-2 | ✓ | 63.97 | 64.74 | 89.95 | 36.23 | 63.72 |
| JavisDiT | ✓ | 32.56 | 15.26 | 34.97 | 14.85 | 24.41 |
| T2V + TV2A | ||||||
| Wan-2.2 + Hunyuan-Foley | ✓ | 64.54 | 37.10 | 89.63 | 41.25 | 58.13 |
| T2A + TA2V | ||||||
| AudioLDM2 + MTV | ✓ | 47.13 | 54.39 | 56.73 | 31.90 | 47.54 |
维度级诊断与边际效应:
- IF Video子维度分析(图6)显示,Dynamic(运动与交互)是最具挑战性维度,即使最强模型在此维度分数也显著低于属性、电影摄影等静态维度,揭示了时序连贯性瓶颈。
- IF Audio子维度分析(图7)指出Sound Effects是最大短板,而Speech/Music相对容易,说明模型在“物理音效-视觉事件”的语义接地上存在根本性困难。
- 复杂度边际分析(图9)表明,随着视觉主体数量从1增至4+,失败率从8-10%升至21-44%;随事件数量从1增至4+,失败率从22%激增至63-80%,确认长时序一致性为当前系统核心瓶颈。
MLLM-as-a-Judge可靠性验证: 在50个prompt子集上计算MLLM评分与人类评分间的L1距离,发现Gemini 2.5 Pro在Video Realism上接近人类水平(L1 0.937 vs. 人类间0.926),但在Audio Realism上显著变差(L1 1.420 vs. 人类间1.042)。Qwen3-Omni在IF Audio上出现灾难性失败(L1 1.887)。
| 评估者 | IF Video↓ | IF Audio↓ | Video Realism↓ | Audio Realism↓ | Overall↓ |
|---|---|---|---|---|---|
| Inter-Human | 0.917 | 0.911 | 0.926 | 1.042 | 0.949 |
| Gemini-2.5-Pro | 1.012 | 0.980 | 0.937 | 1.420 | 1.087 |
| Gemini-2.5-Flash | 1.212 | 1.027 | 1.397 | 1.193 | 1.207 |
| Qwen3-Omni | 1.026 | 1.887 | 1.297 | 1.680 | 1.473 |
补充验证与分析:
- 成对比较排名验证:在Arena50子集上,通过Bradley-Terry模型对人类成对比较偏好进行拟合,得出的Elo排名(Veo-3.1 > Wan-2.6 > PixVerse-V5.5 > Ovi-1.1 > JavisDiT)与Gemini 2.5 Pro的判断完全一致,验证了Judge对模型相对排序的捕捉能力。
- 健壮性分析:重复3次完整评估,Gemini 2.5 Pro的各维度变异系数(CV)均低于1.02%,表明评分高度稳定。
- 校准测试:使用100个真实世界视频作为输入,MLLM给予的指令遵循得分显著高于所有生成模型(如Relations 97.44 vs 模型最高77.81),证明了QA Checklist的区分度和判别力。
- 客观指标与人类一致性验证:音频-视频同步的客观指标与人类平均评分之间的Spearman秩相关系数(SRCC)达到0.9172。
🔬 细节详述
- 训练数据:论文为基准测试本身,不涉及模型训练数据。500条prompt来源包括VidProM、Kling AI社区、LMArena、Shot2Story以及100条经Gemini-2.5-Pro重描述并人工验证后的YouTube片段。所有prompt经
all-mpnet-base-v2去重(阈值0.8)和平方根采样。 - 损失函数:未说明(本论文不涉及模型训练)。
- 训练策略:未说明。
- 关键超参数:为MLLM judge配置了确定性解码(
do_sample=False,temperature=0),帧采样率为2 FPS。同步检测工具desync的默认offset_sec设为-2.0。 - 训练硬件:未说明(本论文不涉及模型训练)。
- 推理细节:15个被评测T2AV系统均使用其原生配置。空间分辨率多为720p(Javis 480p,Kling-2.6 1080p)。对于Ovi-1.1和级联生成系统,用Gemini-2.5-Pro对原始prompt做了解析重述以适配其特定的推理和指令遵循管道。
- 正则化或稳定训练技巧:未说明。
⚖️ 评分理由
创新性 (1.2/2):论文提出了一套高度系统化、针对T2AV的评估基准和诊断框架。其核心创新在于将双层级(客观+主观)评估与QA checklist驱动的错误归因相结合,在T2AV领域填补了明确空白。与VABench、JavisBench等同期工作相比,在prompt复杂度、维度覆盖上具有清晰区分度。但核心模块(LLM重写prompt、MLLM-as-a-Judge、标准信号指标)均非本工作首创,其贡献主要体现在整合、工程化以及对T2AV场景的深度定制上,属于扎实的系统性贡献,而非方法论上的根本性突破。
技术严谨性 (1.1/1.5):评估框架的维度定义、指标公式(如IF-Audio的惩罚项)和统计方法(L1距离、Spearman ρ、Bradley-Terry模型)描述清晰。冗余度分析也体现了对指标依赖性的审慎考量。主要失分点在于:MLLM-as-a-Judge的音频部分验证薄弱,音频真实感上的MLLM-人类一致性较差(L1 1.420),论文虽将其作为发现,但未充分讨论此偏差对整体排名(尤其是音频依赖型模型)的潜在混淆效应。此外,提示重写环节可能引入的偏差(如对特定模型风格的偏好)未做消融分析。
实验充分性 (1.2/1.5):实验规模宏大且分析维度丰富:覆盖15个系统(含端到端、级联式等多种架构);主客观指标共13项;提供了详尽的子维度对比、复杂度边际效应分析、裁判一致性验证及健壮性分析。但主观评测的人类验证局限于50个样本的Consistency50子集,且音频真实感的人类间一致性本身也偏低(L1 1.042),在该子维度上的结论稳健性存疑。未提供模型间分数差异的统计显著性检验(如t检验或bootstrap分析),难以确认小分差是否具有统计意义。
清晰度 (0.9/1):论文结构和叙述逻辑清晰,图表质量高,尤其是数据构建流程、评测示例和雷达图,能有效传达复杂信息。核心评估维度的定义和QA checklist生成逻辑明确。附录内容详实,提供了全部prompts模板。但主文中对部分技术细节(如平方根采样的具体实现、DOVER++和Aesthetic Predictor的版本与使用方式)的解释可更直接,少量关键描述依赖引用而非自包含阐述。
影响力 (1.2/1.5):T2AV生成是当前多模态AI的活跃前沿,本工作提供的系统化评估与诊断能力对领域具有明显的推动作用:不仅为模型横向比较设立了公共标准,更暴露了“音频真实感瓶颈”、“Dynamics瓶颈”和“长时叙述困难”等明确的研究靶点。来自南京大学、快手、中科院自动化所的合作,以及所覆盖的SOTA模型,也增强了其社区关注度。不过,MLLM judge的成本和稳定性问题若不能有效解决,可能限制其在工业界快速迭代中的实用性。
开源 (0.7/1.5):论文声明代码和数据可在GitHub和HuggingFace获取,核心benchmark(500 prompts)提供下载,符合数据集论文的核心开放原则。但论文中仅提供了组织名
NJU-LINK/T2AV-Compass,未给出具体的、可直接访问的URL。开源状态的最终确认依赖于外部搜索引擎(审校提示),因此给予中等偏上分数,但未达到满分。可复现性 (0.3/0.5):评估pipeline的多数步骤在附录中给出,MLLM judge的推理配置(temperature=0)也明确。但关键的可复现障碍在于:强依赖Gemini-2.5-Pro等闭源LLM作为重写器和Judge,其版本更迭可能直接导致评分分布漂移;此外,人类验证的细节、客观指标的具体调用参数未完全标准化描述,可能在不同实现下产生微小偏差。
工程/实践价值 (1.3/1.5):这是一篇典型的benchmark工程论文,其核心价值完全体现在工程实践上。T2AV-Compass建立了一套从prompt生产、质量校验到双层级自动评测的完整pipeline,组件化设计使其具备良好的可维护性和可扩展性。对于T2AV模型开发的工业界团队而言,这套框架不仅能用于模型选型,更能直接集成到日常回归测试中,快速定位动态性、同步、音色等方面的退化,具有很高的工程复用价值。
🚨 局限与问题
论文明确承认的局限:
- 计算开销: MLLM-as-a-Judge协议导致大规模、实时评估的成本较高。
- MLLM偏见: 评测受限于底层MLLM的内在偏见,且依赖Gemini闭源变体,可能受厂商更新、版本漂移影响。
- 覆盖面: 当前prompt规模(500条)虽多样,但可能未完全捕捉极端长尾的物理交互或小众艺术概念。
- 长视频: 未来需扩展到10秒以上长视频。
审稿人发现的潜在问题:
- 音频评测过于依赖MLLM: 客观声学指标(AA中的PQ/CU、NISQA)提供的是低保真度参考,而主观音频评测完全交由MLLM。鉴于Gemini-2.5-Pro在音频真实感上的人类一致性很差(L1=1.420),且Qwen3-Omni在IF Audio上完全失效,当前框架的音频评测结论可靠性不足。如果MLLM不能很好地“听”懂声音,那么所有围绕“音频指令遵循”和“音频真实感”的诊断都存在系统性偏差。论文虽将此作为发现,但并未提出任何缓解策略,使得框架在音频维度上的权威性大打折扣。
- Prompt构建的分布偏差: 论文通过LLM重写显著拉长了prompt并注入约束,这使得基准更偏向测试模型遵循“密集、长指令”的能力,可能低估在典型用户使用的短prompt下的实际表现。生成的QA checklist也可能继承了LLM对任务的理解偏差。
- 基线比较的公平性: 为Ovi-1.1和级联系统使用Gemini-2.5-Pro重述prompt以适配其输入,虽然动机是好的,但引入了一个混杂变量:这些模型得到的是“二次优化”后的输入,而端到端模型直接使用原始重写prompt。两者输入的信息量和指令明晰度可能不处同一起跑线,影响了对比的公平性。
- 主观评测的覆盖度与深度: 人类评估仅基于50个样本的Consistency50子集,这对于得出“MLLM Judge接近人类水平”的结论来说样本量偏小。此外,人类评估仅提供了量化分数和排名,并未对MLLM推理过程的质量(如合理性、忠实度)进行定性分析,使得对Judge可靠性的理解停留在表面。