AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
📄 AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models #多模态模型 #基准测试 #多模态模型 🔥 9.7/10 | 前25% | #多模态模型 | #基准测试 | arxiv 学术质量 6.5/7 | 影响力 1.6/2 | 可复现性 1.6/2 | 置信度 高 👥 作者与机构 作者:Jialiang Yang, Bin Xia, Ruihang Chu, Dingdong Wang, Wanke Xia, Zhun Mou, Tianyang Zhong, Yiting Zhao, Wenming Yang。 机构:清华大学、香港中文大学。 💡 毒舌点评 这篇论文旨在解决音视频生成领域一个真实存在的痛点——评估。作者们观察到现有评估方法(如VBench, VABench)的不足:要么只关注单模态,要么依赖通用的VQA模型,无法捕捉人像场景下微妙的跨模态错误。AVBench提出了一套“全自动、专有化、与人类对齐”的评估方案,其核心在于用精心设计的困难负样本对多模态大模型进行监督微调,使其成为“专业裁判”。这个思路本身是正确且有实用价值的。然而,作为审稿人,我必须指出其局限性。首先,整套方案的“全自动”高度依赖于基础模型(Qwen系列)和外部评估器(如SyncNet, DOVER++),其性能瓶颈可能转移到了这些组件上,论文对此的讨论不足。其次,虽然构建了庞大的训练集(300KK样本),但“困难负样本”的生成策略(如基于LLM的文本微扰、音视频轨道的人工偏移)在多大程度上覆盖了真实生成模型可能犯的“所有”错误,缺乏理论或更充分的实验验证。最后,论文宣称的“可微分奖励信号”潜力很吸引人,但并未提供任何在实际RLHF流程中应用的案例,更像一个远景声明。论文写作清晰,实验对比了多个主流模型,数据表格详实。但评审意见的深度可以更进一步,例如对评测器自身鲁棒性的分析(如对抗样本)、对训练集分布偏差的讨论等仍有空间。总体来说,这是一篇扎实的、解决实际问题的系统工作,但距离“终极评估框架”还有距离。 📌 核心摘要 本文介绍了AVBench,一个针对人像中心音视频生成模型的自动化评估基准。现有评估方法存在忽略细粒度人像相关性、滥用通用模型以及缺乏精确连续评分等问题。AVBench通过两个核心设计来解决:1) 提出了涵盖视觉质量、音频质量及多层跨模态一致性的十维评估指标,专门针对人像场景;2) 构建了大规模(300KK样本)且包含多样化困难负样本(如微小时移、情感错配、LLM驱动的语义突变)的训练集,通过监督微调(SFT)训练出专用的评估器。这些评估器(音视频、音频文本、视频文本)通过归一化预测概率产生连续、可微分的评分。实验表明,AVBench的自动评分与人类偏好判断高度相关(最高皮尔逊相关系数达0.9779),且在硬样本测试中能有效识别模型弱点,为评估和优化音视频生成系统提供了可靠工具。 🔗 开源详情 代码:未提供代码仓库链接。 模型权重:未提供模型权重链接。 数据集:未提供数据集直接下载链接。论文使用了OpenHumanVid数据集构建训练集,但未提供该数据集链接。 Demo:提供了项目主页链接:https://yajialiang.github.io/AVBench-site/ 复现材料:未提及训练配置文件、检查点或可复现材料包。 论文中引用的开源项目: OpenHumanVid:未提供链接,仅提及名称。 CLAP:提供了GitHub链接。 ViCLIP:提供了GitHub链接。 ImageBind:提供了GitHub链接。 Qwen3-Omni:未提供链接,仅提及名称。 Qwen-3 Max:未提供链接,仅提及名称。 Qwen2.5-Omni:提供了GitHub链接。 Qwen2-Audio:提供了GitHub链接。 Whisper-large-v3:提供了GitHub链接。 DF_Arena:提供了GitHub链接。 NISQAv2:未提供链接,仅提及名称和论文引用。 Audiobox-Aesthetics:提供了GitHub链接。 DOVER++:提供了GitHub链接。 LAION-Aesthetics:提供了GitHub链接。 SyncNet:提供了项目链接。 LatentSync:未提供链接,仅提及名称和引用。 🏗️ 方法概述和架构 AVBench的框架建立在两个并行支柱上:高质量评测集构建与专用评估器训练。 ...