DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation
📄 DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation #基准测试 #大语言模型 🔥 9.8/10 | 前25% | #基准测试 | #大语言模型 | arxiv 学术质量 6.4/7 | 影响力 1.7/2 | 可复现性 1.7/2 | 置信度 高 👥 作者与机构 第一作者:Jiamin Chen 机构:ByteDance Inc., City University of Hong Kong 通讯作者:Wangchunshu Zhou (chunshu@bytedance.com) arXiv ID: 2605.30090 💡 毒舌点评 这篇论文精准地戳中了当前长视频生成评估的痛点——大家都在卷单帧质量或短片,但长视频真正的败笔往往在镜头间的“缝合”和“转场”,以及千人千面的用户偏好被粗暴地平均化。DirectorBench 提供了一个系统、可诊断且个性化的评估框架,这比给出一个单一的、看起来很漂亮但毫无解释力的总分要有用得多。作者的实验设计逻辑清晰,三个RQ层层递进,得出了关于工作流设计比模型选择更重要、瓶颈在“单元间”等具有指导意义的结论。然而,该基准自身的可靠性验证(评估者间一致性、工具准确性)尚未充分展示,且个性化评估的深度(如何影响瓶颈识别)还有挖掘空间。总的来说,这是一个扎实且及时的工作,为长视频生成的迭代改进提供了关键的诊断工具。 📌 核心摘要 本文提出了DirectorBench,一个用于诊断长视频生成的个性化多智能体评估基准。该基准旨在克服现有评估方法聚焦短片视觉质量、忽略工作流故障诊断和用户偏好差异的局限。核心设计是将评估形式化为 \(f(\mathbf{m}, \mathbf{u}, \mathcal{G}) \rightarrow \mathcal{R}\),即根据结构化元数据(\(\mathbf{m}\))和用户配置(\(\mathbf{u}\))来评估生成系统(\(\mathcal{G}\))并产出诊断报告(\(\mathcal{R}\))。Benchmark由80个结构化元数据条目、7个用户配置文件和40个检查点标准构成,涵盖脚本、视觉、音频、跨模态和稳定性五大维度。其核心创新在于:1) 诊断式评估:通过动态激活适用的检查点,定位具体的失败瓶颈(如镜头间过渡质量差),而非仅输出聚合分数;2) 个性化评估:引入用户配置文件,表明同一生成内容在不同用户偏好下质量评分存在显著差异,单一通用分数无法捕捉这种变化。通过对4种工作流、6个基础LLM和7个用户配置的实验,发现:工作流架构是生成质量的主要决定因素;当前各工作流的共同瓶颈在于单元间的过渡和跨模态一致性,而非单帧质量;基础LLM的选择主要影响叙事推理和跨模态对齐;个性化评估揭示了显著的用户依赖型质量差异。人工评估验证了DirectorBench在维度层面与人类判断的对齐。 🔗 开源详情 代码:https://github.com/jiaminchen-1031/DirectorBench 模型权重:未提供(评估使用的基座大语言模型均为闭源模型,如GPT-5.4等)。 数据集:https://huggingface.co/datasets/Jiamin1031/DirectorBench Demo:未提及 复现材料:论文提供了详细的复现材料,包括: 元数据条目:80个结构化元数据条目(完整示例见附录A)。 用户配置文件:7个详细的用户配置文件规范(见附录B,包含优先级权重、硬约束和用户品味描述)。 检查点分类法:40个检查点的完整分类注册表(见附录C,组织为维度、子指标、检查点)。 内容分析属性:用于动态检查点激活的18个内容分析属性列表(见附录D)。 评估流水线:基于LangGraph的多智能体评估流水线的详细描述(DAG结构、四个阶段)。 论文中引用的开源项目(未提供具体GitHub链接): ViMax:一个开源的“分解-拼接”视频生成流水线。 MovieAgent:一个开源的角色感知视频生成规划器。 PySceneDetect:用于镜头分割。 OpenCV:用于视频处理和边界度量计算。 Librosa:用于音频特征提取。 MobileViCLIP-Small:用于文本-视频相似度计算。 Sentence-BERT:用于文本-音频语义相似度计算。 LangGraph:用于构建评估流水线的有向无环图(DAG)。 ffprobe/ffmpeg:用于视频探测和音频提取。 🏗️ 方法概述和架构 DirectorBench的评估框架(如图1所示)是一个分层、多阶段的系统,其核心是将“生成-评估”循环形式化。框架的核心组件和流程如下: ...