📄 MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
标签:#音视频生成 #模型评估 #基准测试 #数据集 #音频理解
6.3/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5
✅ 6.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音视频生成 | #模型评估 | #基准测试 #数据集 | arxiv
👥 作者与机构
- 第一作者:Xiaohan Zhang(标注为 1,2,但具体机构1和2未在提供的文本中明确说明)
- 通讯作者:Yang Shi(标注为 6,2*)和 Huaxiong Li(标注为 1*)
- 作者列表:Xiaohan Zhang,Yuqing Wen,Junlin Chen,Yuqi Tang,Yiting He,Lizhuo Shao,Weiming Zhu,Tengfei Liu,Yang Shi,Jialu Chen,Yuanxing Zhang,Huaxiong Li
- 机构信息:论文中作者上标的数字未在提供的文本部分附上对应的机构名称,因此无法确认各作者的具体所属机构。
💡 毒舌点评
论文敏锐地抓住了“多参考音视频生成”这一新兴且复杂的评估盲区,其“资产包-面板”组合的数据构建流水线和“再判断增强的MLLM评估框架”设计精巧,确实为系统化诊断模型在参考理解、绑定与组合上的失败模式提供了有价值的工具。然而,核心的“基准”资产——数据集、评估代码和详细的提示词模板——在论文中完全未承诺开源,使得这项工作的核心贡献沦为一个难以验证和复用的“黑箱评估报告”。一篇以“基准”为名的论文却不公开基准资源,其学术影响力和社区贡献将大打折扣,颇有“王婆卖瓜,自卖自夸”之嫌。
📌 核心摘要
- 要解决的问题:现有音视频生成基准主要针对文本驱动、单参考或音视频对齐,缺乏对需要模型同时理解、绑定和组合多个参考(如多个视角的人物、物体、场景)并生成同步音视频内容的新兴任务(MR2AV)的评估能力。
- 方法核心:提出了一个名为MultiRef-Compass的统一基准。它包含一个通过“资产包”组合构建350个样本的可扩展数据构建流水线,以及一个集成自动指标和“再判断增强的MLLM-as-a-Judge”的混合评估框架,从基本质量、参考一致性、音视频一致性和指令遵循四个维度(含14个子指标)进行细粒度评估。
- 新在何处:首次系统性定义并评估了多参考音视频生成(MR2AV)任务;设计了覆盖多视角、多实体绑定、人-物-场景组合的资产组合流程;提出了结合自动指标和LLM判断、并引入“再判断”阶段以提高评估一致性的混合框架。
- 主要实验结果:在8个代表性MR2AV系统(6个闭源,2个开源)上进行了实验。结果表明,现有系统在多个维度上仍有巨大提升空间。例如,在自动指标中,Kling 3.0在实体保真度(EF)上得分最高(0.6160);在MLLM指标中,Seedance 2.0在绑定正确性(BC,4.6360)和细节保持(DP,4.8500)上表现最佳。开源模型整体表现落后于闭源模型。评估框架与人类偏好在四个维度上的皮尔逊相关系数均超过0.89。
- 实际意义:为MR2AV这一新兴而复杂的任务提供了首个全面的评估工具和诊断框架,有助于推动该方向的研究,定位模型短板。
- 主要局限性:基准样本量(350)有限;为公平比较,将所有模型输入标准化为三张参考图,可能无法评估更复杂的参考场景;自动评估工具(如人脸检测、唇音同步)对卡通风格或大幅姿态变化的样本存在局限;MLLM评估存在成本高和潜在偏差问题。
🔗 开源详情
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及模型权重链接(论文中评估的模型包括 Seedance 2.0、Kling 3.0、HappyHouse 1.1、Gemini-Omni、Wan 2.7、Vidu Q3-Mix 等闭源模型,以及 SkyReels-V3、Wan2.1-VACE 等开源模型,但未提供这些模型的权重下载地址)
- 数据集:论文中未提及数据集公开链接(论文构建了包含350个样本的MultiRef-Compass基准测试,但未说明是否公开发布及获取方式)
- Demo:论文中未提及在线演示链接
- 复现材料:论文中未提及具体的训练配置、检查点等复现材料下载链接。论文描述了数据构建流程(如使用Pexels、Fesund等来源的资产包)和评估框架的细节(如评估提示、指标计算),但未提供可下载的复现材料包。
- 论文中引用的开源项目:论文在评估框架中引用了以下第三方开源项目/工具,但未提供它们的直接链接:
- YOLO-World:用于检测人物和物体区域。
- SigLIP:用于计算图像嵌入相似度。
- InsightFace 和 ElasticFace R100:用于人脸检测和嵌入提取。
- DINOv2:用于卡通人物头部相似度计算。
- DOVER++:用于评估视频技术质量。
- Audiobox:用于评估音频技术质量。
- LatentSync:用于语音-唇动同步评估。
- SpeechBrain ECAPA-TDNN:用于计算说话人嵌入和音色相似度。
- Gemini 3.1 Pro:用作MLLM评估的评判模型。
🏗️ 方法概述和架构
本文提出MultiRef-Compass,一个用于评估多参考到音视频生成(MR2AV)的基准框架。其核心是一个分阶段构建的评估数据集和一套混合评估协议。
下图展示了MultiRef-Compass的整体框架,它涵盖了多参考输入、生成过程以及四个核心评估维度。

图中清晰勾勒出基准如何从多参考条件生成音视频,并通过自动与MLLM结合的评估体系,从基本质量、参考一致性、音视频一致性和指令遵循进行诊断。
1. 数据集构建流程: 该流程分为三个阶段,旨在系统化地构建覆盖不同参考组合难度的测试样本。
- 阶段一:资产包构建。构建可复用的“资产包”,包括主体包(多视角的人物/角色)、物体包、场景包、音频包(不同音色)和视频包。所有资产均来自免版权库(如Pexels, Freesound)或通过AIGC工具生成,并经过人工验证身份一致性和视觉质量。
- 阶段二:基于面板(Board)的资产组合。根据预设规则将资产包组合成测试样本。主基准包含三个面板:B1(同一主体多视角,测试身份保持)、B2(主体+物体/场景的异构组合)、B3(来自不同包的多实体绑定)。扩展面板B4加入音视频参考输入。这种设计系统性地控制了参考组合的复杂度。
- 阶段三:结构化提示词生成。使用GPT-5.5根据资产组合和难度等级,生成结构化的多模态提示词(涵盖视觉、音频、语音要求),并由人工审核其合理性。每条样本均附带元数据,记录参考配置等信息。
为系统构建评估数据集,我们设计了一个基于资产包的可扩展流程。

下图详细展示了数据构建流水线:从资产包(如主体、物体、场景)的构建与组合,到结构化面板的生成,再到提示词的人工审核,最终形成评估样本。
2. 评估框架架构: 评估框架采用“混合法官”设计,结合客观指标与主观(MLLM)判断。
- 整体流程:对于每个生成的音视频样本,框架根据其元数据“路由”激活适用的评估指标。自动工具和MLLM分别对适用的维度打分。
- 四大评估维度及核心组件:
- 基本质量(BQ):包含视觉技术质量(VTQ, 使用DOVER++)、音频技术质量(ATQ, 使用Audiobox)和解剖质量(AQ, MLLM检查列表评估身体/物体/场景的物理合理性)。
- 参考一致性(RC):这是评估MR2AV的核心维度。包含实体保真度(EF), 它创新性地结合了自动相似度计算(使用SigLIP/InsightFace等)和MLLM估计的“粘贴自然度系数”(Ppaste)来校正生硬的“复制粘贴”得分;细节保持(DP, MLLM检查列表评估细粒度视觉细节);绑定正确性(BC, MLLM检查列表评估身份、属性、动作是否绑定到正确实体)。
- 音视频一致性(AVC):评估音画同步与匹配。包含语音-唇形同步(SLS, 先用MLLM筛选稳定正脸视频,再用LatentSync计算);事件-声音匹配(ESM, MLLM判断);声源正确性(SC, MLLM判断);音色相似度(TS, 使用ECAPA-TDNN计算说话人嵌入相似度,仅用于B4)。
- 指令遵循(IF):评估对提示词要求的完成度。包含视觉任务遵循(VT)、音频任务遵循(AT)、语音内容准确性(SCA)和时序顺序遵循(TO), 均由MLLM基于检查列表评分。
- 关键设计:再判断(Rejudging)阶段:为解决MLLM初始评估可能出现的尺度不一致问题(过于严格或宽松),在所有模型评估完成后,引入一个“再判断”阶段。该阶段会横向比较同一评估项在不同模型输出上的初始评分和理由,当发现不一致时,会重新检查视频证据,仅修正明确的评分不一致,而不改变评估维度或引入新标准。这提高了评估的可靠性和可审计性。
3. 组件间交互与设计动机: 数据流清晰:输入(多参考+提示词)→ 模型生成 → 评估框架根据元数据路由到对应指标 → 自动工具与MLLM并行评估 → 再判断阶段校准 → 输出多维诊断分数。选择这种架构是为了兼顾评估的覆盖面(多维)、可解释性(细粒度指标)和可靠性(混合判断与再判断)。“资产包”设计旨在提高基准构建的可扩展性和可复现性。使用多种专用工具(人脸检测、物体检测、嵌入模型)与通用MLLM相结合,是为了在可能的地方提供客观证据,同时用MLLM处理更复杂的语义判断。
💡 核心创新点
- 定义了多参考音视频生成(MR2AV)评估任务与基准:首次系统性地将“理解、绑定并组合多个参考”作为音视频生成评估的核心挑战,填补了现有基准在多参考条件评估上的空白。
- 可扩展的资产组合流水线:提出基于“资产包”(主体、物体、场景、音视频)和“面板”规则的数据构建方法。该方法使得测试样本的构建是可控、可复现且可扩展的,能够系统性地覆盖从多视角保持到多实体绑定的不同难度场景。
- 再判断增强的混合评估框架:设计了结合自动指标(用于可量化部分)和MLLM-as-a-Judge(用于语义判断)的评估协议。创新性地引入“再判断”阶段,通过横向对比校准不同样本间的MLLM评分尺度,提高了评估的一致性和可靠性。
- 四维度细粒度诊断体系:提出基本质量、参考一致性、音视频一致性、指令遵循四个评估维度,并细分为14个子指标。特别是“参考一致性”维度,通过自动保真度与MLLM评估(粘贴自然度、绑定正确性)相结合,能更全面地诊断模型在参考利用上的成功与失败模式。
- 可扩展的元数据驱动评估路由:每条测试样本附带元数据,评估框架据此自动激活适用的指标(如唇音同步仅对包含对话的样本启用),使评估框架能灵活适配不同参考配置和任务要求。
📊 实验结果
论文在8个代表性MR2AV系统(6闭源,2开源)上评估了主基准(300个样本,B1-B3)的结果,并在附录中报告了挑战基准(50个样本,B4)的结果。关键实验结果汇总如下:
实验结果在8个代表性系统上进行,整体性能可视化如下。

图中雷达图显示了闭源与开源模型在四个维度上的排名,其中Seedance 2.0在多个维度表现优异,开源模型则相对落后。
表2:自动指标结果(主基准)
| 模型 | 基本质量 VTQ | 音频质量 ATQ | 实体保真度 EF | 唇音同步 SLS |
|---|---|---|---|---|
| Seedance 2.0* | 0.2225 | 7.4562 | 0.6104 | 3.1727 |
| Kling 3.0 | 0.1869 | 7.3333 | 0.6160 | 2.8560 |
| HappyHouse 1.1 | 0.1953 | 7.7729 | 0.5952 | 3.0951 |
| Gemini-Omni* | 0.2373 | 7.3126 | 0.5967 | 4.5333 |
| Wan 2.7 | 0.1846 | 7.2296 | 0.5656 | 2.7732 |
| Vidu Q3-Mix | 0.2041 | 7.1909 | 0.5763 | 3.1603 |
| SkyReels-V3 | 0.2062 | – | 0.5720 | – |
| Wan2.1-VACE | 0.1633 | – | 0.5204 | – |
| 注:Seedance 2.0和Gemini-Omni*因安全过滤,分别评估了282和245个样本。 |
表3:MLLM指标结果(主基准)
| 模型 | 解剖质量 AQ | 细节保持 DP | 绑定正确性 BC | 事件-声匹配 ESM | 声源正确 SC | 视觉指令 VT | 音频指令 AT | 语音内容 SCA | 时序指令 TO |
|---|---|---|---|---|---|---|---|---|---|
| Seedance 2.0* | 3.9452 | 4.8500 | 4.6360 | 4.8528 | 4.8492 | 4.7054 | 4.6377 | 4.7850 | 4.7123 |
| Kling 3.0 | 3.8994 | 4.8000 | 4.5180 | 4.8421 | 4.8792 | 4.4508 | 4.7101 | 4.8630 | 4.6919 |
| HappyHouse 1.1 | 3.4909 | 4.8500 | 4.5740 | 4.8181 | 4.9441 | 4.6954 | 4.1932 | 4.8537 | 4.7033 |
| Gemini-Omni* | 3.9100 | 4.4370 | 4.6290 | 4.8079 | 4.8933 | 4.6865 | 4.6114 | 4.7233 | 4.7481 |
| Wan 2.7 | 3.7869 | 4.7970 | 4.5110 | 4.7458 | 4.8699 | 4.5319 | 4.3816 | 4.4100 | 4.7611 |
| Vidu Q3-Mix | 3.3038 | 4.3630 | 4.3570 | 4.7461 | 4.8308 | 4.2875 | 4.5894 | 4.2830 | 4.2670 |
| SkyReels-V3 | 3.3761 | 4.0200 | 4.2410 | – | – | 3.6126 | – | – | 3.0944 |
| Wan2.1-VACE | 3.0923 | 3.4790 | 3.8582 | – | – | 3.5198 | – | – | 3.0925 |
其他关键结果:
- 整体排名:闭源模型中,Seedance 2.0综合排名第一,Gemini-Omni第二,Kling 3.0和HappyHouse 1.1紧随其后。开源模型(SkyReels-V3, Wan2.1-VACE)在各项维度上均显著落后于闭源模型。
- 再判断效果:案例分析显示,再判断阶段能有效校准MLLM过于严格或宽松的初始判断,提高评分一致性。
- 人类对齐:评估框架与人类偏好的皮尔逊相关系数在BQ、RC、AVC、IF四个维度上分别为0.8979、0.9380、0.9217、0.9644,表明其能较好反映人类判断。
- 细分发现:在指令遵循中,各模型优势不同(如Seedance视觉任务强,Kling音频/语音任务强)。参考一致性随参考组合复杂度增加而下降。当前模型在保持动态面部一致性、满足精细动作和着装要求方面普遍存在困难。
评估框架通过具体案例揭示了模型的失败模式,例如SkyReels-V3的典型问题。

下图展示了SkyReels-V3的copy-and-paste伪影案例,以及通过粘贴自然度系数Ppaste校正后排名变化,突出了评估框架的诊断能力。
🔬 细节详述
- 训练数据:本文是基准构建论文,不涉及模型训练。评估数据集为自建的MultiRef-Compass,包含350个样本(300主基准+50挑战基准)。数据来源为Pexels、Fesound等免版权库以及AIGC生成。
- 损失函数:不适用。
- 训练策略:不适用。被评估模型为已训练好的第三方系统。
- 关键超参数:不适用。评估框架中使用的工具模型(如DOVER++, Audiobox, YOLO-World, SigLIP, InsightFace, LatentSync, SpeechBrain ECAPA-TDNN)均为预训练模型。
- 训练硬件:评估在8块NVIDIA A800 GPU上进行。
- 推理细节:被评估的闭源模型通过API或平台调用,生成10秒1080p视频(平台允许时)。开源模型遵循官方推荐的推理配置。
- 评估细节:MLLM评估使用Gemini 3.1 Pro作为“法官”。所有MLLM分数采用1-5 MOS尺度。EF计算中结合了自动嵌入相似度、长时一致性(LTC)系数和粘贴自然度系数(Ppaste)。SLS评估前使用MLLM过滤出稳定正脸视频。
⚖️ 评分理由
创新性 (1.2/2):首次系统定义多参考音视频生成(MR2AV)任务,设计了基于资产包的可扩展数据构建流水线和再判断增强的混合评估框架,填补了现有基准在多参考组合评估上的空白。
技术严谨性 (1.1/1.5):评估协议设计合理,结合自动指标与MLLM,并引入再判断阶段提高一致性;但样本量有限(350)和MLLM评估潜在偏差可能影响严谨性。
实验充分性 (1.0/1.5):在8个代表性系统上实验并报告人类对齐相关系数;但样本规模小,且对开源模型评估条件不公(未评估音频指标),降低了充分性。
清晰度 (0.9/1):论文结构清晰,方法、结果和附录描述详细;但MLLM评估流程和指标细节较复杂,可能增加读者理解负担。
影响力 (0.8/1.5):为音视频生成领域提供了首个全面评估工具,有助于推动MR2AV研究;但对纯音频或语音领域直接贡献有限,影响力主要在视频生成。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.2/0.5):论文描述了数据构建和评估方法细节,但核心资源如资产包、评估提示词模板未公开,关键配置缺失,影响完整复现。
工程/实践价值 (1.1/1.5):提供了可扩展的资产组合流水线和元数据驱动的评估路由设计,具有实际应用价值,有助于模型诊断和改进。
🚨 局限与问题
1. 论文明确承认的局限:
- 基准作为控制性诊断工具,未覆盖所有创意领域、文化风格或参考模态。
- 为公平比较,将输入标准化为三张参考图像,无法评估更大规模的参考集。
- 自动评估工具存在局限,特别是对卡通主题和大幅姿态/表情变化的人脸。
- 语音-唇形同步(SLS)指标对稳定正脸视频有偏好,可能对生成动态面部的模型不公。
- MLLM评估存在成本高和潜在模型偏差问题。
2. 审稿人发现的潜在问题:
- 样本规模与代表性:350个样本对于全面评估一个复杂多变的生成任务而言规模偏小,其结论的统计显著性和对长尾情况的覆盖度存疑。
- 核心资源未公开:这是最关键的学术诚信和实用价值问题。一个不公开数据集和评估代码的“基准”,其可验证性和可复用性大打折扣,与开源研究精神相悖。
- 评估偏差风险:尽管引入了再判断,但整个MLLM评估体系基于Gemini 3.1 Pro,可能存在系统性的模型偏好。评估提示词虽经设计,但其对不同模型输出的解读可能存在隐性偏差。
- 指标耦合性:部分指标(如EF与DP, ESM与SC)可能存在概念重叠,影响评估的独立性。
- 对开源模型的评估条件:论文指出开源模型未评估音频指标,且推理配置遵循官方建议。这可能导致与闭源模型在非公平条件下比较,影响结论的普适性。
- 领域相关性:论文评估的MR2AV任务主要关注视觉和音视频同步,其核心评估指标(如EF, DP, BC)多聚焦于视觉一致性,对纯音频生成或语音合成任务的评估能力较弱,对语音/音乐/音频领域的研究者借鉴意义有限。