英文题目:VABench: A Comprehensive Benchmark for Audio-Video Generation
会议身份:
conference:cvpr:2026:conference-paper-id:Hua_VABench_A_Comprehensive_Benchmark_for_Audio-Video_Generation_CVPR_2026_paper
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#基准测试 #基准设计 #音视频 #空间音频信号 #音视频生成
评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Daili Hua:机构信息未能从会议 PDF 纯文本可靠映射
- Xizhi Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Bohan Zeng:机构信息未能从会议 PDF 纯文本可靠映射
- Xinyi Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Junbo Niu:机构信息未能从会议 PDF 纯文本可靠映射
- Xinlong Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Quanqing Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Wentao Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该基准面向文本到音视频与图像到音视频生成,输入为文本提示或静态图像加文本描述,输出为带同步音频的视频与立体声音轨,难点在于跨模态语义一致、毫秒级音画同步、物理合理性与情感表达的联合建模。数据构建先由专家模板与大语言模型批量生成778条文本到音视频提示与521条图像到音视频图文描述,以覆盖七类声音场景与空间声线索。随后将上述提示拆分为视觉与听觉子提示并构造视听问答对,使文本条件进入可验证的细粒度评测环节。最后经人工核验可观测性与常识约束并剔除不可判样本,其中虚拟世界类仅保留在文本到音视频任务中。评测链先用专家模型量化单模态质量与文本-视频、文本-音频、音频-视频对齐及失同步偏移,再用多模态大语言模型进行1至5分宏观打分与问答准确率评估,并对立体声做九维声像与信号完整性分析。与已有视频到音频评测相比,关键差异是从依赖真实参考的比对转向无参考三角一致性评估,并新增物理与情感耦合维度,因而更适用于开放生成的可扩展自动评估。在T2AV基准任务下,Veo3的文本-音频对齐分数为0.3582,高于Sora2的文本-音频对齐分数0.3465。结论适用边界仅限所测端到端音视频系统与视频加音频组合及七类场景,长时程、多说话人强混响或非现实物理外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要解决什么评测缺口?
这篇解读的输入是会议论文的原文证据与本次收到的官方原图像素,目标是让刚进入语音音乐音频领域的研究生能核对并复述方法。必须保留的信息包括 3 类任务的定义、7 类内容划分、15 维评估的构成、数据构造流程、实验调用条件与主要报告结论,输出是 1 篇按学习依赖展开的中文技术解读。本文只讲论文实际研究的同步音视频生成评测,不扩展到纯视频或纯音频生成方法。
已有视频生成评测在画面质量与时间一致性上比较成熟,但当模型同时输出声音时,原有体系卡不住新的耦合现象。论文指出,多普勒效应带来的音高与响度变化、人物情绪在声音与表情上的协同表达、背景音乐与视觉节奏的配合,以及立体声的空间声学属性,都在已有基准中被忽略。更直接的困难是,文本到音视频生成没有真实音视频真值可对照,不能沿用视频转音频那种基于参考的评测,需要对文字、视频、音频三者做无参考的三角一致性检验。
为此作者提出综合基准框架,覆盖文本到音视频与图像到音视频两类主流任务,并单列立体声音视频生成。测试内容按人类听觉感知组织成七大类,评估按专家模型与多模态大模型双轨组织成 15 个细粒度维度。理解这套安排时,先把样本走完输入到表示到组件到目标到输出,再看每个指标的计算目标与实现,才不容易把不同指标的数值混为一谈。
已有路线在同输入同目标下差在哪里?
视频生成一侧近年由扩散模型与变换器结构共同推进,从早期模型到支持长时与高一致性的模型,再到引入人类反馈强化学习的模型,评测也从单指标转向多维框架。原文对照的视频评测代表是覆盖帧质量、时间一致与物理合理性的体系,这类体系与本文是同运行阶段但不同目标,前者只看画面,后者要求声画联合,因此不能把画面分数直接当成声画分数。
音频视觉生成一侧出现了追求声画时间同步的统一模型,也有靠外挂视频转音频模块实现合成的路线。视频转音频模型通过联合视频文本条件改善语义可控与事件对齐,或用多模态大模型推理改善理解与保真,但在复杂场景的长期一致性上仍困难。与本文同输入同目标的已有联合基准在维度和场景上受限,尤其缺乏对物理与情感等高阶耦合的定量刻画,且多依赖人工打分,难以扩展。
本文与上述工作的对照是有源的:同输入是文字或图像条件,同目标是同步音视频,同监督是无参考下的三角一致,同运行阶段是生成后的自动评估。类别差异不能当成同条件胜负,例如把视频转音频的参考基评测分数与文本到音视频的无参考分数直接比较是没有意义的。
要测的三类任务各自卡住什么?
第一类是文本到音视频生成,把文字语义翻译成连贯的音视序列。白话说就是看文字描述,模型要同时编出画面运动与声音,难点是运动保真与跨模态语义对齐都要成立。第二类是图像到音视频生成,从静态图像推断运动与同步音频。白话说就是给定一张图,模型要让图中对象动起来并配上合理的声音,难点是动作可信、时间连贯与音视对齐。第 3 类是立体声生成,把文字转成带有明确空间线索的双通道音频,难点是正确理解左右声道提示并实现声道分离,评测用 116 条指定左右不同声音的提示。
文本到音视频生成 × 图像到音视频生成: 文本到音视频生成负责把文字语义翻译成连贯的画面运动与同步声音,考验跨模态语义对齐,图像到音视频生成负责从静态图像推断合理动作与同步声音,考验动作可信与时间连贯,二者搭配是因为前者测开放语义创造,后者测视觉约束下的补全,组合后才能区分模型是靠文字想象还是靠画面约束维持声画一致。
内容侧按 7 类组织:动物、人类声音、音乐、环境声、同步物理声、复杂场景、虚拟世界。其中人类声音再分有语义的语言声与无语义的生理动作声,音乐看旋律节奏音色与视觉情绪的配合,环境声覆盖自然城市室内,同步物理声要求材质与运动动力学的严格对应,复杂场景覆盖复杂声景、主观感受、世界知识、象征关联与不可见声源,虚拟世界超越物理规律但要求内部逻辑自洽,且只出现在文本到音视频任务中。这种划分的用意是把感知一致推向物理逻辑与情感语境的理解。
框架全景:任务内容与评估管线如何串起来?
先沿一个样本走完全程有助于建立全景。以音乐类为例,输入条件是一段描述电吉他干净明亮放克节奏的文字,模型生成一段包含吉他演奏画面与波形的视频,随后进入两条评估支路:一条是多模态大模型问答,提问音色是否为干净明亮并给出判断,另一条是人工评价,用自然语言描述听感。左侧是任务与内容分类,中间是生成,右侧是评估,这就是全景的主路径。
下段是图前导读,请按从左到右的顺序读图,先确认任务框与评测语境框的包含关系,再看输入条件箭头如何进入生成框,最后比较右侧两类评价的提问方式有何不同。
看图路径: 1. 先从左侧任务框确认三类任务名称再向右看评测流程;2. 再看中间输入条件如何指向视频生成框;3. 最后比较右侧模型推理问答与人工评价问答的表述差异
论文图 1。原论文 Figure 1:“Overview of the VABench framework, illustrating its three main components: (1) The audio-video generation tasks being evaluated (T2AV, I2AV, and stereo), (2) the detailed…”。
该图显示左侧上方是三任务框,下方是评测语境框并展开音乐、复杂场景、环境、人类声音、同步物理声等分支,右侧上方是输入条件示例,中间是生成模型与生成视频示例,下方右侧是模型推理评价与人工评价示例。可见的教学要点是,评估不是单一分数,而是同一生成结果同时接受结构化问答与开放描述检验,这为后文 15 维指标提供了组织依据。原文明确该框架包含两类主流任务的评估与 15 个细粒度指标,其中一部分基于专家模型,一部分基于多模态大模型。
十五维如何分工:专家模型管什么,大模型管什么?
专家模型轨道量化感知质量、语义对齐与时间同步。单模态音频质量包括语言子类的语音清晰度与语音质量自然度,以及通用音频美学。跨模态对齐包括文字视频对齐、文字音频对齐、音视对齐,分别选用面向视频理解、音频文本与图像音频联合嵌入的模型计算相似度。时间同步包括用同步偏移预测模型估计的失同步量,以及仅用于有人脸说话检出时语言子类的唇音同步置信度。
专家模型评估 × 多模态大模型评估: 专家模型评估负责用专用模型量化可计算的感知质量与同步偏移,追求精确可重复,多模态大模型评估负责模拟人对复杂语义、艺术性与叙事表达的判断,追求整体理解,二者搭配是因为前者卡不住高层物理与情感耦合,后者单独用又不够稳定,组合形成粗粒度打分加细粒度问答的双轨。
多模态大模型轨道分粗细两层。粗粒度是 1 到 5 分的宏观打分,包括对齐、艺术性、表现力、音频真实感与视频真实感,其中虚拟世界类不计入真实感。细粒度是每样本 3 到 7 题的微观问答,分别聚焦声音物理属性与环境交互细节,以及视觉元素与物理动作细节,最终按全部问题平均正确率聚合。立体声另按空间成像质量与信号完整性兼容性组织 9 个声学指标,包括立体声宽度、成像稳定、电平稳定、包络相关、瞬态同步、低中高频相位相干与单声道兼容等,其中部分指标经逆归一化使越大越好,并用雷达图可视化。
跨模态语义对齐 × 时间同步: 跨模态语义对齐负责检验文字视频、文字音频、视频音频三者内容是否讲同一件事,时间同步负责检验声音事件与画面动作在时刻上是否对上,二者搭配是因为语义对了时刻错了仍显假,时刻对了语义错了仍显乱,组合后才能把三角一致性拆成可分别测量的维度。
空间成像质量 × 信号完整性与兼容性: 空间成像质量负责刻画立体声的声场宽度与声像清晰稳定,信号完整性与兼容性负责刻画相位相干与单声道下混后是否能量损失,二者搭配是因为声场宽但下混损失大则不实用,信号稳但声场窄则无空间感,组合后才能在 9 维雷达上暴露宽度与保真度的权衡。
下面这张表把评估轨道的数量关系整理出来,便于核对后文每个分数属于哪条轨道,避免把自动指标当成人评。表前的问题是:15 维是如何在 2 轨道间分配的,公平比较时应如何对应指标方向。表中数字的单位是维度个数,越大表示该轨道覆盖面越广,不代表分数越高越好。
| 评估轨道 | 维度总数 | 专家模型维度数 | 大模型维度数 | 轨道作用举例 |
|---|---|---|---|---|
| 专家模型加多模态大模型双轨 | 15 个维度 | 8 个维度 | 7 个维度 | 同步偏移与问答准确率分开计量 |
| 专家模型轨道 | 15 个维度中的一部分 | 8 个维度 | 0 个维度 | 文字视频与文字音频相似度 |
| 多模态大模型轨道 | 15 个维度中的一部分 | 0 个维度 | 7 个维度 | 对齐艺术性表现力与细粒度问答 |
表后需要解释主要收益与代价。双轨的好处是把可计算的同步误差与需要理解的叙事表达分开,代价是两类分数的量纲与聚合对象不同,不能直接相减或平均。例如失同步量是越小越好,问答准确率是越大越好,宏观打分是 1 到 5 分,三者差值没有可比性。未胜出项在后文结果中会看到,某些模型在同步上占优但在语义对齐上落后,这正是分轨的价值。
没有训练时,数据是如何构造出来的?
本研究没有训练新的生成模型,该节必须明确说明这一点。实际计算过程是基准数据的构造与整理:专家规划内容与类别比例,组织数据源与采集工具,再用大模型批量生成原始提示并解耦成视觉与听觉子提示,同时构造视觉问答与音频问答,最后由人工核验分类正确性、元素可观察性与物理常识约束。图像到音视频支路则是筛选并人工分类高质量图像,排除隐私风险,再由多模态大模型生成统一的音视描述并同样解耦与核验。
下段是图前导读,请按三框顺序阅读,重点看中间框两条支路的起点与终点分别是什么,右侧框的过滤与分布调整发生在数据可用的哪个阶段。
看图路径: 1. 从左到右跟踪规划到整理再到检查的三框箭头;2. 看中间框内开源图像收集与大模型生成提示的两条支路;3. 看右侧框内人工与智能体过滤和分布调整的两个动作
论文图 4。原论文 Figure 4:“Overview of the pipeline for benchmark data curation. This process is used to generate the text conditions for T2AV tasks and the image conditions for I2AV tasks.”。
该图显示左侧规划框包含专家规划内容与组织数据源,中间整理框包含收集开源图像与用大模型生成提示并分别形成图像条件与文字条件,右侧检查框包含人工与智能体过滤数据以及调整数据分布。可见的动作是,文字条件与图像条件不是 1 次写成,而是生成后再经问答构造与人工复核,目的是保证问题具有区分度且听觉推断符合常识。原文未报告生成模型的梯度路径与参数冻结情况,因此不能从模型名称推定实现细节,缺项即缺项。
测什么、与谁比、条件是否一致?
测试对象分两类。一类是端到端音视频模型,包括快速版与预览版在内的 3 个模型,另一类是分离式视频加音频组合,由 3 种纯视频生成器分别搭配两种音频模型构成。调用方式上部分经接口访问,部分本地部署,视频输出设为 720P 或最接近比例,帧率与时长沿用默认,端到端模型的 48 kHz 立体声音轨被抽取,分离式组合保留原生输出,音频模型的提示按官方长度限制改写但保持核心语义。比较时同任务同提示是公平条件,指标方向需逐个确认,失同步量越小越好,其余相似度、打分与问答准确率越大越好。
下段是图前导读,请自上而下核对 7 个类别的示例,先读每行的文字提示关注声音动词与材质词,再看右侧图像是否提供可发声对象,最后注意虚拟行只有文字而无图像。
看图路径: 1. 自上而下核对七个内容类别的排列顺序;2. 对每个类别比较左侧文字提示与右侧图像条件的对应关系;3. 注意虚拟类只有文字条件而无图像条件的版式差异
论文图 3。原论文 Figure 3:“VABench’s seven content categories, illustrated with ex- ample text prompts and representative images.”。
该图按动物、人类声音、音乐、环境、同步物理声、复杂场景、虚拟的顺序,每行给出文字提示与代表图像,例如日出鸟鸣、博主开箱解说、古典吉他琶音、海滩波浪、背包落地闷响、开罐器切割、侦探触物回忆等。可见的教学价值是,同一类别下文字提供听觉细节,图像提供视觉锚点,二者共同决定问答的考察点。
下面这张表把数据规模整理成可核对的形式。表前的问题是:在相同类别体系下 3 类任务的样本量如何分配,比较模型时聚合对象是否一致。表中样本量单位是条,类别数单位是类,数值相同不代表同一指标。
| 任务 | 样本量 | 条件形式 | 空间专项提示 | 内容类别总数 |
|---|---|---|---|---|
| 文本到音视频 | 778 条样本 | 文字提示 | 116 条空间提示中的一部分 | 7 类 |
| 图像到音视频 | 521 条样本 | 图像加描述 | 116 条空间提示中的一部分 | 6 类加虚拟除外 |
| 立体声音视频 | 116 条空间提示 | 文字空间提示 | 116 条空间提示 | 7 类语境复用 |
表后需要说明代价与边界。样本量大的文本任务覆盖虚拟世界,而图像任务因需真实图像而未覆盖该类,因此跨任务平均分不能直接比较。116 条空间提示是专项测试,只测空间线索理解,不能代表通用音质。聚合时宏观真实感排除虚拟类,唇音同步只在检出说话人脸的语言子类计算,若忽略这些条件会误读差距。
主结果显示了什么,什么没有同时成立?
文本到音视频一侧,原文报告在端到端模型中某模型在音频质量与跨模态对齐上整体较强,另一模型在真实感上占优但在音频美学与同步上落后,还有一模型在音视同步尤其唇音同步上最好但语义对齐略低,三者显示语义一致、同步与真实感难以同时达到。音频模型中一种通用音频模型总体优于另一种推理型模型,但后者在唇音同步上有优势。纯视频模型中某模型在多数视觉指标上最高,与最强音频模型组合后成为最强的分离式组合,提示更高质量的视频有助于音频生成。总体上端到端模型更占优,支持联合训练更易捕获跨模态协同的判断,但分离式仍是可行替代。
端到端音视频模型 × 分离式视频加音频模型: 端到端音视频模型负责联合生成画面与声音,追求统一语义空间内的自然协同,分离式视频加音频模型负责先由纯视频模型生成画面再由视频转音频模型配音,追求复用现有视频与音频能力,二者搭配对比是因为只有同条件比较才能判断联合训练带来的协同是真实增益还是视频质量差异,组合意义在于揭示架构路线差异。
图像到音视频一侧,端到端 3 模型的总体排序与文本任务镜像,纯视频模型中另一模型在多数指标上居首,与通用音频模型组合后在主要指标上最好。联合分析显示,图像带来的强视觉约束缩小了模型间差距,某些分离式组合甚至在对齐上超过端到端,但在文本任务中端到端优势明显。表现力差距在图像任务中收窄,细粒度语义上端到端在两任务均领先,但视觉输入使分数更均衡。
下段是图前导读,请先确认图例颜色与模型名的对应,再沿 8 个轴比较外包面积,最后聚焦宽度轴与单声道兼容轴的反向关系。
看图路径: 1. 先确认图例中三种颜色分别对应哪三个模型;2. 沿雷达八个轴比较宽度与单声道兼容轴的相对大小;3. 再看包络相关与电平稳定轴上谁的外包面积更大
论文图 7。原论文 Figure 7:“Comparative radar chart of three models: Phase Co- herence (Coh Low/Mid/High), Mono Compatibility (Mono Com- pat), Soundstage Width (Width), Transient Synchronization (Tran-…”。
该图是 3 模型的 9 维雷达,轴包括低中高频相干、单声道兼容、宽度、瞬态同步、电平稳定、包络相关与成像稳定,越大越好。可见的模式是,某一模型技术保真最好但声场最窄,另一模型声场最宽但主要来自声道间相位偏移导致定位不稳与能量损失,还有一模型在两者间较均衡且声像最稳。人工核查进一步报告三者均不能从文字提示可靠生成语义性声道分离,一种接近单声道,一种仅有响度差异,一种偶发细微交替与纵深线索,个别样本出现随视觉运动的空间源或多说话人左右分轨。
下面这张表把人工一致性验证的条件整理出来。表前的问题是:基准分数是否与人感一致,比较了谁、在什么量表与维度上如何聚合。表中人数单位是人,模型数单位是个,量表是 1 到 5 分。
| 验证对象 | 评价人数 | 对比模型数 | 量表 | 聚合方式 |
|---|---|---|---|---|
| 语义同步真实感 3 维度 | 6 人 | 3 个模型 | 1 到 5 分 | 成对胜率再算皮尔逊相关 |
| 端到端与分离式代表 | 6 人 | 3 个模型 | 1 到 5 分 | 胜记 1 平记 0.5 负记 0 |
| 基准与人工胜率 | 6 人 | 3 个模型 | 1 到 5 分 | 基准胜率对人工胜率 |
表后需要说明支持与限制。原文显示基准与人工偏好在各维度强相关,支持自动评估与人感对齐的判断,但这只是代表性子集与 3 模型的试点验证,不能推广到全部样本与全部模型。未胜出项包括在音乐与动物等弱相关音频类型上各系统尚可,但在人类声音等强同步任务上分离式组合始终弱于端到端,且复杂场景得分最低,说明多源动态交互仍是短板。
按类别拆开后,哪里缩小哪里拉大?
按 7 类拆开的细粒度问答显示,端到端中某模型总体最强并在动物类突出,另一模型最均衡,还有一模型在虚拟世界最好。分离式内部呈现视频生成器的排序,音频侧通用模型稳健而推理型在音乐上有 distinct 优势。总体是弱相关音频类型如音乐与动物较好,人类声音较差,高度同步任务上端到端一致优于分离式,甚至最好分离式组合也未超过最弱端到端,且三端到端差距小而稳定。
视觉问答趋势类似,虚拟世界最好而复杂场景最低,端到端包揽各类别前列,与分离式的最大差距出现在人类声音与虚拟世界,支持音频线索增强视觉理解与情感表达的解释,但这仍是有限解释而非因果证明。
失败条件也要点名。立体声专项中宽度与保真权衡明确,技术保真最好的声场最窄,声场最宽的定位不稳,均衡者声像最稳但仍无可靠语义分离。这意味着若只看单一宽度指标会误判空间能力,必须结合单声道兼容与相干一起读。另一边界是唇音同步只在检出说话人脸时计算,样本覆盖有限,不能把该维度推广到全部人类声音。
复述时要注意百分点与相对百分比不同,不同指标差值不能放进同一模型列下比较,自动指标不能当成人评。若原文表头与正文算法描述冲突,应明确标注冲突而不是编造聚合口径来圆。本次可核对的连续原句未给出逐格表头,因此正文未复写逐格数字,改用条件表与维度表承担可核对部分,数字细节以原文表格为准。
哪些还没测到,不能承诺什么?
首先是资源状态的唯一依据。本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码模型或数据已公开,只能说原文未提供可验证的可用链接。若后续需要复现,应先补验证链接可达性,再谈权重下载与系统可运行的区别。
其次是测量边界。原文未测量误判率、延迟、推理开销、输出帧率与实际延迟,也未报告训练资源与部署成本,因此不能承诺这些量得到改善。宏观打分用 1 到 5 分,问答用平均正确率,同步用偏移量,三者总体趋势不等于每组每步都成立。用户研究仅用 6 位评价者与 3 模型子集,相关性高不等于全集一致。
最后是适用条件。虚拟世界只在文本任务出现,真实感计算排除该类,唇音同步只在语言子类且检出人脸时计算,立体声 116 条是专项提示。若把这些条件混为同一聚合对象,会得到虚假的胜负。缺失证据不是技术错误,相关性不是因果,本文的支持止于报告与有限解释,未验证的推测需用可能或待验证表达。
要复现,先做什么,后补哪项验证?
先按原文条件重建调用。准备 3 类输入:文本提示、图像条件与 116 条空间提示,注意虚拟类只给文本任务。按原文设置视频为 720P 或最接近比例,帧率时长用默认,端到端抽取 48 kHz 立体声轨,分离式保留原生输出,音频提示按长度限制改写但保留核心语义。用原文指定的专家模型计算相似度与同步偏移,用多模态大模型按 1 到 5 分打宏观维度,按每样本 3 到 7 题做微观问答并平均。立体声按 9 个声学指标计算并注意逆归一化方向,再画雷达图。
先跑通一条音乐样本的全链路,核对输入到表示到组件到目标到输出的每一步产物是否落盘,再扩展到 7 类。关键超参数与信息条件在原文中以模型选择与默认设置为准,未报告的冻结与梯度细节不要猜。若要声称与人一致,需复刻 6 人 3 个模型 1 到 5 分的成对胜率流程,并计算与基准胜率的皮尔逊相关。
还需补的验证包括更大样本的人评、全量模型的显著性检验、不同聚合口径下的敏感性分析,以及延迟与成本的实测。只有补齐这些,才能判断端到端优势在部署条件下是否成立。
何时值得尝试这个基准?
当你的模型同时输出画面与声音,且关心声音事件是否在正确时刻出现、内容是否与文字和画面讲同一件事,就值得用这套基准。它把语义对齐、时间同步、真实感、艺术性与细粒度问答分开,能定位是时刻错了还是内容错了。对于立体声工作,它用宽度与兼容的权衡提醒你不要只追求声场宽。
值得尝试的另一情形是做分离式管线时,用它检验更强的视频生成是否带动音频质量,以及推理型音频模型是否在音乐或唇音同步上有局部优势。但要注意,当前证据显示强同步与人类声音仍是短板,复杂场景最低,立体声无可靠语义分离,因此不要承诺上线即有空间感。
收束一句话:这是一套面向同步声画的无参考多维评测组织,强项是把三角一致拆成可计算与可问答的维度,代价是量纲不一且部分维度只在子集计算,复现时先对齐条件再读差距。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
另有 3 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses




