英文题目:VMChill: A Dataset for Fine-Grained Visual-Musical Synergy
会议身份:
conference:aaai:2026:conference-paper-id:37331
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#数据集 #数据集构建 #音视频 #音乐 #视频到声音生成
评分:6.7/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Xiaowei Chi:机构信息未能从会议 PDF 纯文本可靠映射
- Zeyue Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Jialiang Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Wei Xue:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为预告片视频片段及其伴随音频,输出为融合视觉叙事与音乐语义的细粒度多模态长字幕,难点在于预告片剪辑节奏快、文本特效多且音乐与画面语义耦合紧密。方法链分三步:先以预告片关键词检索在野长视频并按场景切分得到平均4.6秒片段,再做运动、光学字符识别文本面积、图像质量与美学过滤及人声分离与音乐质量筛选,然后用单模态专家分别抽取首中尾帧内容、动态差异、对象背景标签与流派乐器情绪速度等音乐属性。最后由LLaMA2-13B将异构描述融合成统一长字幕,并据此划分出VMChill-20M、VMChill-Music、VMChill-2M与人工修订的VMChill-Test子集。与既有视频语言数据集仅提供视觉字幕或把音乐视为通用音频类别不同,该工作显式建模音乐体裁乐器情绪速度并与视觉内容时间对齐,使音乐成为可理解生成的语义模态。在VBench评测任务下,VideoCrafter-2.0(VMChill)指标motion smoothness为98.33,高于VideoCrafter-2.0的97.73。结论适用边界限于预告片域短片段对齐与字幕增强,尚未验证长程音乐结构保持与跨域泛化能力。视频生成实验的训练成本为使用8块Tesla-H800硬件、批量为3训练10000步。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要保留什么?
这篇解读的输入是论文正文提供的文字证据与 4 张官方原图像素,目标是让刚进入语音、音乐与音频方向的研究生能够不依赖二手评价复述出数据集做法。必须保留的信息包括数据来源与规模、切分与清洗条件、标注流水线中每个模型的输入输出、4 个子集的划分标准,以及下游实验的训练配置、评测指标方向与关键数字。
输出是一份按学习依赖展开的技术说明,先讲任务与相关路线,再讲方法全景与组件计算,然后讲构造与训练过程,最后讲实验条件、结果、局限与复现动作。需要先说明的是,论文没有声称当前可下载的数据链接,本解读也不把作者未来发布计划写成已公开事实,所有关于规模与效果的陈述都回到原文数字。
预告片在这里不是普通视频,它是经过专业剪辑的短视频,画面节奏、转场与背景音乐为叙事与情绪服务,因此作者把它当作天然具有较强视听一致性的数据源。理解这一点后,才能明白为什么后续要用场景切分保留转场边界,为什么要单独处理音乐而不是把音频当作环境音一并写进描述。
已有视频语言数据与音乐视频工作各解决了什么,还缺什么?
已有大规模视频语言数据主要解决看图说话式训练问题。论文列举的路线包括用替代文本、自动语音识别转写或自动标注模型给画面配文字,代表性工作覆盖了从早期检索数据到近年的大规模自动标注数据。这类数据的输入是视频帧,监督是面向视觉内容的文本,运行阶段集中在视频理解与文本到视频生成。它们的缺口是把音频尤其是音乐当作弱关联信息,至多提供转写或粗类别,没有时间对齐的乐器、情绪与结构标注。
另一类音频视觉集合规模虽大,但同样把音乐当作普通声音事件类别处理。音乐专用工作则走了另一条路线,例如提供和弦、流派或整轨一致性标注的数据集,以及视频到音乐生成模型。这类工作的输入包含视频与音乐配对,目标是生成与画面匹配的音乐,但论文指出它们多为整视频级标注、片段长且未切分、规模有限,不适合训练需要帧级或秒级对齐的任务。
理解模型侧也存在类似割裂,问答与音色识别模型只覆盖乐器等窄域,联合音视频模型又受粗标注限制。生成侧的文本到音乐模型能产出高质量音频但缺乏视觉条件,视频到音乐模型受数据稀缺限制且长结构保持困难。VMChill 的位置就是补上大规模、切分后、带细粒度音乐维度的视频音乐配对,使理解与生成两类任务都能在同一时间粒度上使用音乐语义。
要解决的具体问题是什么,难在哪里?
具体问题是如何低成本地获得大量时间对齐、语义丰富的画面与音乐联合标注。输入是野外收集的预告片长视频,期望输出是秒级片段及其多模态长标注,标注需要同时说清谁在什么场景做什么、镜头如何运动、音乐是什么风格与情绪。难点有 3 层。第一层是源数据复杂,预告片包含密集剪辑、字幕动画、片头片尾与对白旁白,直接切分与直接描述都会引入噪声。
第二层是模态格式差异大,画面可以用帧描述模型处理,音乐需要风格、乐器、速度与动态等多维描述,且语音会干扰音乐判断。第 3 层是融合困难,多个单模态描述的长度与粒度不同,简单拼接会断裂,单模型端到端写长标注又容易幻觉。论文因此把问题拆成收集与清洗、单模态抽取、质量过滤与语言模型融合 4 个可检查环节,每个环节都有明确的输入输出与取舍条件,而不是把跨模态一致性寄托在一个黑盒模型上。
整体流水线如何从一部预告片走到一条多模态标注?
拿一部预告片走完全程有助于建立整体感。输入是视频文件及其附带音频与平台元数据。第一步做元数据清洗与音视频同步抽取,音频按 44.1 kHz 采样率抽出,视频保留 720p 或更高分辨率。第二步按场景切分长视频,得到平均 4.6 seconds 的短片段集合,这就是最大规模的全量集合。第三步并行走两路,一路对画面做帧内容、动态差异、类别背景与文字识别描述,另一路对音频做音乐事件检测、人声分离、质量过滤与多维音乐标注。
第四步对满足运动、画质与美学条件的片段,用语言模型把多路描述融合成一条连贯长标注,形成高质量子集,再从中抽取少量片段做人工修正得到测试集。下面的示意图用一个卡通追逐例子展示了这种对齐思想,画面侧写清猫拿鸟笼奔跑与被绊倒的动作变化,音乐侧写清木管、马林巴与弦乐的配器与情绪变化,并用箭头标出速度变化与转场、旋律轮廓与动作的对应关系。
这段导读帮助初学者在看图前先抓住主线,顶部是时间轴与画面,中间是画面文字,底部是音乐文字,关键是两类文字指向同一段时间并在转场处同步变化,读图时应先看时间方向再看跨模态箭头。
看图路径: 1. 先沿顶部胶片带从左向右确认场景切换位置与对应片段;2. 再看中间黄色框的画面动态描述如何写出奔跑与绊倒的动作变化;3. 接着看底部蓝色框的三段音乐描述如何写配器与情绪变化;4. 最后看虚线箭头标注的速度变化与旋律轮廓如何与转场和动作对应
论文图 1。原论文 Figure 1:“We present VMChill, a large dataset with multimodal captions.”。
图中可见的教学要点是细粒度协同不是一句整体情绪标签。画面框明确写出从左向右奔跑、伸腿绊倒与鸟笼滚向右侧等可定位动作,音乐框分别写出低声部 creeping、速度如心跳加快与快速音阶加钹 crash 等可对应动态,中间用速度变化对齐转场、旋律轮廓映照动作来建立跨模态连接。这种写法提示复述时不能只说视听相关,而要说清哪个音乐变化对应哪个画面变化,以及标注是如何分段写出的。
画面侧与音乐侧各自抽取什么,如何计算与过滤?
画面侧的计算围绕帧与运动展开。帧描述对每个片段的首帧、中间帧与末帧分别生成简洁描述,保留关键信息。动态描述把多帧拼成连环画形式送入多模态语言模型,引导模型说出帧间动态差异,并结合文字识别与更详细的总结扩展信息。类别与背景通过问答方式单独抽取对象词与背景词,用于约束语言模型融合时的幻觉。运动质量用运动向量而不用光流,理由是预告片快速剪辑会破坏像素级连续流动假设,而块级位移更稳健且更轻量。
文字识别针对预告片常见的片头片尾与动画字幕,检测文本框面积以反映文本量,并对多帧的可靠文本做合并。画质与美学打分作为额外过滤信号。
场景切分 × 多模态标注: 场景切分负责把长预告片按相邻帧内容差异切成秒级短片段,给出时间边界和可独立描述的视觉单元,多模态标注负责在每个单元上分别抽取画面内容、运动差异与音乐属性,二者搭配的理由是只有先获得时间对齐的干净单元,后续的画面描述与音乐描述才能指向同一段时间,组合后形成可用于训练与评测的细粒度视听对。
运动向量过滤 × 光流: 运动向量过滤用编码块级位移判断片段是否存在有效运动,用于剔除静帧、字幕卡与幻灯片式播放,光流则跟踪像素级连续运动,在预告片快速剪辑下容易不稳定,二者分工不同,论文选择运动向量是因为它对快速转场更稳健且计算更轻,组合意义是在保留正常运镜与动作的同时降低低信息片段进入标注流水线的比例。
单模态描述抽取 × 大语言模型融合: 单模态描述抽取由图像描述模型、视频问答模型与音频模型分别产出帧内容、动态差异、类别背景与音乐结构化描述,大语言模型融合负责把这些来源不同、粒度不同的文本合并为一句连贯的多模态标注,前者保证各模态信息不被互相覆盖,后者解决直接让一个模型同时看听写长文本时的幻觉与断裂问题,组合后得到同时保留视觉细节与音乐语义的长标注。
音乐侧的计算围绕纯净度与多维语义展开。先用音乐事件检测模型判断哪些音频段包含音乐,原文报告超过七成音频段包含音乐。再用音源分离模型分离出音乐干声以去除对白旁白干扰,原文报告多数处理片段达到一定的人声抑制效果,纯净干声与原始音频并存以支持多模态比较。然后用音频模型从声音质量与音乐性两个维度打分,只有双维度超过阈值的片段才进入结构化标注,标注维度包括流派、乐器、情绪、速度与音乐动态。下面的音乐处理示意图展示了这一串联结构,初学者应重点看剔除分支与保留分支的分叉位置。
这段导读说明该图不是简单的模型堆叠,而是 2 级筛选加一轮详细标注。第一级把语音与音效轨道分出去,第二级把低质音乐片段分出去,只有高质量片段才进入需要填写 5 个维度的提示词,读图时要沿箭头数清每次分叉后数据的去向。
看图路径: 1. 先沿三行流程确认从原始视频到音乐轨道再到音乐片段的主路径;2. 再看中间灰色框标注的音乐事件检测与质量过滤分别剔除了哪类数据;3. 最后看底部提示语要求模型输出的五个音乐维度
论文图 6。原论文 Figure 6:“Music processing pipeline of VMChill.”。
图中从上到下依次是原始视频到原始音频再到音乐事件检测,检测后分出语音音效轨道与音乐轨道,音乐轨道切成固定时长片段后进入质量过滤,过滤后分出低质片段与高质量片段,高质量片段才进入详细标注并写入音乐子集。底部提示词明确要求描述流派、乐器、情绪、速度与音乐动态,这与正文列举的 5 个维度 1 致。复述时应强调阈值过滤发生在详细标注之前,而不是先标注再筛选。
人声分离 × 音乐质量过滤: 人声分离用音源分离手段去除对白与旁白干扰,得到更干净的音乐干声,音乐质量过滤再用音频模型从声音清晰度与音乐性两个维度打分并设阈值筛选,前者解决语音与音乐混叠导致的乐器与情绪判断失准,后者解决低质或非音乐片段进入音乐子集的问题,二者串联后才进行流派、乐器、情绪与速度等多维标注。
数据如何收集、切分与划分成四个子集?
构造过程本身承担了训练论文中训练节的职责,因为核心工作量是数据工程与标注流水线,而不是提出新网络结构。收集先用预告片关键词检索野外视频,再用电影、游戏、电视剧与纪录片等更具体的关键词扩充来源多样性。切分用场景检测工具比较相邻帧内容差异并按阈值切分,原文阈值为 30。过滤结合运动分数、文本量、画质与美学分数。子集划分逻辑需要准确复述。
全量集合是场景切分后的全部片段,规模超过两千万。音乐富集子集是从全量中按声音质量与音乐性筛选并做 4 维以上音乐标注的片段。高质量子集是从原集合按运动分数区间、画质前 85% 与美学前 85% 筛选且时长大于 4 秒的片段,提供全部标注。人工修正测试集是从高质量子集中抽取约 1000 个片段并人工修订合并标注,用于评测。下面的清洗与分离示意图展示了从数据源到 4 个子集的分叉,读图前应先记住全量、音乐、高质量与测试四者的包含关系。
这段导读帮助读者把流程图与文字标准对应起来,左侧是数据源与音视频分流,中间是场景剪裁与音乐处理,右侧是 4 个存储位置,关键是高质量过滤与人工修正两个菱形与箭头,它们决定了哪些片段能进入高质量子集与测试集。
看图路径: 1. 先从左上视频数据源出发确认元数据清洗后分出的保留与废弃分支;2. 再看音视频两路如何分别走向音乐处理与基于场景的剪裁;3. 最后确认高质量过滤与人工修正如何得到不同子集
论文图 4。原论文 Figure 4:“Data cleaning and separation of the VMChill.”。
图中视频数据源先经过元数据清洗,分出废弃部分与保留部分,保留部分同时产出原始视频与原始音频。视频经基于场景的剪裁走向高质量过滤,音频经音乐处理产出音乐子集并汇入高质量过滤,高质量过滤后分出全量与高质量子集,高质量子集再经人工标注修正得到测试集。复述时要注意全量与高质量是过滤前后的关系,音乐子集是并行处理后汇入的关系,测试集是人工修正后的小规模评测集合。
实验测什么,用什么数据划分与指标,条件是否一致?
实验按 4 个问题组织,分别对应标注质量、视频生成、视频理解与音乐生成。标注质量用人评,在测试集中随机抽取少量视频,按正确性、细节、丰富度与流畅度打 0 到 10 分,比较人工修正、融合标注、对象背景标签、帧标注、音乐标注与多模态模型标注。视频生成在高质量子集上随机采样并用视频标注微调视频生成模型,训练配置为 8 卡、批量大小与步数学习率均有明确记录,评测用视频生成基准的多个维度,方向均为越高越好。
视频理解以视频语言模型为基线,用相同模型与训练配置在高质量子集上训练若干轮,并与官方预训练权重和官方微调权重比较,评测用文本生成常用指标与语义相似度指标。音乐生成训练能同时接受文本或视频输入的扩散模型,文本到音乐与视频到音乐分别在对应基准上与基线比较,指标包括分布距离与质量分数,其中分布距离越低越好,质量分数越高越好。
数据分布方面,类别统计显示影视动画与娱乐占比较高,生活与游戏等也有覆盖,对象词以人物为主,背景词以室内场景为主。下面的类别分布图用于检查分布偏置,读图前应明确纵轴是预告片比例而非片段数量。
这段导读提醒初学者不要把类别分布误读为均匀分布,横轴是十余种视频来源类别,纵轴是百分比,柱高差异直接反映数据偏置,读图时先找最高的两个柱子再看长尾类别。
看图路径: 1. 先看横轴类别名称确认覆盖影视、娱乐、游戏与生活等多种预告片来源;2. 再比较纵轴比例确认哪两类占比最高、哪几类占比很低
论文图 2。原论文 Figure 2:“Distribution of video categories of the VMChill dataset.”。
图中最高的两根柱子对应影视动画与娱乐类,其次是人物博客类,其余喜剧、游戏与其他类别占比较小,新闻政治、音乐、科学与体育等更低。这种分布支持论文关于主题多样的说法,但也意味着模型训练与评测主要被影视娱乐类主导,复述结论时应保留这一适用条件,不能推广为所有视频类型都同样有效。
音乐生成的主结果显示了什么,代价是什么?
音乐生成是检验音乐标注与视频音乐配对是否可用的关键实验。比较的问题是,在相同评测基准上,用本数据集训练或微调的模型是否优于对应的公开基线。公平条件是文本到音乐与视频到音乐分开比较,文本侧比较文本到音乐基线及其微调版本与新训练的文本条件模型,视频侧比较视频到音乐基线与新训练的视频条件模型。指标方向需要记清,分布距离类指标越低越好,质量分数越高越好。结果表的阅读顺序应先看任务分组,再按行比较基线、微调与新模型。
该表直接报告音乐生成的定量主结果,包含文本到音乐与视频到音乐 2 个任务分组、必要的公开基线与本数据集训练的实际可运行模型,指标同时覆盖分布距离与质量分数,适合作为核心结果表精读。
| Task Method | KL↓ | ISc↑ | FD↓ | FAD↓ |
|---|---|---|---|---|
| Stable-Audio-Open | 1.51 | 2.04 | 36.33 | 3.23 |
| Text-to-Music Stable-Audio-Open (tuned) | 1.20 | 3.19 | 24.82 | 2.40 |
| T2M-DiT | 1.50 | 2.98 | 25.74 | 3.46 |
| VidMuse | 0.73 | 1.32 | 29.95 | 2.46 |
| V2M-DiT | 0.77 | 1.25 | 30.52 | 2.51 |
表后解释需要同时给出收益与未胜出项。文本到音乐一侧,经本数据集微调的基线在分布距离与质量分数上均优于微调前,说明数据集的文本标注带来了可测量的改进,新训练的文本条件模型也优于原始基线但未全面超过微调后的强基线。视频到音乐一侧,新训练的视频条件模型与领域内强基线接近,部分指标略低,说明视频音乐配对有效但并未在所有指标上取胜。限制是该表只覆盖音乐生成,视频理解与视频生成的数字需要回到正文其他段落,不能用这张表证明所有任务都提升。
视频到音乐生成 × 文本到音乐生成: 文本到音乐生成以融合后的文字标注为输入检验标注的语义可用性,视频到音乐生成以画面序列为输入检验视听时间对齐是否被模型利用,前者分工是验证语言侧质量,后者分工是验证跨模态条件有效性,二者搭配才能说明数据集既提供了可读的文字监督,也提供了可对齐的视频音乐配对。
规模、时长与标注长度的对照说明了什么?
除了主结果,还需要一组关于数据构造的对照,以说明规模与标注粒度不是随意选择的。比较的问题是,全量、音乐子集、高质量子集与测试集在数量、时长与标注长度上有何差异,以及收集与切分过程的原始规模有多大。公平条件是同一套收集与切分流水线下按不同过滤标准划分,指标包括片段数、总时长、平均片段时长与平均标注词数。下面的整理表把分散在正文中的规模数字放在同一结构下,便于核对数据集、阶段与聚合对象。
该表整理收集与划分阶段的规模数字,用于对照全量切分结果、音乐事件比例、时长门限与测试集标注长度,阅读时应注意每格数字对应不同的聚合对象,不能把视频数与片段数混为一列比较。
| 阶段与对象 | 数量 | 时长与长度 | 质量与标注条件 | 对应子集 |
|---|---|---|---|---|
| 收集到的预告片视频 | 285,518 个视频 | 94,911,802.8 seconds 总时长 | 关键词覆盖多类来源 | 全量来源 |
| 场景切分后片段 | 21,588,792 个片段 | 4.6 seconds 平均时长 | 场景检测阈值为 30 | 全量片段 |
| 含音乐的音频段比例 | 超过 70% 含音乐 | 44.1 kHz 采样 | 经音乐事件检测 | 音乐候选 |
| 高质量子集门限 | 2M 片段规模 | 长于 4s | 运动与画质美学过滤 | 高质量子集 |
| 人工修正测试集 | 1k 片段 | 3.2hr 总时长,98.2 words 平均标注 | 人工修订合并标注 | 测试集 |
表后解释应指出支持与边界。全量规模与音乐比例支持用预告片做视听数据的选择,高质量门限与时长要求解释了为什么高质量子集的平均时长与标注长度明显大于全量。未胜出或未覆盖的一面是,原文没有给出消融掉某一过滤条件后下游指标必然下降多少的对照,因此不能把每个阈值都说成最优,只能说它们是论文实际使用的可复现条件。复现时应优先保持相同的切分阈值、时长门限与质量过滤顺序,再根据本地算力调整采样规模。
哪些结论是直接报告,哪些还只是可能?
直接报告的部分包括收集与切分规模、音乐事件比例、标注流水线中各模型的分工、4 个子集的划分标准,以及下游实验在给定配置下的指标变化。论文用较大篇幅报告了视频生成的运动平滑与主体一致性提升、视频理解在多个文本指标上的提升,以及音乐生成中微调带来的改进,这些都绑定了具体基线与评测集。
有限解释的部分是人工偏好与自动指标的关系,融合标注的人评高于单模态标注,对象背景标签虽短但正确性较好,这支持多路融合的价值,但样本量有限,不能推广为所有视频都如此。未验证推测需要谨慎表达,预告片的高视听一致性可能有助于其他视频类型,但类别分布偏向影视娱乐,对象以人物为主,背景以室内为主,因此跨域泛化待验证。
成本与延迟同样未充分测量,微调步数与硬件配置有记录,但推理开销、输出帧率与实际延迟没有作为主要结论,复述时不应承诺这些量得到改善。总体趋势不等于每组都成立,例如视频生成的整体一致性维度并未同步提升,音乐生成的视频条件模型也未全面超过强基线,这些反例应与收益一并保留。
要复现应先做什么,需要保留哪些关键条件?
复现应从数据构造开始而不是直接训练生成模型。第一步按关键词收集预告片并记录视频数量与总时长,抽取同步音视频流并固定音频采样率与视频分辨率下限。第二步用场景检测工具按相同阈值切分,统计片段数与平均时长,检查是否接近原文报告的量级,若差异过大应先检查阈值与数据源而非直接调模型。
第三步分别跑通画面侧与音乐侧,画面侧至少实现首中末帧描述、动态差异描述与对象背景问答,音乐侧至少实现音乐事件检测、人声分离与双维度质量过滤,再用要求 5 个音乐维度的提示词做详细标注。第四步用语言模型融合多路描述并保留全部中间描述,以便出错时回查是画面错误、音乐错误还是融合错误。第五步按运动分数区间、画质与美学比例、时长大于 4 秒筛选高质量子集,再抽取小规模片段做人工修正得到测试集。
下游复现时,视频理解应使用相同的基线结构与训练轮数批量大小,视频生成应保留相同的微调步数学习率与评测维度,音乐生成应分开评测文本条件与视频条件。信息条件方面,本解读依据的证据未包含可验证的公开下载链接,因此应把数据集与代码当作当前不可用处理,先复现流水线逻辑与评测流程,待官方渠道可达后再对齐完整数据。
何时值得尝试这个思路,一句话如何记住它?
当任务需要音乐随画面变化而变化时,这个思路值得尝试,例如预告片混剪、游戏宣传片配乐、短剧卡点生成与视频音乐检索问答。它的可迁移点不是某个模型权重,而是把长视频先按场景切成可描述单元,再把画面、运动与音乐分开写清楚,最后用语言模型合并的工程顺序。这种顺序把时间对齐放在语义融合之前,适合音乐与转场强相关的素材。
如果素材以对白为主或音乐稀疏,音乐分支的收益会变小,此时应先做音乐事件比例统计再决定是否投入多维音乐标注。记住它可以用一句话概括,用预告片的天然剪辑一致性换取可训练的视听对齐,再用分路抽取加语言模型融合换取可读的长标注,用人工修正的小测试集守住评测可信度。后续还需补的验证包括更均衡的类别采样、低质与高质过滤的对照、以及在非预告片数据上的泛化测试,这些补足后才能更稳地把结论从预告片推广到一般视频。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



