Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections
📄 Dialogue-Aware Video-to-Music Generation Using Public Domain Film Collections 标签:#音视频生成 #Adapter #数据集 #音乐生成 #基准测试 7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频生成 | #Adapter | #数据集 #音乐生成 | arxiv 👥 作者与机构 第一作者:Haven Kim(具体机构未逐作者标注;论文仅列 1 University of California San Diego、2 University of Michigan) 通讯作者:未说明 作者列表:Haven Kim、Zachary Novack、Julian McAuley(原文作者名单拼作 “Juian McAuley”,疑为 Julian McAuley 的笔误)、Hao-Wen Dong;机构信息仅列两个单位,未逐作者映射 💡 毒舌点评 这篇论文用一个 246.4 小时的自托管公共领域电影数据集,直击视频配乐领域“链接腐烂 + 爬取限速”的真实痛点,工程贡献清楚。但对话感知模块本质上是 FiLM 加位置编码的轻量改装,且 GVMGen 在 in-domain 上出现 CLAP 0.43→0.39、KL 0.72→0.73 的倒退,作者仅以“OOD 提升/正则化”解释,缺乏组件级消融和主观听感证据,却仍宣称“improvement over the state-of-the-art baselines”,结论偏强。 ...