Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking
📄 Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking #音乐检索 #多模态模型 #对比学习 5.4/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0.1/1.5 | 复现 0/0.5 | 工程 1.2/1.5 📝 5.4/10 | 后50% | #音乐检索 | #对比学习 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Seungheon Doh(未说明) 通讯作者:未说明 作者列表:Seungheon Doh(未说明)、Minhee Lee(未说明)、Sangmoon Lee(未说明)、Ben Sangbae Chon(未说明)、Juhan Nam(未说明) 💡 毒舌点评 本文构建了一个“检索+重排序”的两阶段视频音乐推荐框架,把多模态语义检索和时序交叉编码器拼成了一个完整系统,在评测基准上超越了通用跨模态模型,人类评估也显示音乐质量能吊打生成式方案。然而,实验部分缺少消融实验、关键训练细节几乎全部缺失、代码和模型都未开源,这些硬伤使得方法的有效部件无法区分,整个工作的学术可验证性约等于零。两阶段的独立贡献说不清楚,创新点看起来更像是工程拼装而非方法突破。 📌 核心摘要 论文针对视频配乐推荐任务,提出 VTMR 两阶段框架:第一阶段利用视频的RGB帧、非音乐音频和LLM生成的场景描述,与音乐音频及其LLM生成字幕和视频元数据,在共享嵌入空间中进行多模态语义检索,得到全局语义兼容的 top-N 候选音乐;第二阶段通过交叉编码器对视频的视听序列与候选音乐的声学序列进行时序交叉注意力打分,实现细粒度时间对齐重排序。相比以往仅依赖单模态全局嵌入的方法,VTMR 同时建模了全局语义兼容与局部时序对应。在 VidMuse 基准上,语义检索阶段将 R@10 从最强基线 ImageBind 的 14.2 提升至 15.9,MedR 从 75 降至 58;加入时序重排序后 R@10 进一步提升至 18.3,MedR 降至 46。人工 A-vs-B 测试中,VTMR 在与 Adobe Firefly 商用工具的总体偏好对比中具有竞争力(77% win+tie),且音乐质量远胜生成式基线 VidMuse(96% win+tie)。实际意义在于为视频创作者提供可检索高质量版权音乐的自动化工具,但主要局限在于缺少消融实验、训练超参数缺失且未开源,方法贡献的归因存疑。 ...