Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation

📄 Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation 标签:#音乐推荐 #模型融合 #大语言模型 #音乐文本检索 8.3/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 🔥 8.3/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐推荐 | #模型融合 | #大语言模型 #音乐文本检索 | arxiv 👥 作者与机构 第一作者:Naman Garg(National Institute of Technology Kurukshetra, India) 通讯作者:正文未明确标注 作者列表:Naman Garg、Sarika Jain、George Fazekas(机构:National Institute of Technology Kurukshetra, India;Queen Mary University of London, United Kingdom) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 563 words

On computational approaches to Pop music culture

📄 On computational approaches to Pop music culture 标签:#音乐理解 #音视频理解 #音乐文本检索 #模型评估 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5 ✅ 6.1/10 | 前50% | 文档类型:综述 | 评分置信度:高 | #音乐理解 | #模型评估 | #音视频理解 #音乐文本检索 | arxiv 👥 作者与机构 作者:A. Flexer(奥地利约翰·开普勒大学等)。 💡 毒舌点评 本文最重要的提醒是:只听音频会把 Pop 文化削成波形特征,封面、歌词、音乐视频和传播语境同样是证据。它对“distant reading”迁移到音乐的解释很有启发,但综述提出的多模态愿景仍受数据偏斜、授权和文化语义不可比的现实约束,工程上远比做一个跨模态 embedding 困难。落到证据层面:综述依赖公开英语资源,非英语地区与小众文化的代表性不足;不同语料的版权、采样机制与元数据质量差异会实质影响结论;三个未来方向既缺统一数据标准也没有可复现基线,多模态因果解释更是明确需要文化研究者参与而非自动模型单打独斗。 📌 核心摘要 本文主张 Pop music culture 应被作为音频、视觉、文本和社会文化关系的多模态现象研究,而不是只做音频分析。作者回顾 distant reading、distant listening、distant viewing、歌词 NLP、封面图像、音乐视频和大规模 MIR 语料的工作,指出真正融合多模态的研究仍少,语料采样往往造成外部效度问题。文章提出三个研究方向:绘制歌词主题宇宙、建立专辑封面图像志、追踪音乐时间线中的 retro cycles。 ...

2026-08-19 · 更新于 2026-09-04 · 2 min · 377 words