Recovering Expert Critic-Sourced Network Adjacency between Musical Artists from Acoustic Distributions: A Construct-Validity Approach

📄 当乐评人说两位歌手很像,声音本身答应吗? 英文题目:Recovering Expert Critic-Sourced Network Adjacency between Musical Artists from Acoustic Distributions: A Construct-Validity Approach 一句话:论文把乐评共现当作待检验的构念而非真值,用 80 维声学分布的边缘 Wasserstein 距离向量预测无向邻接,在艺人不相交冷启动下以 0.767 到 0.865 的 AUC 分层验证出声学核心与社会学残差的二分,代价是陈旧的标量特征与弱实体链接且缺乏现代表征对照。 标签:#音乐推荐 #集成学习 #音乐理解 #可解释性 评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5 👥 作者与机构 Elena Badillo-Goicoechea:The University of Chicago Fengfeng He:The University of Chicago 💬 毒舌点评 亮点在于把乐评人共现这一主观网络用分布式的声学基线做构念效度检验,并用共识分层揭示出声学核心与社会学残差的有趣二分,思路比单纯做相似度回归更具音乐学解释力。短板是声学侧仅用 80 维 Essentia 标量特征的边缘 Wasserstein 距离,完全丢弃特征间联合结构与时序,且图构建依赖 NLTK/TextBlob 的弱命名实体识别与归一化匹配,可靠性与可复现性均存疑。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 797 words

Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation

📄 Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation 标签:#音乐推荐 #模型融合 #大语言模型 #音乐文本检索 8.3/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 🔥 8.3/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐推荐 | #模型融合 | #大语言模型 #音乐文本检索 | arxiv 👥 作者与机构 第一作者:Naman Garg(National Institute of Technology Kurukshetra, India) 通讯作者:正文未明确标注 作者列表:Naman Garg、Sarika Jain、George Fazekas(机构:National Institute of Technology Kurukshetra, India;Queen Mary University of London, United Kingdom) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 563 words

Computational Features for Symbolic Melody Analysis

📄 Computational Features for Symbolic Melody Analysis 标签:#音乐理解 #开源工具 #模型评估 #音乐推荐 7.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.7/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐理解 | #开源工具 | #模型评估 #音乐推荐 | arxiv 👥 作者与机构 第一作者:David M. Whyatt(机构未说明) 通讯作者:未说明 作者列表:David M. Whyatt、Peter M. C. Harrison(机构信息未在当前正文中完整说明) 💡 毒舌点评 作为符号旋律分析的工具箱,它的覆盖面宣言与实际能力之间有明显落差:调性模板只支持大小调体系,对非十二平均律和其他文化的旋律组织没有同等支持;只接受单声部输入,颤音滑音等音内装饰一律排除。99.20% 的中欧分类准确率听起来惊人,但在差异悬殊的中国—欧洲二分任务上,这个数字可能更多来自记谱习惯与文化分界而非特征质量,缺少更细粒度的风格或作曲家级验证。 📌 核心摘要 这项工作解决的是符号旋律分析工具长期碎片化的问题:研究者往往需要在 R、Java、MATLAB、Common Lisp 和 Python 工具之间切换,特征定义也散落在不同年代的理论与技术文献中。作者梳理 FANTASTIC、SIMILE、IDyOM、jSymbolic、MIDI Toolbox、MUST 和 Partitura 七套工具,将可用特征统一为 282 项,并按音高、节奏、音高—节奏联合三大组、12 个概念类别组织。 2. 配套的开源 Python 包 melody-features 不只是接口汇总:多数特征重新用 Python 实现,melsim 通过 R 包装器接入,同时修复 Minor Major Third Ratio、Interpolation Contour、Step Contour 等参考实现问题,并补充 Mean Duration 等自然延伸特征。 3. 在 Essen Folksong Collection 的中国—欧洲风格分类任务上,235 个数值特征的逻辑回归在 873 首留出旋律上达到 99.20% 准确率,仅错分 7 首;5 折交叉验证为 98.74%±0.29%。 4. 全特征的准确率很高,但高度相关且难以解释。采用 promax 斜交旋转的探索性因子分析后,8 个因子解释 46.27% 总方差,测试准确率仍有 92.56%,用约 7 个百分点的性能换来更紧凑的音乐学解释。 5. 结果还显示,这个中国—欧洲二分类主要由音高信息驱动:音高组置换重要性为 0.4345,节奏组为 0.05762,音高—节奏联合组仅 0.002405。它说明工具箱有较强的 MIR 实用性,但也提醒读者,近乎封顶的地理分类并不等于已经证明特征能覆盖更细粒度、更跨文化的旋律差异。 🔗 开源详情 根据论文全文提取的开源资源链接: ...

2026-08-20 · 更新于 2026-09-04 · 3 min · 432 words

Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion

📄 Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion #音乐检索 #音乐推荐 #知识蒸馏 4.7/10 | 创新 1.1/2 | 严谨 0.7/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.7/1.5 📝 4.7/10 | 后50% | #音乐检索 | #强化学习 | #音乐推荐 #知识蒸馏 | arxiv 👥 作者与机构 第一作者:Pengcheng Jiang(Google Research,伊利诺伊大学厄巴纳-香槟分校) 通讯作者:未说明 作者列表:Pengcheng Jiang(Google Research、伊利诺伊大学厄巴纳-香槟分校)、Judith Yue Li(Google Research)、Moonkyung Ryu(Google Research)、R. Lily Hu(Google Research)、Kun Su(Google Research)、Zhong Yi Wan(Google Research)、Liam Hebert(Google Research)、Hao Peng(Google Research)、Jiawei Han(伊利诺伊大学厄巴纳-香槟分校)、Dima Kuzmin(Google Research)、Craig Boutilier(Google Research) 💡 毒舌点评 这篇论文将一个朴素的工程思路——“用RL生成一次数据,然后蒸馏到小模型”——包装成了一个看似精巧的框架,用于解决集合级检索中非分解属性优化的难题。这个“编译”概念确实有启发性,但论文的全部说服力都建立在Google内部的专有数据和闭源代码之上,对于社区而言,这更像一份Google的内部技术报告。音乐检索实验只在一个无法获取的工业数据集上完成,加上LLM-as-a-Judge评估的潜在偏差和全流程对昂贵基础设施的依赖,使其宣称的通用性和影响力大打折扣,外人看来不过是一座空中楼阁。 ...

2026-07-04 · 更新于 2026-09-04 · 3 min · 554 words

Multimodal Music Recommendation System using LLMs

📄 Multimodal Music Recommendation System using LLMs #音乐推荐 #多模态模型 #大语言模型 10/10 | 创新 2/2 | 严谨 1.5/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 10/10 | 前50% | #音乐推荐 | #多模态模型 | #大语言模型 | arxiv 👥 作者与机构 Srikar Prabhas Kandagatla (University of Massachusetts Amherst),Sreehitha R. Narayana (University of Massachusetts Amherst),Chandana Magapu (University of Massachusetts Amherst),Swetha Mohan (University of Massachusetts Amherst),Shamanth Kuthpadi (University of Massachusetts Amherst),Hongjie Chen (Dolby Laboratories),Ryan A. Rossi (Adobe Research),Franck Dernoncourt (Adobe Research),Nesreen Ahmed (Cisco Research) ...

2026-06-02 · 更新于 2026-09-04 · 2 min · 416 words

Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization

📄 Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization #音乐推荐 #冷启动 ✅ 7/10 | 前50% | #音乐推荐 | #冷启动 | arxiv 学术质量 5.1/7 | 影响力 1.5/2 | 可复现性 0.4/2 | 置信度 高 👥 作者与机构 论文作者共7位,分属两家机构: Audrey Chan (LUCID Inc., Toronto, Canada) Aaron Labbé (LUCID Inc., Montréal, Canada) Jacob Lavoie (Mila — Québec AI Institute, Montréal, Canada) Jordan Bannister (Mila — Québec AI Institute, Montréal, Canada) Arsène Fansi Tchango (Mila — Québec AI Institute, Montréal, Canada) Guillaume Lajoie (Mila — Québec AI Institute, Montréal, Canada) Laurent Charlin (Mila — Québec AI Institute, Montréal, Canada) 💡 毒舌点评 本文动机明确且具有重要的社会价值(为临床用户提供安全的情感音乐推荐),但作为一篇顶会论文,其技术贡献和实验验证显得过于“温和”与“内部”。世界模型的核心是标准的因果Transformer,其创新点更多在于将现有组件(行为克隆、DPO、世界模型)进行组合以解决一个特定应用问题,而非提出全新的模型架构或理论。最大的软肋在于“自指验证”:整个离线策略(DPO)是在世界模型上训练和评估的,而世界模型本身的预测能力(\(R^2\)约40%)只能说尚可,这导致所有下游结论(如DPO的增益)都建立在“如果世界模型是准确的,那么…”的假设之上,缺乏与真实世界交互的闭环验证。论文对此有明确讨论,但这确实削弱了其结论的强度。此外,完全不公开的代码、数据和模型权重,使得这项在伦理约束场景下的“早期部署验证”几乎无法被同行复现或扩展,其“验证”价值打了很大折扣。实验设计相对完整,但部分关键对比(如与Moodify)因对方未开源而缺失,且情感预测任务的基线(如MER基准)比较显得有些笼统。 ...

2026-05-28 · 更新于 2026-09-04 · 3 min · 434 words

ICASSP 2026 - 音乐推荐 论文列表

ICASSP 2026 - 音乐推荐 共 1 篇论文 ← 返回 ICASSP 2026 总览 排名 论文 评分 分档 🥇 MusiCRS: Benchmarking Audio-Centric Conversational Recommend 7.5分 前25% 📋 论文详情 🥇 MusiCRS: Benchmarking Audio-Centric Conversational Recommendation ✅ 7.5/10 | 前25% | #音乐推荐 | #多模态模型 | #基准测试 #音频检索 👥 作者与机构 第一作者:未说明(作者列表无顺序指示) 通讯作者:未说明 作者列表:Rohan Surana(University of California, San Diego, USA)、Amit Namburi(University of California, San Diego, USA)、Gagan Mundada(University of California, San Diego, USA)、Abhay Lal(University of California, San Diego, USA)、Zachary Novack(University of California, San Diego, USA)、Julian McAuley(University of California, San Diego, USA)、Junda Wu(University of California, San Diego, USA) 💡 毒舌点评 ...

2026-04-29 · 更新于 2026-09-04 · 1 min · 167 words

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

📄 MusiCRS: Benchmarking Audio-Centric Conversational Recommendation #音乐推荐 #多模态模型 #基准测试 #音频检索 ✅ 7.5/10 | 前25% | #音乐推荐 | #多模态模型 | #基准测试 #音频检索 学术质量 5.5/7 | 选题价值 1.5/2 | 复现加成 0.5 | 置信度 高 👥 作者与机构 第一作者:未说明(作者列表无顺序指示) 通讯作者:未说明 作者列表:Rohan Surana(University of California, San Diego, USA)、Amit Namburi(University of California, San Diego, USA)、Gagan Mundada(University of California, San Diego, USA)、Abhay Lal(University of California, San Diego, USA)、Zachary Novack(University of California, San Diego, USA)、Julian McAuley(University of California, San Diego, USA)、Junda Wu(University of California, San Diego, USA) 💡 毒舌点评 亮点:本文提出的MusiCRS基准,是首个系统性地将真实Reddit音乐对话与可访问的音频片段(YouTube链接)对齐的工作,填补了音乐对话推荐评估中“对话”与“音频”同时缺失的空白,实验设计严谨,对比维度(模态、流派)清晰。 短板:论文最核心的发现(多模态组合性能常不如单模态)更像一个值得深究的“问题揭示”而非“方案贡献”,且477个对话的规模对于支撑一个健壮的基准来说略显单薄,部分生成模型的Ranking结果与检索模型的差距暗示了任务定义与模型范式可能存在错配。 ...

2026-04-29 · 更新于 2026-09-04 · 2 min · 253 words