Tonnetz-Driven Graph Wedgelet for Harmonic Complexity Reduction in Music Scores

📄 Tonnetz-Driven Graph Wedgelet for Harmonic Complexity Reduction in Music Scores 标签:#音乐理解 #低资源 #音频理解 #Transformer #模型评估 5.3/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 0.6/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.5/1.5 📝 5.3/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #音乐理解 | #低资源 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Emmanuel Caronna(巴勒莫大学工程系) 通讯作者:Elisa Francomano(巴勒莫大学工程系) 作者列表:Emmanuel Caronna(巴勒莫大学工程系)、Elisa Francomano(巴勒莫大学工程系)、Silvia Licciardi(巴勒莫大学工程系) 💡 毒舌点评 本文提出了一种基于图楔形树和六维Tonnetz嵌入的乐谱伴奏压缩方法,其跨学科融合(图信号处理与音乐理论)的构思颇具巧思,对音乐和声距离的刻画也超越了简单的半音距离。然而,整篇论文读下来更像一个精心设计的“概念验证”,其最致命的短板在于实验评估:缺乏与任何现有压缩或简化方法的对比、缺乏对简化后乐谱听觉质量(如和谐度、可听性)的评估、数据集小且作曲家/体裁信息不明。这导致方法的实际效用和优越性完全无法被证实。如果作为一篇会议短文或workshop论文,或许尚可;但若投向主会议,其证据的薄弱程度难以令人信服。 ...

2026-07-13 · 更新于 2026-07-24 · 2 min · 298 words

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

📄 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 标签:#音乐转录 #基准测试 #音乐理解 #数据集 #音频理解 7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 ✅ 7.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐转录 | #基准测试 | #音乐理解 #数据集 | arxiv 👥 作者与机构 第一作者:Nathan Pruyne(Carnegie Mellon University, Language Technologies Institute) 通讯作者:未说明 作者列表:Nathan Pruyne(Carnegie Mellon University, Language Technologies Institute)、Benjamin Stoler(未说明)、William Chen(未说明)、Chien-yu Huang(Carnegie Mellon University)、Shinji Watanabe(Carnegie Mellon University)、Chris Donahue(Carnegie Mellon University, Language Technologies Institute) 💡 毒舌点评 论文精准地识别了缺乏商业流行音乐多轨转录评估基准这一痛点,并展示了构建该基准的工程野心。然而,作为一份旨在成为“黄金标准”的评估数据集,其核心弱点在于:1) 评估效用被严重限制,因为仅测试了两个模型,且它们均非针对该任务设计或训练;2) 核心产物(音频)因版权限制无法直接提供,迫使使用者依赖外部链接,极大削弱了数据集的可访问性和即刻可用性;3) 数据集本身规模很小(3.5小时),多样性虽被强调,但实际覆盖的“流行”子流派有限。这使得该工作的实际影响力远低于其宣称的意图。 ...

2026-07-10 · 更新于 2026-07-24 · 2 min · 313 words

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

📄 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 标签:#音乐转录 #基准测试 #音乐理解 #数据集 6.6/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐转录 | #基准测试 | #音乐理解 #数据集 | arxiv 👥 作者与机构 第一作者:Nathan Pruyne(卡内基梅隆大学) 通讯作者:未说明 作者列表:Nathan Pruyne(卡内基梅隆大学)、Benjamin Stoler(卡内基梅隆大学)、William Chen(卡内基梅隆大学)、Chien-yu Huang(卡内基梅隆大学)、Shinji Watanabe(卡内基梅隆大学)、Chris Donahue(卡内基梅隆大学) 💡 毒舌点评 论文精准命中了自动音乐转录(AMT)领域对真实商业流行音乐进行多轨转录评测基准的空白,其构建的流程(元数据匹配+节拍对齐+人工筛选)严谨且可复用,为社区提供了首个专用基准。然而,最终仅49.1%的成功率揭示了当前跨源对齐技术的根本瓶颈,而3.5小时的规模和强烈的西方音乐偏见限制了其作为通用基准的广度,使其更像是一个高质量但受限的“探路石”。 📌 核心摘要 本文旨在解决自动音乐转录(AMT)模型缺乏针对真实商业流行音乐进行多轨转录评测基准的问题。核心贡献是构建了MulTTiPop数据集,其流程包括:从Lakh MIDI数据集和TheoryTab数据集通过元数据匹配找到潜在对应的多轨MIDI和YouTube音频段;使用基于节拍的动态时间规整(DTW)对齐两者的时间轴;通过融合基线相似度、旋律匹配和YouTube时间戳等多种策略生成候选对齐锚点,最终由人工标注者选择正确的对齐。与已有数据集相比,MulTTiPop首次提供了针对真实商业流行音乐音频的多轨MIDI标注。实验评估显示,当前先进的AMT模型(MT3、YourMT3+)在此数据集上表现不佳,最佳模型的Onset F1仅为38%(精确制式)和37.87%(打击/和声制式),表明该任务存在巨大提升空间。该数据集的实际意义在于为AMT模型在复杂、真实的多轨音乐转录任务上提供了一个有挑战性的评测工具。其主要局限性在于构建成功率不高(49.1%)、数据集规模较小(3.5小时)且存在西方音乐偏见。 ...

2026-07-10 · 更新于 2026-07-24 · 2 min · 301 words

MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

📄 MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations #音乐理解 #数据集 #基准测试 #对比学习 #多模态模型 8.1/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #音乐理解 | #对比学习 | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:Sirui Zhang(中央音乐学院、北京通用人工智能研究院) 通讯作者:Duo Xu(天津音乐学院、北京通用人工智能研究院)、Xin Jin(北京电子科技学院、北京通用人工智能研究院)、Feng Yu(中央音乐学院、北京通用人工智能研究院)、Songchun Zhu(北京大学、北京通用人工智能研究院) 作者列表:Sirui Zhang(中央音乐学院、北京通用人工智能研究院)、Tianle Wang(中央音乐学院、北京通用人工智能研究院)、Xinyi Tong(中央音乐学院、北京通用人工智能研究院)、Peiyang Yu(中央音乐学院、北京通用人工智能研究院)、Jishang Chen(中央音乐学院、北京通用人工智能研究院)、Liangke Zhao(中央音乐学院、北京通用人工智能研究院)、Haoxin Zhang(中央音乐学院、北京通用人工智能研究院)、Duo Xu(天津音乐学院、北京通用人工智能研究院)、Xin Jin(北京电子科技学院、北京通用人工智能研究院)、Feng Yu(中央音乐学院、北京通用人工智能研究院)、Songchun Zhu(北京大学、北京通用人工智能研究院) 💡 毒舌点评 该工作为音乐美学评估贡献了目前最大规模、最细粒度的专业标注基准,多维度框架与多标注者设计很有诚意,显著超越了现有MusicEval/SongEval等数据集。然而,基准实验仅停在轻量回归和零样本LLM预测,缺乏精心设计的专用美学模型对比,且训练超参数几乎完全不公开,削弱了其作为“benchmark”的深度说服力。CLAP的语义适应增益微弱,暴露了当前音文对齐模型在捕捉细粒度美学信号上的根本性局限,而论文对此并未提出有效的解决方案。 ...

2026-07-09 · 更新于 2026-07-24 · 6 min · 1075 words

Rag Classification of Tagore Songs using Symbolic Music Notation and Novel Weighted Distance Measures

📄 Rag Classification of Tagore Songs using Symbolic Music Notation and Novel Weighted Distance Measures #音乐理解 #数据集 #少样本 3/10 | 创新 0.8/2 | 严谨 0.5/1.5 | 实验 0.3/1.5 | 清晰 0.6/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.3/1.5 📝 3/10 | 后50% | #音乐理解 | #数据集 | #少样本 | arxiv 👥 作者与机构 第一作者:Chandan Misra(XIM University, School of Computer Science and Engineering) 通讯作者:未说明 作者列表:Chandan Misra(XIM University, School of Computer Science and Engineering)、Swarup Chattopadhyay(XIM University, School of Computer Science and Engineering) 💡 毒舌点评 这篇论文在文化细微的 Rabindra Sangeet 拉格识别任务上构建了一个手标符号数据集,并提出了融入先验知识的加权距离,思路有音乐直觉但有重大缺陷。方法停留在 kNN 加手工权重的浅层模式,实验仅在三类小样本上与未加权欧氏距离对比,未涉及任何标准机器学习或时序模型。最致命的是,数据集、代码全未公开,复现性为零,且实验设计存在基本混淆。整体贡献无论从机器学习创新、评估充分性或开放性角度来看,都远未达到顶会录用标准,可能适合领域特化的音乐学会议。 ...

2026-07-09 · 更新于 2026-07-24 · 3 min · 524 words

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

📄 Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music #音乐理解 #基准测试 7.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.8/10 | 前25% | #音乐理解 | #提示学习 | #基准测试 | arxiv 👥 作者与机构 第一作者:Tomáš Sourada(查尔斯大学数学与物理学院,形式与应用语言学研究所) 通讯作者:未明确提及,推断为 Jan Hajič jr 作者列表:Tomáš Sourada,Katia Vendrame,Jan Hajič jr 机构:查尔斯大学数学与物理学院,形式与应用语言学研究所 💡 毒舌点评 论文用"用户数据即benchmark"的元框架戳中静态基准的致命伤,程序化生成和基准尺寸校准做得聪明又实用。遗憾的是,问题模板仍停留在音乐理论的"小学算术"级别,无输入基线在修改提示语后才可能更干净,现在对"真正在听"的论证依然有点虚。跨模态对齐的想法很好,但音频模态下"第n个音符"这种需要强音高追踪的题目,本质上就比读乐谱难一个量级——这不完全是模型的锅,部分是出题的问题。 ...

2026-07-08 · 更新于 2026-07-24 · 2 min · 346 words

Decomposer: Learning to Decompile Symbolic Music to Programs

📄 Decomposer: Learning to Decompile Symbolic Music to Programs #音乐理解 #音乐生成 #强化学习 #可解释性 8.4/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.4/10 | 前25% | #音乐理解 | #强化学习 | #音乐生成 #可解释性 | arxiv 👥 作者与机构 第一作者:Yewon Kim (Carnegie Mellon University) 通讯作者:Chris Donahue (Carnegie Mellon University,作为共同作者排在最后,惯例默认为通讯作者) 作者列表:Yewon Kim, Apurva Gandhi, David Chung, Graham Neubig, Chris Donahue (全为Carnegie Mellon University) 💡 毒舌点评 将音乐“反编译”为程序的想法颇具巧思,两阶段的SFT+RL框架确实在逼真度和可读性之间找到了一个相对实用的平衡点,工程实现完整度也高。然而,可读性的衡量标尺看似面面俱到,实则是用LLM法官打钩的清单来逼近人类的审美直觉,略显机械;此外,这种清单对Chiptune等特定音乐风格的适配性存疑,但作者对此论证不足。整体而言,这是一个优雅但不乏瑕疵的跨领域应用,在音乐AI领域开辟了一个有趣但尚需打磨的新方向。 ...

2026-07-03 · 更新于 2026-07-24 · 2 min · 323 words

Profy: Interpretable Visualization of Expertise-Dependent Motor Skills Toward Supporting Piano Practice

📄 Profy: Interpretable Visualization of Expertise-Dependent Motor Skills Toward Supporting Piano Practice #多模态模型 #正则化微调 #音乐信息检索 #音乐理解 6.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 6.9/10 | 前50% | #音乐信息检索 | #多模态模型 | #正则化微调 #音乐理解 | arxiv 👥 作者与机构 Kazuki Kawamura (东京大学, 索尼计算机科学实验室), Fujiki Nakamura (东京大学), Hayato Nishioka (索尼计算机科学实验室, NeuroPiano研究所), Momoko Shioki (索尼计算机科学实验室, NeuroPiano研究所), Shinichi Furuya (索尼计算机科学实验室, NeuroPiano研究所), Jun Rekimoto (东京大学, 索尼计算机科学实验室) ...

2026-06-10 · 更新于 2026-07-24 · 3 min · 525 words

Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding

📄 Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding #音乐生成 #音乐理解 #基准测试 #大语言模型 7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 7/10 | 前50% | #音乐生成 | #音乐理解 | #基准测试 #大语言模型 | arxiv 👥 作者与机构 Matteo Spanio, Mohammad Torabi, Andrea Poltronieri, Antonio Rodà。 主要机构:Centro di Sonologia Computazionale, University of Padova, Italy;Music Technology Group, Universitat Pompeu Fabra, Barcelona, Spain。 ...

2026-06-09 · 更新于 2026-07-24 · 2 min · 352 words

Exploring LLMs for South Asian Music Understanding and Generation

📄 Exploring LLMs for South Asian Music Understanding and Generation #音乐理解 #音乐生成 #低资源 #大语言模型 7.7/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.7/10 | 前50% | #音乐生成 | #音乐理解 | #低资源 #大语言模型 | arxiv 👥 作者与机构 Faria Binte Kader, Mohtasim Hadi Rafi, Shah Wasif Sazzad, Santu Karmaker University of Central Florida, Auburn University ...

2026-06-05 · 更新于 2026-07-24 · 1 min · 187 words