Pitch Spelling Jazz Lead Sheets, Solo Transcriptions, Classical Piano and Monophonic Scores
📄 Pitch Spelling Jazz Lead Sheets, Solo Transcriptions, Classical Piano and Monophonic Scores 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | arxiv 👥 作者与机构 作者:Augustin Bouquillard(法国综合理工学院),Florent Jacquemard(法国国家信息与自动化研究所,巴黎) 机构:École polytechnique, Palaiseau, France; INRIA, Paris, France 💡 毒舌点评 这篇论文的工作很扎实,像是在为音乐信息检索(MIR)社区做一件“脏活累活”但又必不可少的基础工作。核心想法——通过最小化印刷变音记号来推导音高拼写——并不新鲜,但作者们把它做到了一个新的细致程度,特别是为了应对爵士乐这种“调性混沌”的场景,硬生生把Weber距离从几十种音阶扩展到了165种,这工程量和音乐理论的理解都值得尊敬。最大的槽点可能是标题和摘要里“Pitch Spelling”和“Key Estimation”并列,容易让人误以为是两个独立任务,实际上后者在算法中更像是前者的副产品或约束条件。另一个问题是,论文在爵士数据集上和PKSpell等基线比较时,输入信息(是否有时长)和训练数据不同,使得比较的公平性打折扣,虽然作者有解释,但终归不够有力。总的来说,这是一篇领域内实用性强、方法有改进的论文,离“惊艳”还差一步。 📌 核心摘要 本文提出一种名为PSE的两阶段优化算法,用于解决音高拼写问题,即从MIDI音高序列中推导出符合记谱规范的音符名称、全局调号和每小节的局部调式。该算法的核心创新在于:1)将音高拼写、全局调号估计和局部调式估计三个紧密相关的音乐理论问题进行联合优化;2)通过扩展Weber距离,使其能够量化并处理包括多种爵士音阶在内的165种不同音阶之间的差异,从而增强了对爵士乐等复杂音乐语境的适应性。算法分为“模态阶段”和“音调阶段”。模态阶段为每个小节确定可能的最优局部调式;音调阶段则利用这些局部调式作为约束,最终确定全局调号和所有音符的拼写。在7个涵盖爵士、民谣和古典风格的数据集上的评估表明,PSE的性能显著优于MuseScore的内置功能,并在多数古典音乐数据集上达到或超过了PKspell等数据驱动方法的水平。 🔗 开源详情 代码: 论文中给出了两个用于获取评估结果的GitHub仓库链接: 爵士数据集评估输出:https://github.com/florento/PSjazzEval 古典数据集评估输出:https://github.com/florento/PSEval 论文中描述了算法的C++实现(17k行代码)及Python绑定(基于pybind11),但未明确提供核心算法源代码的独立开源仓库链接。 模型权重:论文中未提及。 数据集:论文评估使用了以下7个数据集,部分数据集的获取方式如下: Real Book:200首爵士标准曲总谱(MusicXML格式)。论文未提供直接下载链接。 Charlie Parker Omnibook:50首中音萨克斯独奏转录(MusicXML格式)。论文未提供直接下载链接。 FiloBass:48首验证过的爵士贝斯线转录(MusicXML格式,公开可用)。论文引用了其来源论文:Riley, X., Dixon, S.: Filobass: A dataset and corpus based study of jazz basslines. In: 24th Int. Society for Music Information Retrieval Conference (ISMIR) (2023)。 The Session:从在线社区数据库提取的62首传统曲调子集(原始ABC格式转换为MusicXML)。在线数据库地址:https://thesession.org。 ASAP:从222首钢琴曲的ASAP数据集中选取的5个子语料库(MusicXML格式)。论文引用了其来源论文:Foscarin, F., Mcleod, A., Rigaux, P., Jacquemard, F., Sakai, M.: ASAP: A dataset of aligned scores and performances for piano transcription. In: ISMIR (2020)。 DCML Schumann Kinderszenen:由EPFL数字与认知音乐学实验室提供的13首短曲总谱(MusicXML格式)。论文引用了其来源:Hentschel, J., et al.: An annotated corpus of tonal piano music from the long 19th century. (2024)。 Lamarque-Goudard:来自节奏教科书《D’un Rythme à l’Autre》的250个音乐片段(MusicXML格式)。论文未提供直接下载链接。 Demo:论文中未提及。 复现材料:论文在第5.1节提到了评估方法,使用了Music21工具解析MusicXML文件,并生成带有颜色编码拼写差异、原始拼写、估计的局部调性和全局调性标记的输出XML分数。这些输出文件可在上述GitHub仓库中找到。论文未单独提供检查点或详细的训练配置文件。 论文中引用的开源项目: Music21:用于解析和比较MusicXML乐谱的Python工具包。论文中提供了项目主页链接:https://github.com/cuthbertLab/music21。 MuseScore:用于基准比较的乐谱编辑软件。论文中提供了项目主页链接:https://musescore.org。 PKSpell:用于基准比较的数据驱动音高拼写和调号估计模型。论文引用了其来源论文:Foscarin, F., et al.: PKSpell: Data-driven pitch spelling and key signature estimation. In: ISMIR (2021)。 Krumhansl-Schmuckler (K-S) key-finding model:用于基准比较的调性查找算法。论文中未提供具体实现代码链接,仅引用了理论文献。 FiloBass 与 FiloSax 数据集:在基准比较中提及。论文中给出了FiloBass的来源论文,FiloSax的来源论文为:Foster, D., Dixon, S.: A dataset of annotated jazz saxophone recordings. In: ISMIR (2021)。 The Session 在线数据库:论文中提供了网站链接:https://thesession.org。 ASAP 数据集:论文中给出了来源论文链接(见数据集部分)。 🏗️ 方法概述和架构 本文提出的方法(PSE)旨在解决给定MIDI音高序列和小节边界信息时,自动推导音符拼写(Pitch Spelling)、全局调号(Key Signature)和每小节局部调式(Local Scale)的问题。该问题被建模为一个两阶段的联合优化过程,核心思想是遵循西方乐谱记谱惯例,通过最小化印刷变音记号的数量来寻找最优解。 ...