Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

📄 Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset 标签:#音乐转录 #Transformer #预训练 #数据集 #基准测试 7.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐转录 | #Transformer | #预训练 #数据集 | arxiv 👥 作者与机构 第一作者:Eoin Cummins(University College Dublin) 通讯作者:Yaolong Ju(Great Bay University),电子邮箱:juyaolong@gbu.edu.cn 作者列表:Eoin Cummins(University College Dublin)、Zhongyi Huang(Guangxi Normal University)、Alexandre D’Hooge(Great Bay University)、Zhuoro Mo(Shenzhen University)、Yaolong Ju(Great Bay University) 💡 毒舌点评 SheetSage-A2S 数据集本身是 A2S 走向流行音乐真实录音的重要资产,61 小时、9,468 个片段的规模填补了该方向的数据空白;但模型侧本质是“换预训练编码器 + 扩大 FFN + 数据增强”的组合,实验虽然完整,却既未量化 MuQ 预训练数据与评估集的潜在重叠,也未与 MERT/MusicFM 等其他音乐基础模型做公平对比,因此“MuQ 是合适选择”的结论仍缺乏足够说服力。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 717 words

A Dual Evaluation for Music Transcription

📄 A Dual Evaluation for Music Transcription 标签:#音乐转录 #自监督学习 #多模态模型 #音频理解 #Transformer 7.7/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐转录 | #自监督学习 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Ping Wang(华盛顿大学;按署名顺序为第一作者) 作者列表: Ping Wang(华盛顿大学) Guang Yang(华盛顿大学) Nazif Can Tamer(华盛顿大学) Victoria Ebert(华盛顿大学) Noah A. Smith(华盛顿大学和艾伦人工智能研究所) 通讯作者:论文未明确标注通讯作者 💡 毒舌点评 这项工作的核心贡献在于把“转录质量”拆成“书面记谱”和“播放感知”两个正交维度,并通过大规模人类 ABX 实验确认了 CLEWS 这一最便宜的自动指标恰好在人类偏好上相关性最高,这一发现具有很高的实用价值。但整套评估始终以西方古典钢琴独奏、前三分钟片段为边界,所谓“dual evaluation”能否迁移到乐队、人声或非古典风格,论文既没有证据也没有给出令人信服的理论预期;同时,记谱侧从未用真人读谱或编辑工时做验证,OMR-NED 衡量的仍只是“符号层面的编辑距离”。这使论文更像一份高质量但边界明确的评估基准,而非已经确立的通用 AMT 评估范式。 ...

2026-08-06 · 更新于 2026-08-14 · 2 min · 408 words

Multi-Task Multi-Frame Visual Piano Transcription

📄 Multi-Task Multi-Frame Visual Piano Transcription 标签:#音乐转录 #多任务学习 #音频理解 #Transformer #模型评估 8.8/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 🔥 8.8/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐转录 | #多任务学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Yonghyun Kim(未说明) 通讯作者:未说明 作者列表:Yonghyun Kim(未说明)、Hoyeol Sohn(未说明)、Juhan Nam(未说明)、Alexander Lerch(未说明) 💡 毒舌点评 这篇论文用一套干净的多任务多帧方案首次把视觉钢琴转录的 offset 和 velocity 做到了实用水平,消融实验也把每个设计选择的贡献分析得很透彻,代码和模型全部开源,诚意十足。但跨数据集泛化能力几乎为零,暴露出对固定几何预处理的过度依赖,若未来不解决键盘归一化泛化问题,这个系统只能活在实验室里。 📌 核心摘要 现有视觉钢琴转录(VPT)方法仅关注短窗口(≤0.2秒)内的音符起音,忽略物理键释放(offset)和力度(velocity),且音频转录中踏板造成的误报问题在视觉模态本可解决却未被利用。本文提出 V2N,一个完整的多任务视觉钢琴转录系统,使用共享 Conformer 纯卷积时序骨干网络并行预测起音、放键、按键保持和 velocity,并在每帧都施加监督而非仅在窗口中心。方法核心包括:ResNet-18 视觉前端、三个 Conformer ConvModule 块组成的纯卷积时序骨干、四个并行 BiLSTM 任务头,以及 offset 引导的音符解码策略。在 PianoVAM 和 R3 数据集上,V2N 在起音 F1 上追平或超越所有已有 VPT 系统(PianoVAM 94.7% @50ms,R3s 91.7% @100ms),并在 offset 相关指标上实现数倍的提升(+Off:PianoVAM 45.9%→89.5% @50ms),同时首次给出完整的 note-level velocity F1。消融实验证实多任务训练、多帧 loss、序列建模和长时上下文各自带来稳定增益。主要局限在于跨数据集几何泛化完全失败,且未预测延音踏板。 ...

2026-08-05 · 更新于 2026-08-14 · 5 min · 913 words

Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

📄 Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion 标签:#音乐转录 #扩散模型 #生成模型 #音频理解 #Transformer 6.8/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #扩散模型 | #生成模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Wei-Han Hsu(论文中未提供机构信息) 通讯作者:未说明 作者列表:Wei-Han Hsu、Chih-Cheng Chang、Bo-Yu Chen、Li Su、Yi-Hsuan Yang(所有作者均未在论文中提供机构信息,致谢部分提及台湾国科会及教育部资助项目) 💡 毒舌点评 这篇论文试图用潜扩散生成五类鼓 stem 完成“分离-检测”转录,想法讨巧且对制作场景友好,额外“白送”的可编辑音轨是个卖点。但扩散推理慢、hi-hat 与 cymbal 分离仍是糊涂账,且转录性能全面落后于端到端 SOTA,只敢在 kick/snare 两个子集上说自己“有优势”。实验设计上缺少对推理速度和实际听感的严格评估,让生成式前端的实用价值打了折扣。 ...

2026-08-04 · 更新于 2026-08-14 · 4 min · 837 words

Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

📄 Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription 标签:#音乐转录 #自回归模型 #低资源 #模型评估 #音频理解 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #自回归模型 | #低资源 #模型评估 | arxiv 👥 作者与机构 第一作者:Ting-Kai Hsu(国立台湾大学通信工程研究所) 通讯作者:未说明 作者列表:Ting-Kai Hsu(国立台湾大学通信工程研究所)、Wei-Chin Wang(国立台湾大学电机工程学系)、Kai-Xi Hong(国立台湾大学电机工程学系)、Yu-Hua Chen(国立台湾大学网络与多媒体研究所) 💡 毒舌点评 这篇论文在解码器目标端显式加入NOTE_ON/OFF事件,让transformer直接建模音符边界,这一设计直观有效,尤其在小样本Leduc数据集上避免了灾难性过拟合,97.57个百分点的提升确实亮眼。但文章仅与一个重训的Fretting Transformer比较,既没有和MIDI-to-Tab等近期序列标注方法交手,也缺少对NOTE_ON、NOTE_OFF、正则化等组件各自的消融实验,实验说服力大打折扣。承诺开源但代码未落地,优化器、学习率、batch size等核心训练配置全部缺失,复现基本靠猜。 ...

2026-07-30 · 更新于 2026-08-14 · 2 min · 369 words

Music-JEPA: Learning a World Model of Sound from Action

📄 Music-JEPA: Learning a World Model of Sound from Action 标签:#音乐转录 #自监督学习 #音频理解 #Transformer #模型评估 6.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #自监督学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Ziyu Wang (未说明) 通讯作者:未说明 作者列表:Ziyu Wang (未说明)、Kun Fang (未说明)、Yann LeCun (未说明) 注:原文未明确标注作者具体所属机构。根据Yann LeCun的常见单位和论文致谢信息推断,其隶属于New York University / Meta AI,但论文本身未在作者列表中明确标出。 💡 毒舌点评 本文以“动作条件”为Music-JEPA注入了一个清晰的物理直觉——钢琴声就是演奏动作的产物。然而,它目前仍是一颗精致的纽扣:只在MAESTRO这一个古典钢琴独奏的封闭花园里跳舞,规划出的音符虽然连贯,却远不如专门的有监督转录模型精确,离真实世界音乐的无标注、多乐器、非结构化动作还有漫长的距离。更遗憾的是,论文承诺的代码和模型至今杳无音信,这让它的可复现性大打折扣。 ...

2026-07-27 · 更新于 2026-08-14 · 3 min · 612 words

Fretiq: Browser-Native Electric Guitar String Classification via Engineered Spectral Features and Held-Out Free-Play Evaluation

📄 Fretiq: Browser-Native Electric Guitar String Classification via Engineered Spectral Features and Held-Out Free-Play Evaluation 标签:#音频分类 #音乐转录 #流式处理 #实时处理 #音频理解 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.9/1 | 影响 0.7/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.5/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音频分类 | #音乐转录 | #流式处理 #实时处理 | arxiv 👥 作者与机构 第一作者:Aadi Garg(California Polytechnic State University, San Luis Obispo, Department of Physics) 通讯作者:未说明(邮箱 agarg35@calpoly.edu 提供但未标注通讯作者) 作者列表:Aadi Garg(California Polytechnic State University, San Luis Obispo, Department of Physics) 💡 毒舌点评 这篇论文最大的优点是极其诚实——作者主动报告了97.1%验证准确率与87.8%自由演奏准确率之间的巨大差距,坦承比较训练方法“对某些弦对反而更差”,甚至记录了两次关键的工程失败模式,这种透明度在同级别工作中罕见。然而,核心方法就是MFCC加一个两层全连接网络,这在2025年甚至不算是一个值得单独报告的模型架构;当一个如此简单的模型在验证集上达到97%时,审稿人更应该质疑的是数据泄漏或评估设置的问题,而不是庆祝这个数字本身。 ...

2026-07-22 · 更新于 2026-08-14 · 2 min · 384 words

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

📄 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 标签:#音乐转录 #基准测试 #音乐理解 #数据集 #音频理解 7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 ✅ 7.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐转录 | #基准测试 | #音乐理解 #数据集 | arxiv 👥 作者与机构 第一作者:Nathan Pruyne(Carnegie Mellon University, Language Technologies Institute) 通讯作者:未说明 作者列表:Nathan Pruyne(Carnegie Mellon University, Language Technologies Institute)、Benjamin Stoler(未说明)、William Chen(未说明)、Chien-yu Huang(Carnegie Mellon University)、Shinji Watanabe(Carnegie Mellon University)、Chris Donahue(Carnegie Mellon University, Language Technologies Institute) 💡 毒舌点评 论文精准地识别了缺乏商业流行音乐多轨转录评估基准这一痛点,并展示了构建该基准的工程野心。然而,作为一份旨在成为“黄金标准”的评估数据集,其核心弱点在于:1) 评估效用被严重限制,因为仅测试了两个模型,且它们均非针对该任务设计或训练;2) 核心产物(音频)因版权限制无法直接提供,迫使使用者依赖外部链接,极大削弱了数据集的可访问性和即刻可用性;3) 数据集本身规模很小(3.5小时),多样性虽被强调,但实际覆盖的“流行”子流派有限。这使得该工作的实际影响力远低于其宣称的意图。 ...

2026-07-10 · 更新于 2026-08-14 · 2 min · 313 words

MulTTiPop: A Multitrack Transcription Dataset for Pop Music

📄 MulTTiPop: A Multitrack Transcription Dataset for Pop Music 标签:#音乐转录 #基准测试 #音乐理解 #数据集 6.6/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐转录 | #基准测试 | #音乐理解 #数据集 | arxiv 👥 作者与机构 第一作者:Nathan Pruyne(卡内基梅隆大学) 通讯作者:未说明 作者列表:Nathan Pruyne(卡内基梅隆大学)、Benjamin Stoler(卡内基梅隆大学)、William Chen(卡内基梅隆大学)、Chien-yu Huang(卡内基梅隆大学)、Shinji Watanabe(卡内基梅隆大学)、Chris Donahue(卡内基梅隆大学) 💡 毒舌点评 论文精准命中了自动音乐转录(AMT)领域对真实商业流行音乐进行多轨转录评测基准的空白,其构建的流程(元数据匹配+节拍对齐+人工筛选)严谨且可复用,为社区提供了首个专用基准。然而,最终仅49.1%的成功率揭示了当前跨源对齐技术的根本瓶颈,而3.5小时的规模和强烈的西方音乐偏见限制了其作为通用基准的广度,使其更像是一个高质量但受限的“探路石”。 📌 核心摘要 本文旨在解决自动音乐转录(AMT)模型缺乏针对真实商业流行音乐进行多轨转录评测基准的问题。核心贡献是构建了MulTTiPop数据集,其流程包括:从Lakh MIDI数据集和TheoryTab数据集通过元数据匹配找到潜在对应的多轨MIDI和YouTube音频段;使用基于节拍的动态时间规整(DTW)对齐两者的时间轴;通过融合基线相似度、旋律匹配和YouTube时间戳等多种策略生成候选对齐锚点,最终由人工标注者选择正确的对齐。与已有数据集相比,MulTTiPop首次提供了针对真实商业流行音乐音频的多轨MIDI标注。实验评估显示,当前先进的AMT模型(MT3、YourMT3+)在此数据集上表现不佳,最佳模型的Onset F1仅为38%(精确制式)和37.87%(打击/和声制式),表明该任务存在巨大提升空间。该数据集的实际意义在于为AMT模型在复杂、真实的多轨音乐转录任务上提供了一个有挑战性的评测工具。其主要局限性在于构建成功率不高(49.1%)、数据集规模较小(3.5小时)且存在西方音乐偏见。 ...

2026-07-10 · 更新于 2026-08-14 · 2 min · 301 words

MuScriptor: An Open Model for Multi-Instrument Music Transcription

📄 MuScriptor: An Open Model for Multi-Instrument Music Transcription 标签:#音乐转录 #预训练 #强化学习 #开源工具 #基准测试 8.3/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 🔥 8.3/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐转录 | #预训练 | #强化学习 #开源工具 | arxiv 👥 作者与机构 第一作者:Simon Rouard(Meta) 通讯作者:未说明 作者列表:Simon Rouard(Meta)、Michael Krause(Meta)、Axel Roebel(Meta)、Carl-Johann Simon-Gabriel(Meta)、Alexandre Défossez(Meta) 💡 毒舌点评 论文的实质贡献在于一个高度系统化、工程化的端到端转录系统,而非单一的算法突破。其亮点是“大力出奇迹”策略——通过构建海量(145万MIDI)的合成数据集和中等规模(17万条)的带标注真实数据集,结合多阶段训练范式,并在开源模型权重上做得非常彻底,为社区提供了强大的现成工具。短板同样明显:性能的提升严重依赖于未公开、难以复现的内部数据集(𝒟Real),使得其技术路线的可推广性存疑;在强化学习后训练阶段采用了未经严格理论验证的简化GRPO算法,训练稳定性成疑;且完全回避了计算成本(GPU时长、能耗)的披露与分析,这对于评估其“开源模型”的实际可用性至关重要。 📌 核心摘要 本文旨在解决现有多乐器自动音乐转录(AMT)模型在复杂真实音乐混音中泛化能力差、实用性低的问题。 方法核心是构建名为MuScriptor的解码器-仅Transformer模型,并通过一个包含预训练、微调和强化学习后训练的多阶段流程进行训练。预训练使用大规模动态合成的MIDI-音频对(𝒟Synth),微调使用大规模带标注的真实音乐音频(𝒟Real),后训练则在人工精选的高质量子集(𝒟RL)上使用类GRPO算法进行对齐。模型支持可选的乐器条件输入以增强可控性。 主要贡献在于:发布了一个在多样化音乐风格上表现稳健的开源多乐器转录模型及其完整训练流程;系统研究了合成预训练的有效性与局限性;首次将GRPO算法应用于AMT的后训练优化;提供了乐器条件化推理功能。与MT3、YourMT3+等先前工作相比,本文重心从架构改进转向数据规模与质量。 实验结果表明,完整的MuScriptor模型(1.3B参数)在自建测试集𝒟Test上全面超越基线YourMT3+(例如,Multi F1从21.9提升至48.2),并在多个未参与训练的公开基准数据集上取得显著提升(例如,Dagstuhl ChoirSet的Frame F1从51.0提升至80.7)。消融实验证实了合成预训练在真实数据稀缺时的巨大价值(如仅用1%真实数据时Offset F1从9.9提升至33.4)以及每个训练阶段的累积增益。 本文的实际意义是为音乐信息检索社区提供了一个开箱即用的强大基线模型和工具。 主要局限包括:其tokenization方案无法表示同乐器同音高的重叠音符;模型的高性能依赖于未公开的内部数据集(𝒟Real),外部复现困难;训练和推理的计算成本未披露;RL训练算法的简化(无KL惩罚和重要性采样裁剪)可能带来稳定性风险;缺乏主观听觉评估。 🔗 开源详情 代码:https://github.com/muscriptor/muscriptor 模型权重:已开源(通过上述GitHub仓库发布)。 数据集:未开源。 𝒟Synth:约145万个MIDI文件,来源包括公开(如Lakh MIDI)和商业数据,未提供下载链接。 𝒟Real:17万个真实音乐录音(约11,000小时)及对齐的音符标注,为内部数据集,未公开。 𝒟RL:从𝒟Real中筛选的300首高质量曲目。 𝒟Test:从𝒟Real中筛选的372首高质量曲目。 Demo:未提及。 复现材料:提供了代码、模型权重和主要训练超参数,但缺少完整的训练检查点、用于数据构建的脚本/阈值、以及训练资源信息。 🏗️ 方法概述和架构 本文构建了一个端到端的多乐器音乐转录系统,其核心是将音乐转录任务转化为序列到序列的语言建模问题。系统接收一个5秒单声道音频波形(16kHz)作为输入,输出一段代表该片段内所有乐器音符事件的离散token序列(类MIDI表示)。 ...

2026-07-10 · 更新于 2026-08-14 · 3 min · 551 words