TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data

📄 不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer 英文题目:TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data 一句话:为破解音频到乐谱转录长期缺真实配对数据的困境,TUTTI 用 NotaGen 生成 36 万对合成音频-ABC 乐谱预训练纯 Transformer 编码器-解码器,再在真实数据上微调,在钢琴与弦乐四重奏上超越专用基线并零样本泛化到未见过的萨克斯,代价是评估仍限于 14.8 秒切块且合成到真实的域差距未被量化。 标签:#音乐转录 | #预训练 | #Transformer | #数据集 | #迁移学习 评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jianhuai Hu:机构信息未在 arXiv HTML 中可靠披露 Yashan Wang:机构信息未在 arXiv HTML 中可靠披露 Shangda Wu:机构信息未在 arXiv HTML 中可靠披露 Zhancheng Guo:机构信息未在 arXiv HTML 中可靠披露 Shijie Liang:机构信息未在 arXiv HTML 中可靠披露 Wuna Meng:机构信息未在 arXiv HTML 中可靠披露 Chuanqi Yang:机构信息未在 arXiv HTML 中可靠披露 Xiaobing Li:机构信息未在 arXiv HTML 中可靠披露 Feng Yu:机构信息未在 arXiv HTML 中可靠披露 Maosong Sun:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用 NotaGen 生成的 363610 对合成数据把数据饥渴的 Transformer 硬生生喂成了跨乐器通用转录器,在弦乐四重奏等任务上把总分从 84.9 拉到 95.6 的提升是实打实的。短板是整套流水线对合成到真实的域差距缺乏量化分析,EPR 与 SFZ 渲染的真实性未经听感或声学指标验证,且声称开源的 TuttiCorpus 与代码在截稿时仍为承诺状态。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1563 words

Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models

📄 同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹 英文题目:Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models 一句话:针对吉他同一音高对应多弦品位置的歧义,Noise2Fret 把离散指板谱嵌入连续空间做条件扩散去噪,并以五项可微音乐物理损失联合约束,在 GuitarSet 与 GOAT 上同时提升音高与指板 F 值并保持 0.67 实时因子,代价是仍局限于标准调弦短窗干净录音。 标签:#音乐转录 #扩散模型 #多任务学习 #高效推理 评分:8.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Riccardo Simionato:Univ. Bordeaux;CNRS, Bordeaux INP, LaBRI;Talence, France Louis Bigo:Univ. Bordeaux;CNRS, Bordeaux INP, LaBRI;Talence, France 💬 毒舌点评 把离散指板选择搬进连续扩散空间并用五项可微音乐物理损失做软约束,思路比统计共现抑制更可解释,且在 GOAT 上的召回与可演奏性平衡确有说服力。短板是 100 ms 窗口与事件级聚合的时序建模过短、评测仍局限于标准调弦的干净录音,且对圆圈五度等较弱先验缺乏统计显著性与真实演奏容错分析。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1430 words

Weakly Supervised Tabla Stroke Transcription via an Adaptive Dynamic Rhythm Language Model (ADRM)

📄 只给顺序不给时间:用会遗忘的节奏记忆补上塔布拉转录的弱监督缺口 英文题目:Weakly Supervised Tabla Stroke Transcription via an Adaptive Dynamic Rhythm Language Model (ADRM) 一句话:为解决塔布拉逐点对齐标注昂贵的问题,论文用 CTC 声学模型生成候选格,再以全局塔拉统计与局部指数遗忘记忆互补的 ADRM 做离线重打分,在四套数据上将符号错误率相对降低约 19% 至 35%,代价是毫秒级定位仍弱且依赖格的质量。 标签:#音乐转录 #RNN #音乐理解 #自监督学习 #数据集 评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Rahul Bapusaheb Kodag:机构信息未在 arXiv HTML 中可靠披露 Vipul Arora:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把自动语音识别(Automatic Speech Recognition,ASR)中连接时序分类(Connectionist Temporal Classification,CTC)+ 语言模型重打分的老套路完整搬到弱监督塔布拉鼓点转录(Tabla Stroke Transcription,TST)上,并用全局先验与局部自适应狄利克雷模型做出可解释的节奏约束,相对误码率(Stroke Error Rate,SER)下降 30% 左右是实打实的。短板是声学模型仍是 12 层卷积因子化时延神经网络(Convolutional Factorized Time-Delay Neural Network,C-TDNN-F)这种 ASR 古董,时序对齐 F1 在 50 ms 容差下仅 8.9% 却敢称可恢复时序,且所谓新数据集表演即兴数据集(Tabla Improvisation Dataset,TID)仅 133 分钟单人单鼓录制,泛化说服力有限。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1245 words

Automatic Transcription of Microtonal Free-Rhythm Vocal Music: A Case Study in Iranian Classical Music

📄 Automatic Transcription of Microtonal Free-Rhythm Vocal Music: A Case Study in Iranian Classical Music 标签:#音乐转录 #音乐理解 #低资源 #开源工具 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 7.5/10 | 前25% | 文档类型:应用研究 | 评分置信度:高 | #音乐转录 | #开源工具 | #音乐理解 #低资源 | arxiv 👥 作者与机构 第一作者:Sepideh Shafiei(Cu Test Inc.) 合作者:Shapour Hakam、Harsh Dange、Joel Rodriguez Caraballo。 💡 毒舌点评 论文最有价值的地方不是宣称“解决了自动转录”,而是承认伊朗古典声乐不能被西方十二平均律的单一量化框架抹平。pitch histogram 加 DTW 的组合能让研究者看见旋律骨架和 tahrir 装饰,但案例数和误差报告仍不足;目前更像一个可操作的文化遗产工具原型,而不是成熟的 AMT benchmark。具体到证据强度:这是一项案例研究,歌手与样本数量有限,pYIN 的八度错误和弱伴奏噪声会一路传导进峰检测与 DTW;tahrir 装饰的边界判定仍依赖专家人工规则。缺少统一的音符级标注评测、跨流派对照和真实用户研究,意味着它离可度量的文化保护基础设施还差关键一步。 ...

2026-08-19 · 更新于 2026-09-04 · 2 min · 418 words

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

📄 Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset 标签:#音乐转录 #Transformer #预训练 #数据集 #基准测试 7.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐转录 | #Transformer | #预训练 #数据集 | arxiv 👥 作者与机构 第一作者:Eoin Cummins(University College Dublin) 通讯作者:Yaolong Ju(Great Bay University),电子邮箱:juyaolong@gbu.edu.cn 作者列表:Eoin Cummins(University College Dublin)、Zhongyi Huang(Guangxi Normal University)、Alexandre D’Hooge(Great Bay University)、Zhuoro Mo(Shenzhen University)、Yaolong Ju(Great Bay University) 💡 毒舌点评 SheetSage-A2S 数据集本身是 A2S 走向流行音乐真实录音的重要资产,61 小时、9,468 个片段的规模填补了该方向的数据空白;但模型侧本质是“换预训练编码器 + 扩大 FFN + 数据增强”的组合,实验虽然完整,却既未量化 MuQ 预训练数据与评估集的潜在重叠,也未与 MERT/MusicFM 等其他音乐基础模型做公平对比,因此“MuQ 是合适选择”的结论仍缺乏足够说服力。 ...

2026-08-07 · 更新于 2026-09-04 · 4 min · 717 words

A Dual Evaluation for Music Transcription

📄 A Dual Evaluation for Music Transcription 标签:#音乐转录 #自监督学习 #多模态模型 #音频理解 #Transformer 7.7/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐转录 | #自监督学习 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Ping Wang(华盛顿大学;按署名顺序为第一作者) 作者列表: Ping Wang(华盛顿大学) Guang Yang(华盛顿大学) Nazif Can Tamer(华盛顿大学) Victoria Ebert(华盛顿大学) Noah A. Smith(华盛顿大学和艾伦人工智能研究所) 通讯作者:论文未明确标注通讯作者 💡 毒舌点评 这项工作的核心贡献在于把“转录质量”拆成“书面记谱”和“播放感知”两个正交维度,并通过大规模人类 ABX 实验确认了 CLEWS 这一最便宜的自动指标恰好在人类偏好上相关性最高,这一发现具有很高的实用价值。但整套评估始终以西方古典钢琴独奏、前三分钟片段为边界,所谓“dual evaluation”能否迁移到乐队、人声或非古典风格,论文既没有证据也没有给出令人信服的理论预期;同时,记谱侧从未用真人读谱或编辑工时做验证,OMR-NED 衡量的仍只是“符号层面的编辑距离”。这使论文更像一份高质量但边界明确的评估基准,而非已经确立的通用 AMT 评估范式。 ...

2026-08-06 · 更新于 2026-09-04 · 2 min · 408 words

Multi-Task Multi-Frame Visual Piano Transcription

📄 Multi-Task Multi-Frame Visual Piano Transcription 标签:#音乐转录 #多任务学习 #音频理解 #Transformer #模型评估 8.8/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 🔥 8.8/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音乐转录 | #多任务学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Yonghyun Kim(未说明) 通讯作者:未说明 作者列表:Yonghyun Kim(未说明)、Hoyeol Sohn(未说明)、Juhan Nam(未说明)、Alexander Lerch(未说明) 💡 毒舌点评 这篇论文用一套干净的多任务多帧方案首次把视觉钢琴转录的 offset 和 velocity 做到了实用水平,消融实验也把每个设计选择的贡献分析得很透彻,代码和模型全部开源,诚意十足。但跨数据集泛化能力几乎为零,暴露出对固定几何预处理的过度依赖,若未来不解决键盘归一化泛化问题,这个系统只能活在实验室里。 📌 核心摘要 现有视觉钢琴转录(VPT)方法仅关注短窗口(≤0.2秒)内的音符起音,忽略物理键释放(offset)和力度(velocity),且音频转录中踏板造成的误报问题在视觉模态本可解决却未被利用。本文提出 V2N,一个完整的多任务视觉钢琴转录系统,使用共享 Conformer 纯卷积时序骨干网络并行预测起音、放键、按键保持和 velocity,并在每帧都施加监督而非仅在窗口中心。方法核心包括:ResNet-18 视觉前端、三个 Conformer ConvModule 块组成的纯卷积时序骨干、四个并行 BiLSTM 任务头,以及 offset 引导的音符解码策略。在 PianoVAM 和 R3 数据集上,V2N 在起音 F1 上追平或超越所有已有 VPT 系统(PianoVAM 94.7% @50ms,R3s 91.7% @100ms),并在 offset 相关指标上实现数倍的提升(+Off:PianoVAM 45.9%→89.5% @50ms),同时首次给出完整的 note-level velocity F1。消融实验证实多任务训练、多帧 loss、序列建模和长时上下文各自带来稳定增益。主要局限在于跨数据集几何泛化完全失败,且未预测延音踏板。 ...

2026-08-05 · 更新于 2026-09-04 · 5 min · 913 words

Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

📄 Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion 标签:#音乐转录 #扩散模型 #生成模型 #音频理解 #Transformer 6.8/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #扩散模型 | #生成模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Wei-Han Hsu(论文中未提供机构信息) 通讯作者:未说明 作者列表:Wei-Han Hsu、Chih-Cheng Chang、Bo-Yu Chen、Li Su、Yi-Hsuan Yang(所有作者均未在论文中提供机构信息,致谢部分提及台湾国科会及教育部资助项目) 💡 毒舌点评 这篇论文试图用潜扩散生成五类鼓 stem 完成“分离-检测”转录,想法讨巧且对制作场景友好,额外“白送”的可编辑音轨是个卖点。但扩散推理慢、hi-hat 与 cymbal 分离仍是糊涂账,且转录性能全面落后于端到端 SOTA,只敢在 kick/snare 两个子集上说自己“有优势”。实验设计上缺少对推理速度和实际听感的严格评估,让生成式前端的实用价值打了折扣。 ...

2026-08-04 · 更新于 2026-09-04 · 4 min · 837 words

Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription

📄 Explicit Note-Event Tokenization and Pitch-Validity Constrained Decoding for MIDI-to-Tablature Transcription 标签:#音乐转录 #自回归模型 #低资源 #模型评估 #音频理解 6.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #自回归模型 | #低资源 #模型评估 | arxiv 👥 作者与机构 第一作者:Ting-Kai Hsu(国立台湾大学通信工程研究所) 通讯作者:未说明 作者列表:Ting-Kai Hsu(国立台湾大学通信工程研究所)、Wei-Chin Wang(国立台湾大学电机工程学系)、Kai-Xi Hong(国立台湾大学电机工程学系)、Yu-Hua Chen(国立台湾大学网络与多媒体研究所) 💡 毒舌点评 这篇论文在解码器目标端显式加入NOTE_ON/OFF事件,让transformer直接建模音符边界,这一设计直观有效,尤其在小样本Leduc数据集上避免了灾难性过拟合,97.57个百分点的提升确实亮眼。但文章仅与一个重训的Fretting Transformer比较,既没有和MIDI-to-Tab等近期序列标注方法交手,也缺少对NOTE_ON、NOTE_OFF、正则化等组件各自的消融实验,实验说服力大打折扣。承诺开源但代码未落地,优化器、学习率、batch size等核心训练配置全部缺失,复现基本靠猜。 ...

2026-07-30 · 更新于 2026-09-04 · 2 min · 369 words

Music-JEPA: Learning a World Model of Sound from Action

📄 Music-JEPA: Learning a World Model of Sound from Action 标签:#音乐转录 #自监督学习 #音频理解 #Transformer #模型评估 6.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #自监督学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Ziyu Wang (未说明) 通讯作者:未说明 作者列表:Ziyu Wang (未说明)、Kun Fang (未说明)、Yann LeCun (未说明) 注:原文未明确标注作者具体所属机构。根据Yann LeCun的常见单位和论文致谢信息推断,其隶属于New York University / Meta AI,但论文本身未在作者列表中明确标出。 💡 毒舌点评 本文以“动作条件”为Music-JEPA注入了一个清晰的物理直觉——钢琴声就是演奏动作的产物。然而,它目前仍是一颗精致的纽扣:只在MAESTRO这一个古典钢琴独奏的封闭花园里跳舞,规划出的音符虽然连贯,却远不如专门的有监督转录模型精确,离真实世界音乐的无标注、多乐器、非结构化动作还有漫长的距离。更遗憾的是,论文承诺的代码和模型至今杳无音信,这让它的可复现性大打折扣。 ...

2026-07-27 · 更新于 2026-09-04 · 3 min · 612 words