TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data
📄 不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer 英文题目:TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data 一句话:为破解音频到乐谱转录长期缺真实配对数据的困境,TUTTI 用 NotaGen 生成 36 万对合成音频-ABC 乐谱预训练纯 Transformer 编码器-解码器,再在真实数据上微调,在钢琴与弦乐四重奏上超越专用基线并零样本泛化到未见过的萨克斯,代价是评估仍限于 14.8 秒切块且合成到真实的域差距未被量化。 标签:#音乐转录 | #预训练 | #Transformer | #数据集 | #迁移学习 评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jianhuai Hu:机构信息未在 arXiv HTML 中可靠披露 Yashan Wang:机构信息未在 arXiv HTML 中可靠披露 Shangda Wu:机构信息未在 arXiv HTML 中可靠披露 Zhancheng Guo:机构信息未在 arXiv HTML 中可靠披露 Shijie Liang:机构信息未在 arXiv HTML 中可靠披露 Wuna Meng:机构信息未在 arXiv HTML 中可靠披露 Chuanqi Yang:机构信息未在 arXiv HTML 中可靠披露 Xiaobing Li:机构信息未在 arXiv HTML 中可靠披露 Feng Yu:机构信息未在 arXiv HTML 中可靠披露 Maosong Sun:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用 NotaGen 生成的 363610 对合成数据把数据饥渴的 Transformer 硬生生喂成了跨乐器通用转录器,在弦乐四重奏等任务上把总分从 84.9 拉到 95.6 的提升是实打实的。短板是整套流水线对合成到真实的域差距缺乏量化分析,EPR 与 SFZ 渲染的真实性未经听感或声学指标验证,且声称开源的 TuttiCorpus 与代码在截稿时仍为承诺状态。 ...