Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training
📄 Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training #音乐生成 #预训练 #自监督学习 #Transformer #SFT 8.1/10 | 创新 1.1/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8.1/10 | 前25% | #音乐生成 | #预训练 | #自监督学习 #Transformer | arxiv 👥 作者与机构 第一作者:Hong-Jie You(南京大学 计算机软件新技术国家重点实验室、人工智能学院) 通讯作者:Yu-Feng Li(南京大学 计算机软件新技术国家重点实验室、人工智能学院) 作者列表:Hong-Jie You(南京大学)、Jie-Jing Shao(南京大学 人工智能学院)、Xiao-Wen Yang(南京大学 人工智能学院)、Lin-Han Jia(南京大学 人工智能学院)、Lan-Zhe Guo(南京大学 智能科学与技术学院)、Yu-Feng Li(南京大学 人工智能学院) 💡 毒舌点评 本文将一个在NLP/CV中已被验证的预训练范式成功迁移到钢琴演奏渲染这一小众领域,并用漂亮的客观/主观双料SOTA数据说明了其有效性,故事逻辑完整。但“范式转变”的帽子扣得略大,本质上仍是“Masked Token Prediction + SFT”的标准配方,且10B-token预训练带来的性能增益在消融中仅依赖“有/无预训练”的二值比较,缺乏更细致的scaling law分析,使得“10B”这个数字更像一个资源配置的结果而非深刻的科学洞察。局限性讨论过于温和,对为何在踏板维度上未能全面领先SOTA避而不谈。 ...