MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques
📄 MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques 标签:#音频质量评估 #音频大模型 #SFT #强化学习 #音乐生成 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频质量评估 | #音频大模型 | #SFT #强化学习 | arxiv 👥 作者与机构 第一作者:Jiabao Zhuang(复旦大学 Fudan NLP Group) 并列一作:Changhao Jiang、Hanchen Wang、Jiahao Chen、Zhixiong Yang、Zhenghao Xiang(均复旦大学 Fudan NLP Group) 通讯作者:Tao Gui(复旦大学 Fudan NLP Group) 作者列表:Jiabao Zhuang(复旦大学 Fudan NLP Group)、Changhao Jiang(复旦大学 Fudan NLP Group)、Hanchen Wang(复旦大学 Fudan NLP Group)、Jiahao Chen(复旦大学 Fudan NLP Group)、Zhixiong Yang(复旦大学 Fudan NLP Group)、Zhenghao Xiang(复旦大学 Fudan NLP Group)、Yifei Cao(复旦大学 Fudan NLP Group)、Jiajun Sun(复旦大学 Fudan NLP Group)、Hui Li(复旦大学 Fudan NLP Group)、Ming Zhang(复旦大学 Fudan NLP Group)、Tao Ji(复旦大学 Fudan NLP Group)、Tao Gui(复旦大学 Fudan NLP Group,通讯作者)、Qi Zhang(复旦大学 Fudan NLP Group)、Xuanjing Huang(复旦大学 Fudan NLP Group) 💡 毒舌点评 把文本生成式奖励模型里的“先写 critique 再打分”范式迁移到长歌曲多维度美学评估,并用自生成 critique 缓解训练/推理分布偏移,这一点做得比较完整,消融证据也清楚。但整体新颖性更接近领域迁移而非本质突破,且 Music Arena 相对 SongEval 的领先只有 0.55 个百分点,没有统计显著性或多 seed 验证,下游 GRPO 效果也缺少人类听感评估来兜底。人工 critique 审核的样本量、接受率与一致性均未量化,进一步削弱了数据构建可靠性。 ...