Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping
📄 Do Text-to-Music Models Really Follow Instructions? A Counterfactual Evaluation of Key and Beat Grouping 标签:#音乐生成 #生成模型 #模型评估 #基准测试 6.8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐生成 | #生成模型 | #模型评估 #基准测试 | arxiv 👥 作者与机构 第一作者:Yining Wang(单位未说明) 通讯作者:未说明 作者列表:Yining Wang(单位未说明) 💡 毒舌点评 这篇工作用 matched neutral–A–B 三元组把“模型本来就常生成该目标”与“指令让模型改出来”拆开,直击音乐生成评测里长期被忽略的 base-rate 混淆;Stable Audio 3 四拍从 96.9% 掉到 56.3% 的反直觉结果尤其有说服力。短板是基准范围较窄,关键识别器在真实音乐上的绝对准确率不算高,自动指标与人类标注之间的偏差让部分精确数值只能作为趋势而非定论。 ...