MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations
📄 MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations #音乐理解 #数据集 #基准测试 #对比学习 #多模态模型 8.1/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #音乐理解 | #对比学习 | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:Sirui Zhang(中央音乐学院、北京通用人工智能研究院) 通讯作者:Duo Xu(天津音乐学院、北京通用人工智能研究院)、Xin Jin(北京电子科技学院、北京通用人工智能研究院)、Feng Yu(中央音乐学院、北京通用人工智能研究院)、Songchun Zhu(北京大学、北京通用人工智能研究院) 作者列表:Sirui Zhang(中央音乐学院、北京通用人工智能研究院)、Tianle Wang(中央音乐学院、北京通用人工智能研究院)、Xinyi Tong(中央音乐学院、北京通用人工智能研究院)、Peiyang Yu(中央音乐学院、北京通用人工智能研究院)、Jishang Chen(中央音乐学院、北京通用人工智能研究院)、Liangke Zhao(中央音乐学院、北京通用人工智能研究院)、Haoxin Zhang(中央音乐学院、北京通用人工智能研究院)、Duo Xu(天津音乐学院、北京通用人工智能研究院)、Xin Jin(北京电子科技学院、北京通用人工智能研究院)、Feng Yu(中央音乐学院、北京通用人工智能研究院)、Songchun Zhu(北京大学、北京通用人工智能研究院) 💡 毒舌点评 该工作为音乐美学评估贡献了目前最大规模、最细粒度的专业标注基准,多维度框架与多标注者设计很有诚意,显著超越了现有MusicEval/SongEval等数据集。然而,基准实验仅停在轻量回归和零样本LLM预测,缺乏精心设计的专用美学模型对比,且训练超参数几乎完全不公开,削弱了其作为“benchmark”的深度说服力。CLAP的语义适应增益微弱,暴露了当前音文对齐模型在捕捉细粒度美学信号上的根本性局限,而论文对此并未提出有效的解决方案。 ...