📄 MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations
#音乐理解 #数据集 #基准测试 #对比学习 #多模态模型
8.1/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5
🔥 8.1/10 | 前25% | #音乐理解 | #对比学习 | #数据集 #基准测试 | arxiv
👥 作者与机构
- 第一作者:Sirui Zhang(中央音乐学院、北京通用人工智能研究院)
- 通讯作者:Duo Xu(天津音乐学院、北京通用人工智能研究院)、Xin Jin(北京电子科技学院、北京通用人工智能研究院)、Feng Yu(中央音乐学院、北京通用人工智能研究院)、Songchun Zhu(北京大学、北京通用人工智能研究院)
- 作者列表:Sirui Zhang(中央音乐学院、北京通用人工智能研究院)、Tianle Wang(中央音乐学院、北京通用人工智能研究院)、Xinyi Tong(中央音乐学院、北京通用人工智能研究院)、Peiyang Yu(中央音乐学院、北京通用人工智能研究院)、Jishang Chen(中央音乐学院、北京通用人工智能研究院)、Liangke Zhao(中央音乐学院、北京通用人工智能研究院)、Haoxin Zhang(中央音乐学院、北京通用人工智能研究院)、Duo Xu(天津音乐学院、北京通用人工智能研究院)、Xin Jin(北京电子科技学院、北京通用人工智能研究院)、Feng Yu(中央音乐学院、北京通用人工智能研究院)、Songchun Zhu(北京大学、北京通用人工智能研究院)
💡 毒舌点评
该工作为音乐美学评估贡献了目前最大规模、最细粒度的专业标注基准,多维度框架与多标注者设计很有诚意,显著超越了现有MusicEval/SongEval等数据集。然而,基准实验仅停在轻量回归和零样本LLM预测,缺乏精心设计的专用美学模型对比,且训练超参数几乎完全不公开,削弱了其作为“benchmark”的深度说服力。CLAP的语义适应增益微弱,暴露了当前音文对齐模型在捕捉细粒度美学信号上的根本性局限,而论文对此并未提出有效的解决方案。
📌 核心摘要
论文针对音乐美学自动评估中缺乏大规模、多维专业标注的问题,构建了MADB数据集:包含9999首曲目,由30名来自多所音乐学院和行业机构、拥有学士以上学位及三年以上专业训练背景的标注者,从10个感知维度(旋律感知、旋律情感、编曲感知、编曲情感、节奏感知、结构感知、表演/演唱情感、咬字/演唱技巧、演奏技巧、音效感知)及一个总体评分进行标注,并附带简短文本评论和风格/情绪标签。质量控制采用三阶段流程。在此基础上,作者构建统一回归框架,评价了MERT、MuQ、CLAP及其语义适应变体(融入评论和标签)。主要实验结果显示:MuQ在所有维度上几乎全面领先(整体LCC 0.718),MERT紧随其后,两者显著优于CLAP系模型;引入评论和标签的语义适应对CLAP的提升幅度微小(整体LCC从0.436提至0.445),表明通用音文对齐模型远未捕捉到细粒度美学特征。零样本Qwen2-Audio实验证明,文本评论本身已蕴含强美学预测信号(仅用评论LCC即达0.736),而纯音频输入预测近乎随机(LCC -0.001),加入音频的提升可忽略不计。该基准为AI音乐评估和人类偏好对齐提供了亟需的资源,但风格分布不平衡、中文评论翻译可能引入噪声,以及缺乏片段级时序标注是其主要局限。
表2:各方法在11个美学维度上的MSE、LCC、SRCC、KRCC(均值±标准差)
| 方法 | 指标 | Overall | Mel. Perc. | Mel. Emo. | Arr. Perc. | Arr. Emo. | Rhy. Perc. | Struc. Perc. | Perf/Sing Emo. | Sing Skill | Perf Skill | Sound Effect |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MERT | MSE↓ | 0.090 | 0.083 | 0.111 | 0.108 | 0.079 | 0.098 | 0.079 | 0.096 | 0.091 | 0.135 | (原文未提供) |
| MuQ | MSE↓ | 0.081 | 0.070 | 0.075 | 0.064 | 0.062 | 0.063 | 0.081 | 0.076 | 0.075 | 0.074 | 0.097 |
| CLAP | MSE↓ | 0.109±0.001 | 0.110±0.005 | 0.121±0.009 | 0.125±0.006 | 0.123±0.010 | 0.103±0.005 | 0.101±0.008 | 0.135±0.004 | 0.145±0.006 | 0.121±0.004 | 0.158±0.007 |
| CLAP+C | MSE↓ | 0.108±0.007 | 0.111±0.005 | 0.118±0.003 | 0.123±0.008 | 0.125±0.008 | 0.105±0.003 | 0.100±0.004 | 0.134±0.005 | 0.139±0.002 | 0.123±0.002 | 0.153±0.006 |
| CLAP+C&T | MSE↓ | 0.109±0.004 | 0.109±0.006 | 0.120±0.009 | 0.120±0.008 | 0.123±0.003 | 0.097±0.003 | 0.098±0.003 | 0.134±0.008 | 0.144±0.003 | 0.121±0.005 | 0.158±0.005 |
| MERT | LCC↑ | 0.626 | 0.670 | 0.713 | 0.561 | 0.567 | 0.674 | 0.534 | 0.782 | 0.674 | 0.635 | 0.600 |
| MuQ | LCC↑ | 0.718 | 0.715 | 0.766 | 0.680 | 0.685 | 0.727 | 0.650 | 0.820 | 0.748 | 0.713 | 0.661 |
| CLAP | LCC↑ | 0.436±0.007 | 0.443±0.010 | 0.464±0.005 | 0.335±0.009 | 0.345±0.007 | 0.419±0.027 | 0.327±0.010 | 0.576±0.003 | 0.488±0.006 | 0.411±0.009 | 0.463±0.018 |
| CLAP+C | LCC↑ | 0.428±0.011 | 0.442±0.008 | 0.459±0.008 | 0.350±0.020 | 0.343±0.012 | 0.426±0.017 | 0.334±0.010 | 0.577±0.007 | 0.483±0.010 | 0.417±0.011 | 0.463±0.014 |
| CLAP+C&T | LCC↑ | 0.445±0.014 | 0.448±0.012 | 0.478±0.004 | 0.355±0.023 | 0.349±0.014 | 0.426±0.008 | 0.347±0.013 | 0.576±0.009 | 0.492±0.006 | 0.427±0.020 | 0.475±0.012 |
| MERT | SRCC↑ | 0.626 | 0.676 | 0.726 | 0.567 | 0.575 | 0.662 | 0.509 | 0.790 | 0.665 | 0.643 | 0.613 |
| MuQ | SRCC↑ | 0.714 | 0.716 | 0.775 | 0.668 | 0.682 | 0.655 | 0.610 | 0.822 | 0.740 | 0.707 | 0.668 |
| CLAP | SRCC↑ | 0.379±0.008 | 0.394±0.021 | 0.427±0.015 | 0.335±0.011 | 0.322±0.010 | 0.332±0.028 | 0.270±0.012 | 0.487±0.010 | 0.410±0.014 | 0.394±0.011 | 0.476±0.015 |
| CLAP+C | SRCC↑ | 0.372±0.025 | 0.394±0.017 | 0.414±0.003 | 0.344±0.018 | 0.325±0.018 | 0.342±0.017 | 0.282±0.016 | 0.493±0.009 | 0.400±0.015 | 0.391±0.014 | 0.473±0.008 |
| CLAP+C&T | SRCC↑ | 0.388±0.018 | 0.405±0.013 | 0.443±0.017 | 0.350±0.025 | 0.325±0.025 | 0.342±0.022 | 0.295±0.015 | 0.502±0.019 | 0.420±0.010 | 0.405±0.020 | 0.482±0.003 |
| MERT | KRCC↑ | 0.451 | 0.490 | 0.533 | 0.404 | 0.407 | 0.484 | 0.356 | 0.588 | 0.483 | 0.464 | 0.447 |
| MuQ | KRCC↑ | 0.528 | 0.525 | 0.584 | 0.492 | 0.501 | 0.480 | 0.443 | 0.628 | 0.550 | 0.521 | 0.478 |
| CLAP | KRCC↑ | 0.259±0.007 | 0.271±0.014 | 0.301±0.020 | 0.224±0.007 | 0.220±0.007 | 0.229±0.028 | 0.185±0.009 | 0.339±0.010 | 0.282±0.011 | 0.268±0.009 | 0.327±0.011 |
| CLAP+C | KRCC↑ | 0.255±0.018 | 0.271±0.013 | 0.285±0.001 | 0.231±0.011 | 0.222±0.012 | 0.236±0.019 | 0.193±0.011 | 0.344±0.007 | 0.275±0.011 | 0.267±0.010 | 0.322±0.006 |
| CLAP+C&T | KRCC↑ | 0.266±0.012 | 0.279±0.010 | 0.312±0.024 | 0.235±0.017 | 0.221±0.017 | 0.235±0.021 | 0.202±0.012 | 0.349±0.016 | 0.289±0.006 | 0.277±0.015 | 0.330±0.004 |
🔗 开源详情
- 代码:https://github.com/knownree/madb
- 模型权重:论文未提供预训练模型权重或检查点。
- 数据集:
- 完整的标注数据及部分音频(7030首,包含2630首AI生成音乐)可在HuggingFace下载 https://huggingface.co/datasets/sirui1/MADB-Dataset
- 构成数据集一部分的Muchin数据集(4400首)可在其项目页面下载 https://github.com/CarlWangChina/MuChin
- 其余因版权限制的2969首音频不提供下载。
- Demo:论文未提及。
- 复现材料:论文提供了数据划分、随机种子以及训练硬件等部分信息,但缺少完整的训练复现包、配置文件或详细的实验日志。
- 论文中引用的开源项目:
- MusicLM (Agostinelli et al., 2023):https://arxiv.org/abs/2301.11325
- Levo (Lei et al., 2025):https://arxiv.org/abs/2506.07520
- Yue (Yuan et al., 2025):https://arxiv.org/abs/2503.08638
- MusicGen (Copet et al., 2024):https://arxiv.org/abs/2306.05284
- Order-Complexity Aesthetic Assessment Model (Jin et al., 2024a):https://arxiv.org/abs/2402.08300
- Order-Complexity Model for Homophony Music (Jin et al., 2023):https://arxiv.org/abs/2304.11521
- Paintings and Drawings Aesthetics Assessment (Jin et al., 2024b):https://arxiv.org/abs/2405.02982
- VADB (Qiao et al., 2025):https://arxiv.org/abs/2510.25238
- VGA-Bench (Jiang et al., 2026):https://arxiv.org/abs/2604.10127
- MusicEval (Liu et al., 2025):https://arxiv.org/abs/2501.10811
- SongEval (Yao et al., 2025):https://arxiv.org/abs/2505.10793
- Contrastive Predictive Coding (van den Oord et al., 2019):https://arxiv.org/abs/1807.03748
- wav2vec 2.0 (Baevski et al., 2020):https://arxiv.org/abs/2006.11477
- MuQ (Zhu et al., 2025):https://arxiv.org/abs/2501.01108
- MERT (Li et al., 2024):https://arxiv.org/abs/2306.00107
- PANNs (Kong et al., 2020):https://arxiv.org/abs/1912.10211
- HTS-AT (Chen et al., 2022):https://arxiv.org/abs/2202.00874
- CLAP (Wu et al., 2024):https://arxiv.org/abs/2211.06687
- CLIP (Radford et al., 2021):https://arxiv.org/abs/2103.00020
- CLAMP3 (Wu et al., 2025):DOI: 10.18653/v1/2025.findings-acl.133
- MuChin dataset (Wang et al., 2024):https://arxiv.org/abs/2402.09871
- Qwen2.5-Instruct (Qwen et al., 2025):https://arxiv.org/abs/2412.15115
🏗️ 方法概述和架构
MADB的核心贡献是构建一个大规模、多维度的音乐美学评估数据集与基准,而非提出新模型。其方法框架分为三个阶段:数据源聚合与筛选、多维专业标注流水线、基准模型评估协议。
数据构建:从四个来源聚合9999首曲目以覆盖不同创作范式与质量:2799首从网络平台手动收集的真人制作音乐(含古典经典与短视频配乐等);1000首由Suno生成的AI音乐;1800首由Levo系统生成的AI音乐;以及4400首来自开源Muchin数据集的作品。该设计旨在广泛捕捉人类创作与AI生成的真实音乐世界多样性。
标注框架:定义了10个感知维度和1个整体美学分数。维度按音乐生产流水线组织——作曲阶段(旋律感知、旋律情感、节奏感知、结构感知);编曲阶段(编曲感知、编曲情感);表演阶段(表演/演唱情感、咬字/演唱技巧、演奏技巧);后期制作阶段(音效感知)。每个维度采用1-5分量表,不可适用的维度(如纯器乐曲的演唱技巧)标为0,并在模型优化时排除。
标注流程:30名来自多所音乐学院、传媒大学及行业的专业标注者独立评分,每首曲目平均由约10人评价。质量控制采用三阶段流程:首轮标注,随机抽检20%进行一致性审查,再随机抽检10%由另一名独立审查员验证。此外,标注者需为每首曲目撰写约50字的中文主观评论,并从10个流派和6个情绪标签中各选最多两个。评论经Qwen2.5-Instruct翻译为英文后,多个标注者评论经编码和平均池化形成统一文本表示。流派和情绪标签则嵌入低维向量,通过可学习门控机制与评论特征融合为联合语义嵌入。
基准评估协议:所有预训练模型使用统一的回归头架构进行公平对比。音频特征经时域池化为固定长度嵌入后,输入基于Transformer的回归器,用MSE损失(可选结合排序相关性损失)预测各维度分数。编码器在训练时冻结,仅训练回归头。受测模型包括:(1) 纯音频编码器MERT和MuQ;(2) 原始CLAP;(3) 经过语义预适应的CLAP变体——该预适应阶段利用对比学习将音频嵌入与融合的联合语义嵌入对齐,仅使用评论和标签数据,不涉及美学分数,避免标签泄露。此外,零样本评估了Qwen2-Audio-7B-Instruct在纯音频、纯评论&标签、音频+评论&标签三种输入配置下的预测能力。
💡 核心创新点
- 大规模多维专业美学基准:首次提供近万首曲目、10个感知维度和整体评分的专业标注,由30位符合资质要求的音乐人标注,标注规模、维度和标注者专业性均远超现有MusicEval、SongEval等单一评分小规模数据集,填补了音乐美学评估基准的空白。
- 生产过程导向的维度设计:按照作曲-编曲-表演-后期制作的生产流程组织美学维度,为美学评估提供结构化解析框架,使模型能够分阶段诊断音乐质量,而非仅输出模糊的总体分数。
- 语义与数值双通道标注:开创性地要求标注者同时提供数值评分和文本评论、风格/情绪标签,并利用这些语义信息作为辅助监督信号进行对比学习预适应,验证了评论信息可有效增强模型表征,开辟了多模态美学对齐的新路径。
- 统一的冻结编码器评估协议:为所有预训练编码器采用固定的回归头架构进行横向对比,避免了不同解码器设计带来的混杂因素,清晰揭示了MuQ、MERT等音乐专用编码器相对于CLAP等通用音文对齐模型的巨大固有优势。
- 零样本LLM模态贡献量化实验:通过Qwen2-Audio在受控输入配置下的零样本评估,首次直接量化表明人类评论本身已携带几乎所有可用于美学评分的高阶感知信息(LCC 0.736),而当前LLM几乎无法从原始音频中提取或整合此类信息(纯音频LCC -0.001)。
📊 实验结果
本文在统一框架下评估了多种预训练模型在多维音乐美学评分任务上的表现,主要包括预训练音频编码器(MERT、MuQ)、基于 CLAP 的语义适应变体(原始 CLAP、CLAP+C、CLAP+C&T)以及多模态大语言模型(Qwen2-Audio-7B-Instruct)的零样本预测。实验采用均方误差(MSE)、线性相关系数(LCC)、斯皮尔曼秩相关系数(SRCC)和肯德尔秩相关系数(KRCC)作为评价指标。
表 2 给出了各模型在 11 个美学维度上的性能对比,其中粗体表示所有方法中的最优结果,下划线表示 CLAP 系列方法内部的最优结果。
| Metric | Method | Overall_Score | Mel. Perc. | Mel. Emo. | Arr. Perc. | Arr. Emo. | Rhy. Perc. | Struc. Perc. | Perf_Sing. Emo. | Sing. Skill | Perf. Skill | Sound Effect |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MSE↓ | MERT | 0.090 | 0.083 | 0.111 | 0.108 | 0.079 | 0.098 | 0.079 | 0.096 | 0.091 | 0.135 | 论文未给出具体数值 |
| MuQ | 0.081 | 0.070 | 0.075 | 0.064 | 0.062 | 0.063 | 0.081 | 0.076 | 0.075 | 0.074 | 0.097 | |
| CLAP | 0.109±0.001 | 0.110±0.005 | 0.121±0.009 | 0.125±0.006 | 0.123±0.010 | 0.103±0.005 | 0.101±0.008 | 0.135±0.004 | 0.145±0.006 | 0.121±0.004 | 0.158±0.007 | |
| CLAP+C | 0.108±0.007 | 0.111±0.005 | 0.118±0.003 | 0.123±0.008 | 0.125±0.008 | 0.105±0.003 | 0.100±0.004 | 0.134±0.005 | 0.139±0.002 | 0.123±0.002 | 0.153±0.006 | |
| CLAP+C&T | 0.109±0.004 | 0.109±0.006 | 0.120±0.009 | 0.120±0.008 | 0.123±0.003 | 0.097±0.003 | 0.098±0.003 | 0.134±0.008 | 0.144±0.003 | 0.121±0.005 | 0.158±0.005 | |
| LCC↑ | MERT | 0.626 | 0.670 | 0.713 | 0.561 | 0.567 | 0.674 | 0.534 | 0.782 | 0.674 | 0.635 | 0.600 |
| MuQ | 0.718 | 0.715 | 0.766 | 0.680 | 0.685 | 0.727 | 0.650 | 0.820 | 0.748 | 0.713 | 0.661 | |
| CLAP | 0.436±0.007 | 0.443±0.010 | 0.464±0.005 | 0.335±0.009 | 0.345±0.007 | 0.419±0.027 | 0.327±0.010 | 0.576±0.003 | 0.488±0.006 | 0.411±0.009 | 0.463±0.018 | |
| CLAP+C | 0.428±0.011 | 0.442±0.008 | 0.459±0.008 | 0.350±0.020 | 0.343±0.012 | 0.426±0.017 | 0.334±0.010 | 0.577±0.007 | 0.483±0.010 | 0.417±0.011 | 0.463±0.014 | |
| CLAP+C&T | 0.445±0.014 | 0.448±0.012 | 0.478±0.004 | 0.355±0.023 | 0.349±0.014 | 0.426±0.008 | 0.347±0.013 | 0.576±0.009 | 0.492±0.006 | 0.427±0.020 | 0.475±0.012 | |
| SRCC↑ | MERT | 0.626 | 0.676 | 0.726 | 0.567 | 0.575 | 0.662 | 0.509 | 0.790 | 0.665 | 0.643 | 0.613 |
| MuQ | 0.714 | 0.716 | 0.775 | 0.668 | 0.682 | 0.655 | 0.610 | 0.822 | 0.740 | 0.707 | 0.668 | |
| CLAP | 0.379±0.008 | 0.394±0.021 | 0.427±0.015 | 0.335±0.011 | 0.322±0.010 | 0.332±0.028 | 0.270±0.012 | 0.487±0.010 | 0.410±0.014 | 0.394±0.011 | 0.476±0.015 | |
| CLAP+C | 0.372±0.025 | 0.394±0.017 | 0.414±0.003 | 0.344±0.018 | 0.325±0.018 | 0.342±0.017 | 0.282±0.016 | 0.493±0.009 | 0.400±0.015 | 0.391±0.014 | 0.473±0.008 | |
| CLAP+C&T | 0.388±0.018 | 0.405±0.013 | 0.443±0.017 | 0.350±0.025 | 0.325±0.025 | 0.342±0.022 | 0.295±0.015 | 0.502±0.019 | 0.420±0.010 | 0.405±0.020 | 0.482±0.003 | |
| KRCC↑ | MERT | 0.451 | 0.490 | 0.533 | 0.404 | 0.407 | 0.484 | 0.356 | 0.588 | 0.483 | 0.464 | 0.447 |
| MuQ | 0.528 | 0.525 | 0.584 | 0.492 | 0.501 | 0.480 | 0.443 | 0.628 | 0.550 | 0.521 | 0.478 | |
| CLAP | 0.259±0.007 | 0.271±0.014 | 0.301±0.020 | 0.224±0.007 | 0.220±0.007 | 0.229±0.028 | 0.185±0.009 | 0.339±0.010 | 0.282±0.011 | 0.268±0.009 | 0.327±0.011 | |
| CLAP+C | 0.255±0.018 | 0.271±0.013 | 0.285±0.001 | 0.231±0.011 | 0.222±0.012 | 0.236±0.019 | 0.193±0.011 | 0.344±0.007 | 0.275±0.011 | 0.267±0.010 | 0.322±0.006 | |
| CLAP+C&T | 0.266±0.012 | 0.279±0.010 | 0.312±0.024 | 0.235±0.017 | 0.221±0.017 | 0.235±0.021 | 0.202±0.012 | 0.349±0.016 | 0.289±0.006 | 0.277±0.015 | 0.330±0.004 |
关键结论(表 2):
- 音乐专用预训练编码器 MuQ 在所有维度和指标上几乎全面领先,整体 LCC 达到 0.718,SRCC 为 0.714,显著优于其他模型。MERT 次之,整体 LCC 为 0.626。
- 原始 CLAP 模型整体 LCC 仅为 0.436,即使融入评论文本(CLAP+C)或同时融入评论和标签(CLAP+C&T),整体 LCC 也仅小幅提升至 0.445 左右,仍远低于音乐专用模型。
- 语义适应(引入评论和标签)在多数维度上带来了方向一致且稳定的性能增益,例如结构化感知 LCC 从 0.327(CLAP)经 CLAP+C 的 0.334 提升至 CLAP+C&T 的 0.347,且在节奏感知、旋律情感等维度也表现出累积提升趋势。该适应过程未使用美学分数,排除了标签泄漏的影响。
- 在旋律情感等高感知维度,MuQ 的 LCC 高达 0.766,而最佳 CLAP 变体仅为 0.478,差距达 0.288,表明通用跨模态对齐不足以捕获精细的美学感知。
表 3 对比了多模态大语言模型 Qwen2-Audio-7B-Instruct 在零样本设置下,不同输入模态组合的预测性能。
| Metric | Method | Overall | Mel. Perc. | Mel. Emo. | Rhy. Perc. | Struc. Perc. | Perf. Emo. | Perf. Skill |
|---|---|---|---|---|---|---|---|---|
| MSE↓ | Audio only | 1.181 | 1.206 | 1.060 | 1.249 | 1.007 | 1.049 | 1.214 |
| Comment&Tag | 0.091 | 0.112 | 0.094 | 0.149 | 0.118 | 0.109 | 0.123 | |
| Audio+Comment&Tag | 0.095 | 0.113 | 0.101 | 0.154 | 0.119 | 0.111 | 0.133 | |
| LCC↑ | Audio only | -0.001 | 0.003 | -0.038 | -0.029 | -0.005 | -0.036 | -0.060 |
| Comment&Tag | 0.736 | 0.685 | 0.705 | 0.528 | 0.667 | 0.660 | 0.635 | |
| Audio+Comment&Tag | 0.734 | 0.694 | 0.707 | 0.541 | 0.649 | 0.698 | 0.660 | |
| SRCC↑ | Audio only | -0.035 | -0.040 | -0.078 | -0.044 | -0.027 | -0.111 | -0.098 |
| Comment&Tag | 0.717 | 0.669 | 0.690 | 0.508 | 0.623 | 0.662 | 0.635 | |
| Audio+Comment&Tag | 0.718 | 0.686 | 0.701 | 0.514 | 0.610 | 0.670 | 0.650 | |
| KRCC↑ | Audio only | -0.028 | -0.032 | -0.063 | -0.036 | -0.022 | -0.088 | -0.080 |
| Comment&Tag | 0.593 | 0.552 | 0.569 | 0.408 | 0.513 | 0.541 | 0.516 | |
| Audio+Comment&Tag | 0.594 | 0.561 | 0.573 | 0.409 | 0.496 | 0.568 | 0.522 |
关键结论(表 3):
- 仅使用文本评论和标签(Comment&Tag)时,大语言模型在整体评分上的 LCC 已达 0.736,SRCC 为 0.717,远高于任何基于音频的基线模型,甚至与表 2 中的 MuQ 整体 LCC(0.718)相当。这表明人工评论文本已经高度压缩了美学推理信息,可以直接驱动高准确度的美学评分预测。
- 仅使用音频(Audio only)时,各项相关指标均接近零或为负(如整体 LCC 为 -0.001),模型预测几乎随机,说明当前多模态 LLM 尚无法从原始音频信号中有效提取或融合高层美学感知。
- 将音频与评论、标签结合(Audio+Comment&Tag)后,性能相较于纯文本输入提升甚微(整体 LCC 从 0.736 略降至 0.734),进一步印证了音频信号在零样本美学推理中的贡献有限,文本信号起绝对主导作用。
- 上述结果均在零样本条件下取得,直接反映了各模态本身的信息含量,而非通过数据集训练获得的适配能力,因此具有较高的可解释性。
综合来看,无论是有监督的回归实验还是零样本 LLM 探针,都一致表明:现有预训练模型在多维音乐美学预测任务上仍存在明显不足,尤其在高感知维度上的表现与人类判断差距较大;人工文本反馈是极具价值的监督信号,而直接从音频中学习高层美学特征仍是极具挑战性的开放问题。
表3的LLM零样本实验进一步揭示模态贡献的巨大差异:仅使用评论和标签(Comment&Tag)时,Qwen2-Audio在整体评分上的LCC已达0.736,SRCC 0.717,远超大语言模型范畴下的任何基准模型;而仅使用音频(Audio only)时LCC为-0.001,近乎随机;加入音频后(Audio+Comment&Tag)LCC为0.734,提升可忽略不计。这证实了文本评论已高度压缩了美学推理过程,而当前多模态LLM尚无法从音频原始信号中提取或融合高层美学感知。
消融分析(由CLAP原始模型、CLAP+C、CLAP+C&T的系统对比构成)表明,评论和标签的语义适应在若干维度(如节奏感知、结构感知)带来一致的性能提升,且该适应完全不涉及美学分数,排除了标签泄露。所有CLAP实验采用4个固定随机种子(42,120,5,2500)重复以减少随机性。数据源分析显示整体平均分存在差异(互联网和Suno样本约3.5,Levo约3.18),但各源内部标准差较高,表明数据内多样性充足。
🔬 细节详述
- 训练数据划分:数据集按固定比例随机划分为训练集和验证集,但具体比例未说明。
- 损失函数:回归任务以MSE损失为主,可选择结合以排序为目标的相关性损失以更好地对齐人类感知排序。非适用维度(分值为0)的条目被排除出损失计算。相关性损失的具体形式和权重未公开。
- 训练策略:所有模型使用Adam优化器,超参数“所有实验保持一致”(原文未给出学习率、批次大小、训练轮数、warmup策略等具体值)。编码器冻结,仅训练Transformer回归头。语义预适应阶段使用基于余弦相似度的对比学习目标,仅使用评论和标签,不涉及美学分数。随机种子设置明确:CLAP系实验为(42, 120, 5, 2500)四个种子,MuQ和MERT使用种子42。
- 关键超参数:回归头采用基于Transformer的设计,但层数、头数、隐藏维度、池化策略(如平均池化或注意力池化)、标签嵌入维度及门控融合的具体实现细节均未公开。
- 训练硬件:嵌入提取和预训练使用NVIDIA A100 GPU,下游训练使用NVIDIA Tesla V100 GPU。训练时长未提及。
- 推理细节:LLM零样本实验使用Qwen2-Audio-7B-Instruct,通过指令提示词要求其输出1-5分的美学评分。每种输入配置采用独立的输入管道以严格控制模态。英文评论用于此实验。推理时的温度、采样等参数未说明。音频输入配置(采样率、截断方式)未详述。
- 正则化与稳定训练:未提及dropout、weight decay、梯度裁剪等常见正则化手段。多标注者分数聚合采用均值,未探索其他稳健方案(如中位数或去极端值)。
- 标签定义:论文附录提供了10类流派和6类情绪的完整定义,如情绪标签包括Happy、Peaceful、Passionable、Sad、Angry、Nervous。
⚖️ 评分理由
- 创新性 (1.5/2):论文核心创新在于构建了一个规模、维度和标注专业度远超现有工作的音乐美学基准MADB,并开创性地将评论文本作为额外的语义监督信号引入训练。其生产过程导向的维度设计和统一公平的评估协议也具有贡献。但这本质上是将图像美学领域的成熟方法论迁移至音乐领域,并未提出全新的美学评估建模范式,创新幅度属中等偏大。
- 技术严谨性 (1.0/1.5):标注流程设计合理,有扎实的三阶段质量控制和ICC一致性分析支撑。但基准评估的实验设计存在重大缺陷:回归头结构、损失函数细节、训练超参数几乎完全缺失,这带来了不可忽略的黑箱风险。多标注者聚合策略的鲁棒性(如均值 vs. 中位数)、非适用维度零分对训练的潜在偏差等关键问题也未得到讨论。整体无数学或逻辑漏洞,但深度和透明度不足。
- 实验充分性 (1.0/1.5):系统对比了MuQ、MERT、CLAP及其语义适应变体,基线有一定代表性。但缺少基于传统MIR特征+经典回归器(如SVR、随机森林)的基线以证明深度学习编码器的必要性,也未与Jin等人专门为音乐美学设计的模型进行对比。消融实验仅停留在评论/标签的叠加,未探讨门控融合方式、编码器不同层特征融合等更细粒度的ablation。缺乏统计显著性检验。
- 清晰度 (0.9/1):行文流畅,任务动机明确,工作流程与实验设置清楚,图表直观。但关键的复现细节严重缺失(超参数、回归头结构),显著降低了论文的可复现性。部分维度缩写与正文的对应关系需要读者反复确认,造成轻微阅读障碍。
- 影响力 (1.0/1.5):MADB为音乐美学评估提供了一个社区亟需的公共基准,其规模和标注丰富度有望成为该领域的基础资源,支撑AI音乐生成评估、RLHF等下游任务。但影响力受限于风格偏向流行、中文评论需翻译带来语义损耗,以及基准实验深度尚浅,尚未催生出新的强美学模型。对该子领域研究者有明确价值。
- 开源 (1.0/1.5):核心标注数据及部分音频(7030首)已通过HuggingFace公开,代码仓库在GitHub可见,符合核心内容开源的基本要求。但其余2969首受版权保护的音频无法公开,且文档和README的详尽程度未知,因此未给满分。
- 可复现性 (0.5/5):尽管论文给出了部分随机种子和所用GPU型号,并公开了数据和代码框架,但由于训练超参数(学习率、批次大小、epoch等)、回归头具体结构、损失函数权重、门控融合实现等核心复现必需信息的缺失,他人仍极难精确复现论文中的基准分数。只能算“可 部分复现”,远未达到完整复现标准。
- 工程/实践价值 (1.2/1.5):该工作构建了一个可即用的多维美学评估数据流水线和基准测试框架,定义了清晰的标签体系和质量控制流程,对于工业界希望构建AI音乐评估系统的团队有很高的参考价值。数据公开和评估协议统一为社区提供了一个标准化的“测试集”,工程价值显著。
🚨 局限与问题
论文明确承认的局限:
- 音乐风格分布不均衡,流行类别占主导,可能造成模型偏向主流审美,泛化到小众风格困难。
- 中文文本评论经机器翻译为英文,可能引入噪声或语义漂移。
- 标注仅在整曲级别,缺乏片段级时间标注,无法捕捉曲内美学动态变化。
- 当前标签体系较粗(10流派、6情绪),未包含细粒度子风格,未来需扩展层级分类。
- 未捕捉感知维度与整体分数之间的因果关系。
审稿人发现的潜在问题与批评:
- 基准实验的深度与公平性问题:统一的冻结编码器+轻量回归头协议虽有公平对比的优点,但回归头结构和容量的未公开可能使其成为性能瓶颈,导致部分性能差异源于回归头对不同编码器输出特征的适配性不同,而非编码器固有美学表征能力的差异。这与常见的Linear Probe/MLP协议相比,不确定性更大。
- 多标注者聚合与个体偏差的忽略:简单地用均值聚合多标注者评分,完全丢弃了评分者个人尺度和偏差(如严苛度)的丰富信息。这在强调“主观性”的美学任务中是巨大浪费,且可能掩盖少数专家的高质量判断,未来应探索使用Z-score标准化或基于Item Response Theory (IRT) 的更复杂的聚合方法。
- “评论”实验的结论过强与“读答案”嫌疑:零样本LLM实验中,直接输入高度总结了美学判断的评论和标签便获得极高预测精度(LCC >0.7),这近乎是一种通过阅读“答案的摘要”来进行测试的行为,而非真正的多模态美学理解。该实验更准确地说是在测量语言模型从文本中提取摘要信息的能力,其结论“音频提供互补信息但提升微小”需要更谨慎的解读,不应过度贬低音频模态的潜力。
- 非适用维度的零分处理:标注者被允许为不适用维度标注0,此0与低分表现(1分)在损失计算中被统一排除,但思想上是含糊的。一个维度的“不适用”是否可能反映了一种极端的负面审美判断(例如,糟糕的编曲导致了结构的破碎)?这种处理可能掩盖了零分和低分之间的模糊地带,引入噪声。
- CLAP语义适应的增益微乎其微:实验结果表明,费心设计的评论和标签语义对齐对CLAP的提升效果非常微弱(LCC提升不足0.01),这强烈暗示当前通用音文对齐模型本质上缺乏和细粒度美学感知相关的特征空间。论文将此解释为“评论提供有用信号”略显勉强,更诚实的结论应是:在现有编码器框架下,此路不通。
- 缺乏对音频基本属性的控制分析:论文未报告音乐长度、响度等基本属性的分布,也未分析这些属性对模型预测性能的影响。这是一个影响实验结论鲁棒性的关键缺失。