📄 Is One Score Enough? Assessing Singing Quality of Songs with Temporal Score Curves
标签:#音乐理解 #Transformer #自监督学习 #音频理解 #模型评估
7.6/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5
✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐理解 | #Transformer | #自监督学习 #音频理解 | arxiv
👥 作者与机构
- 第一作者:Yishan Lv(西安交通大学,香港中文大学(深圳))
- 通讯作者:未说明
- 作者列表:Yishan Lv(西安交通大学,香港中文大学(深圳))、Jing Luo(西安交通大学)、Xinyu Yang(西安交通大学)、Zhizheng Wu(香港中文大学(深圳))
💡 毒舌点评
论文提出了一个有价值的问题(完整歌曲SQA),并设计了一个清晰的两阶段框架。其创新主要在于问题定义和聚合机制的设计。然而,整个系统的基石——用于生成段落伪标签的教师模型T是一个未开源的黑盒,而其核心评估数据集(Internal Dataset)也是私有的。这使得论文的核心贡献如同建立在流沙之上,其优异的实验结果无法被社区独立验证,系统的可靠性高度存疑。
📌 核心摘要
本文旨在解决完整歌曲演唱质量评估(SQA)的问题,而现有研究主要关注短音频片段。作者提出了SongSQA框架,这是一个两阶段方法:第一阶段,一个段落分数预测器利用教师模型生成的伪标签进行训练,以实现细粒度的段落级质量预测;第二阶段,一个歌曲质量聚合器融合段落特征和分数,通过可学习的歌曲嵌入和自注意力机制动态聚合关键质量线索,预测整体歌曲分数并生成时间分数曲线。相较于简单地将片段级方法应用于长音频,SongSQA的新颖之处在于它明确建模了歌曲内不同段落的质量变化及其对整体评估的影响。实验结果表明,在Lyra-SA和Internal两个数据集上,SongSQA在所有评估指标上均优于所有基线模型,其中在KTAU指标上相对于最强基线实现了最高13.95%的相对提升。该研究的实际意义在于为音乐教育、AI生成内容评估等应用提供了更细致的质量评估工具。主要局限性包括模型严重依赖私有数据集和未开源的教师模型,这限制了结果的可复现性和社区验证。
下图对比了传统的片段级SQA与本文提出的完整歌曲SQA方法。

左侧为传统方法仅处理短片段并输出单一分数,右侧为SongSQA处理完整歌曲并输出整体分数和段落级分数曲线,突出了问题定义的扩展。
🔗 开源详情
- 代码:论文中未提及代码链接。
- 模型权重:论文中未提及。
- 数据集:
- Lyra-SA Dataset(公开):腾讯音乐天琴实验室发布的歌唱质量评估数据集。获取链接:
https://lyracobar.y.qq.com/singvoicedataset.html。 - Internal Dataset(专有):论文作者自建的内部数据集,未开源。
- Lyra-SA Dataset(公开):腾讯音乐天琴实验室发布的歌唱质量评估数据集。获取链接:
- Demo:论文中为主观评估提供的音频样本演示页面:
https://anon-music.github.io/audio-eval-demo/。 - 复现材料:论文中提供了部分训练配置,包括数据分段(10秒,5秒重叠)、模型架构细节(Segment Score Predictor含2层自注意力,Song Quality Aggregator层数\(L=2\))、损失权重(\(\lambda=0.1\))、优化器(Adam)参数等,但未提供模型检查点或详细附录。
- 论文中引用的开源项目:
- MuQ(用于特征提取的SSL音乐表示模型):论文中引用了相关论文(Zhu et al., 2025),但未提供项目代码或模型链接。
- SongEval(用于生成伪标签的教师模型变体之一):论文中引用了相关论文(Yao et al., 2025),并提及使用了作者公开的检查点,但未提供具体获取链接。
- Gemini-3-Pro(用于生成伪标签的大语言模型):论文中提及通过提示(prompt)其进行段落评分,但未说明具体开源或API获取方式。
- MDX-Net(用于人声分离的源分离模型):论文中提及用其提取内声部,引用了相关论文(Kim et al., 2021),但未提供项目链接。
- 其他基线模型(如UTMOSv2, PS-SQA, RAMP+, wav2vec 2.0, MERT等):论文中仅作为对比方法提及,未说明其开源状态或提供链接。
🏗️ 方法概述和架构
SongSQA是一个两阶段的端到端框架,旨在从完整歌曲的音频中预测整体演唱质量分数,并生成一条反映质量随时间变化的段落级分数曲线。
- 整体流程概述:输入一首完整歌曲的音频,首先将其切分为有序的音频段落序列。第一阶段,使用预训练的
Segment Score Predictor对每个段落进行特征提取和质量分数预测。第二阶段,Song Quality Aggregator将这些段落的特征和分数融合成统一的嵌入序列,并通过一个聚合器(基于Transformer)进行上下文建模和信息聚合,最终输出歌曲的整体质量分数。
下图展示了SongSQA的整体模型架构,包括两个阶段的设计。

图中清晰显示了第一阶段段落分数预测器和第二阶段歌曲质量聚合器的组件与数据流,其中可学习的歌曲嵌入通过自注意力聚合段落信息。
主要组件/模块详解:
- Segment Score Predictor(阶段一):
- 功能:学习从单个音频段落中提取与演唱质量相关的细粒度声学特征,并预测该段落的分数。
- 内部结构/实现:采用自监督音乐表示模型MuQ作为骨干网络提取初始声学特征序列
\(H_i^{\mathrm{muq}}\)。随后,将该序列输入一个由多头自注意力、残差连接和层归一化组成的编码器,得到上下文化表示\(H_i^{\mathrm{enc}}\)。为了同时捕捉显著的瞬态事件(如瑕疵或亮点)和整体表演水平,采用了非对称双路径池化策略:对原始MuQ特征进行最大池化以保留显著事件,对编码器输出进行平均池化以总结整体表现。将两者拼接得到段落特征\(f_i\),最后通过一个线性层预测段落分数\(\hat{s}_i\)。 - 输入输出:输入为单个音频段落
\(v_i\)的波形,输出为该段落的声学特征向量\(f_i\)和预测分数\(\hat{s}_i\)。 - 训练监督:由于缺乏段落级人工标注,该组件使用教师模型
\(\mathcal{T}\)生成的伪标签\(y_{\mathrm{pseudo}}^{(i)}\)进行监督训练,损失函数为均方误差。论文使用的教师模型是一个专注于多维度歌曲美学评估的框架,其“歌唱”维度分支的预测分数被用作伪标签。
- Song Quality Aggregator(阶段二):
- 功能:建模段落级表演与整体歌曲质量之间的内在联系,聚合整个歌曲的关键质量线索。
- 内部结构/实现:
- 特征融合:对每个段落
\(i\),使用冻结的Segment Score Predictor提取其特征\(f_i\)和分数\(\hat{s}_i\)。将两者分别通过线性层投影到潜空间,并用Sigmoid函数激活分数分支,然后拼接并经过层归一化,形成质量感知的段落嵌入\(x_i\)。 - 聚合设计:引入一个随机初始化的可学习歌曲嵌入
\(x_0\)(类似BERT的[CLS]token),并将其置于段落嵌入序列的开头,形成输入序列\(X^{(0)} = [x_0, x_1, ..., x_n]\)。该序列被送入一个由L层Transformer编码器层组成的聚合器。通过自注意力机制,\(x_0\)能够与所有段落嵌入\(x_i\)动态交互,从而自适应地强调对整体质量影响更大的段落。 - 预测:取Transformer最后一层输出中
\(x_0\)对应位置的表征\(h_{\mathrm{global}}\)作为歌曲级表征,通过一个MLP回归头预测最终的歌曲整体质量分数\(\hat{y}\)。
- 特征融合:对每个段落
- 输入输出:输入为一首歌曲的有序段落嵌入序列,输出为歌曲的整体质量分数预测值
\(\hat{y}\)。 - 训练目标:阶段二的总损失是歌曲级回归损失
\(\mathcal{L}_{\mathrm{song}}\)与一个段落-分数一致性正则化损失\(\mathcal{L}_{\mathrm{cons}}\)的加权和。\(\mathcal{L}_{\mathrm{cons}}\)鼓励所有段落预测分数的平均值与歌曲真实标签接近,以防止段落分数在优化歌曲级目标时发生漂移。
- Segment Score Predictor(阶段一):
组件间的数据流与交互:音频切分后,有序段落序列首先流经阶段一的预测器,每个段落独立产出
\((f_i, \hat{s}_i)\)对。在阶段二,这些对被融合成\(x_i\),并与\(x_0\)组合成序列。该序列流经Transformer聚合器,信息通过自注意力在\(x_0\)和所有\(x_i\)之间流动,最终在\(x_0\)处汇聚出全局信息,用于最终预测。关键设计选择及动机:选择两阶段而非端到端训练,是为了解决段落级标注缺失的核心难题。非对称池化策略是为了在特征层面就兼顾局部突出事件和整体稳定性。引入可学习的歌曲嵌入和Transformer聚合器,是为了模拟人类评估时会不自觉关注关键段落(亮点或瑕疵)的心理过程,避免简单平均池化导致信息平滑。
💡 核心创新点
- 问题定义创新:从片段到完整歌曲的SQA:将评估对象从短片段扩展到完整歌曲,并定义为生成整体分数和时间分数曲线。此前方法(如UTMOSv2, PS-SQA)无法处理长音频内的质量变化。此创新通过实验验证了直接应用片段级方法效果有限,而SongSQA通过建模段落间关系取得了显著提升。
- 监督信号创新:基于教师模型的伪标签学习:针对段落级人工标注稀缺且存在“标签共享假设”缺陷的问题,提出使用预训练的教师模型为每个段落生成质量伪标签。这避免了将歌曲整体分数粗暴分配给所有段落,提供了更精细、真实的段落级监督。消融实验表明,使用教师模型伪标签优于直接共享歌曲标签和使用其他替代教师(如SongEval, Gemini-3-Pro)。
- 聚合机制创新:可学习的歌曲嵌入与自注意力聚合:摒弃了简单的平均池化,引入可学习的歌曲嵌入作为“观察者”,通过Transformer自注意力机制动态地从有序段落序列中聚合对整体质量判断最关键的信息。实验消融证明,这一设计显著优于仅使用Transformer编码器或仅用平均池化的变体。
📊 实验结果
论文在Lyra-SA(公共数据集,非专家标注)和Internal Dataset(私有数据集,专家标注)两个数据集上进行了评估。所有分数归一化到0-100分。
1. 主实验结果(与基线对比)
| 模型 | Lyra-SA (MSE↓) | Lyra-SA (LCC↑) | Lyra-SA (SRCC↑) | Lyra-SA (KTAU↑) | Internal (MSE↓) | Internal (LCC↑) | Internal (SRCC↑) | Internal (KTAU↑) |
|---|---|---|---|---|---|---|---|---|
| UTMOSv2 | 193.55 | 0.5312 | 0.5520 | 0.3956 | 144.52 | 0.8133 | 0.7892 | 0.5901 |
| PS-SQA | 147.55 | 0.5247 | 0.5185 | 0.3755 | 73.29 | 0.8246 | 0.8014 | 0.6011 |
| RAMP+ | 149.41 | 0.4804 | 0.4679 | 0.3354 | 83.17 | 0.8032 | 0.7952 | 0.6000 |
| wav2vec 2.0-based | 151.79 | 0.4915 | 0.4899 | 0.3531 | 79.40 | 0.8011 | 0.7883 | 0.5884 |
| MERT-based | 163.45 | 0.4515 | 0.4386 | 0.3104 | 79.99 | 0.7988 | 0.7886 | 0.5952 |
| MuQ-based | 131.64 | 0.5842 | 0.5800 | 0.4180 | 52.61 | 0.8814 | 0.8106 | 0.6249 |
| SongSQA (Ours) | 114.01 | 0.6237 | 0.6317 | 0.4662 | 37.56 | 0.9235 | 0.8859 | 0.7121 |
结论:SongSQA在所有数据集和所有指标上均优于所有基线。在内部数据集上,相较于最强的MuQ-based基线,MSE降低了28.6%,KTAU提升了13.95%。
下图给出了SongSQA在一首完整歌曲上生成的时间分数曲线示例。

蓝色曲线表示预测的段落分数随时间变化,虚线为预测整体分数,红色线为真实标签,可见模型能捕捉质量波动。
2. 关键消融实验结果
| 消融变体 | Lyra-SA (MSE↓) | Lyra-SA (LCC↑) | Lyra-SA (SRCC↑) | Lyra-SA (KTAU↑) | Internal (MSE↓) | Internal (LCC↑) | Internal (SRCC↑) | Internal (KTAU↑) |
|---|---|---|---|---|---|---|---|---|
| 完整模型 | 114.01 | 0.6237 | 0.6317 | 0.4662 | 37.56 | 0.9235 | 0.8859 | 0.7121 |
| 教师模型消融 | ||||||||
| w/ SongEval | 136.01 | 0.5509 | 0.5392 | 0.3921 | 66.79 | 0.8296 | 0.6191 | 0.4434 |
| w/ Gemini-3-Pro | 127.16 | 0.5808 | 0.5873 | 0.4261 | 44.13 | 0.8912 | 0.8325 | 0.6510 |
| w/ Ground Truth | 118.02 | 0.6115 | 0.6128 | 0.4549 | 37.20 | 0.9084 | 0.8701 | 0.6911 |
| 特征融合消融 | ||||||||
| w/o Scores (仅特征) | 115.32 | 0.6277 | 0.6284 | 0.4681 | 35.51 | 0.9230 | 0.8837 | 0.7107 |
| w/o Features (仅分数) | 187.55 | 0.5315 | 0.5152 | 0.3765 | 200.32 | 0.8221 | 0.8307 | 0.6474 |
| 聚合设计消融 | ||||||||
| w/o SongEmb (Transformer+均值池化) | 125.54 | 0.6042 | 0.6083 | 0.4443 | 39.44 | 0.9097 | 0.8785 | 0.7043 |
| w/o SongEmb & TE (仅均值池化) | 117.88 | 0.6158 | 0.6110 | 0.4501 | 35.71 | 0.9224 | 0.8794 | 0.7049 |
结论:消融实验证明了各组件的有效性。1)使用的教师模型(\(\mathcal{T}\))生成的伪标签显著优于其他替代方案。2)同时使用段落特征和分数进行融合的效果最好。3)可学习的歌曲嵌入(\(x_0\))是性能提升的关键,它与Transformer编码器结合使用效果最佳。
3. 主观评估:在5首歌曲上进行的小规模成对比较实验中,模型对段落质量高低的预测与12名人类听众的判断达到了86.7%的一致率,初步证明了时间分数曲线的感知合理性。
下图展示了另一首歌曲的时间分数曲线,并高亮了低质量段落A和高质量段落B。

图中A和B段落分别对应主观评估中的低分和高分示例,模型能识别出这些关键段落的质量差异。
🔬 细节详述
- 训练数据:使用Lyra-SA(1000首完整歌曲,10首歌各100个用户翻唱)和内部数据集(2035首歌曲,1284首不同歌曲)。音频被切分为10秒段落,重叠5秒,过滤掉静音段落。
- 损失函数:阶段一:段落分数预测损失
\(\mathcal{L}_{\mathrm{stage1}}\)(MSE)。阶段二:歌曲级回归损失\(\mathcal{L}_{\mathrm{song}}\)(MSE)加上段落-分数一致性正则化损失\(\mathcal{L}_{\mathrm{cons}}\)(MSE),权重系数\(\lambda=0.1\)。 - 训练策略:优化器:Adam (
\(\beta_1=0.9\),\(\beta_2=0.999\),\(\epsilon=10^{-8}\))。学习率、batch size、训练轮数等未在正文中说明。 - 关键超参数:段落长度:10秒,重叠5秒。Segment Score Predictor:2层自注意力编码器。Song Quality Aggregator (Transformer):层数
\(L=2\)。特征维度、注意力头数等未说明。 - 训练硬件:未说明。
- 推理细节:未说明。
- 正则化或稳定训练技巧:使用了段落-分数一致性正则化
\(\mathcal{L}_{\mathrm{cons}}\)来稳定阶段二的训练。
⚖️ 评分理由
创新性 (1.5/2):提出了将评估对象从短片段扩展到完整歌曲并生成时间分数曲线的新问题定义创新[A_SUMMARY],设计了基于教师模型伪标签的段落级监督信号创新以克服标注稀缺问题[A_SUMMARY],并提出了利用可学习歌曲嵌入和自注意力进行动态聚合的机制创新[A_SUMMARY],消融实验证明了关键设计的有效性[A_RESULTS]。
技术严谨性 (1.1/1.5):两阶段框架设计逻辑清晰,组件功能定义明确[A_METHOD]。非对称双路径池化、特征融合策略和聚合机制均有具体实现描述与动机说明[A_METHOD]。但固定10秒切分可能破坏音乐语义完整性,且未探讨其影响[A_LIMITS]。
实验充分性 (1.2/1.5):实验在公开和私有数据集上进行了对比和消融实验,覆盖了代表性基线和多种关键组件变体,结果一致支持论文声明[A_RESULTS]。但核心评估数据集为私有,无法被社区验证和复现,且主要依赖整体分数评估,对时间曲线本身缺乏系统性评估[A_LIMITS]。
清晰度 (0.8/1):论文结构清晰,通过架构图、公式和流程详细阐述了两阶段方法[A_METHOD][S_HEAD]。相关工作梳理全面,覆盖了从早期研究到最新进展的脉络[S_MIDDLE]。
影响力 (1.3/1.5):研究解决了音乐理解和多媒体应用中的实际问题(完整歌曲SQA),为音乐教育、AI生成内容评估提供了更细致的工具[A_SUMMARY][S_HEAD]。方法直接针对音频/音乐领域,具有明确的领域相关性和应用潜力。
开源 (0.2/1.5):代码、模型权重和核心教师模型均未开源[A_OPEN]。仅提供了Demo演示页面和对公开数据集Lyra-SA的获取链接,但核心方法产物(如模型)无法获取。
可复现性 (0.3/0.5):论文披露了部分关键配置,如音频切分(10秒,5秒重叠)、主要模型层数(2层)、损失权重(λ=0.1)和优化器(Adam)参数[A_OPEN][S_TAIL]。但缺少学习率、batch size、训练轮数、硬件等详细训练配置,复现存在关键信息缺失。
工程/实践价值 (1.2/1.5):设计了一个完整的两阶段端到端流程,包含特征提取、分数预测与质量聚合,有清晰的输入输出定义[A_METHOD]。提供了用于主观评估的音频样本Demo,展示了方法的实际输出效果[A_OPEN]。研究对音乐教育和AI内容评估等实际场景有明确价值[A_SUMMARY]。
🚨 局限与问题
1. 论文明确承认的局限:论文未在结论部分专门讨论局限性,但可从实验和方法部分推断出以下问题:
- 对教师模型
\(\mathcal{T}\)的依赖:伪标签的质量直接决定了段落预测器的上限,但\(\mathcal{T}\)本身是一个黑盒,其预测是否完美对齐人类对“演唱质量”的感知存疑。 - 数据集的泛化性:主要实验在一个公开数据集和一个私有数据集上进行。私有数据集结果更好,但无法被社区验证和复现。公开数据集Lyra-SA仅包含10首歌曲的100个翻唱,歌曲多样性有限。
2. 审稿人发现的潜在问题:
- 伪标签的循环论证风险:教师模型
\(\mathcal{T}\)本身可能对完整歌曲的某些特性(如整体混音、伴奏)敏感,而不仅仅是演唱质量。用它来标注段落,再训练模型预测歌曲整体分数,可能存在潜在的特征泄露或偏差传递。 - 段落切分策略的武断性:固定10秒切分(重叠5秒)可能破坏乐句的完整性。一个完整的乐句可能横跨两个切分点,导致质量评估在音乐语义上不连贯。论文未探讨不同切分策略的影响。
- 时间曲线的评估缺失:论文的评估主要依赖整体歌曲分数的预测精度(MSE, SRCC等)。虽然通过主观实验证明了高低段落预测的合理性,但缺乏对曲线本身(如变化趋势、位置准确性)的系统性评估。如何衡量一条预测曲线与理想曲线(假设存在)的匹配度?
- 专家标注与模型预测的悖论:内部数据集由专家根据8个维度综合打分,但模型仅用整体分数训练。模型是否真正学到了这些维度的综合,还是只是拟合了数字?这在一定程度上降低了可解释性。