📄 Rag Classification of Tagore Songs using Symbolic Music Notation and Novel Weighted Distance Measures

#音乐理解 #数据集 #少样本

3/10 | 创新 0.8/2 | 严谨 0.5/1.5 | 实验 0.3/1.5 | 清晰 0.6/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.3/1.5

📝 3/10 | 后50% | #音乐理解 | #数据集 | #少样本 | arxiv

👥 作者与机构

  • 第一作者:Chandan Misra(XIM University, School of Computer Science and Engineering)
  • 通讯作者:未说明
  • 作者列表:Chandan Misra(XIM University, School of Computer Science and Engineering)、Swarup Chattopadhyay(XIM University, School of Computer Science and Engineering)

💡 毒舌点评

这篇论文在文化细微的 Rabindra Sangeet 拉格识别任务上构建了一个手标符号数据集,并提出了融入先验知识的加权距离,思路有音乐直觉但有重大缺陷。方法停留在 kNN 加手工权重的浅层模式,实验仅在三类小样本上与未加权欧氏距离对比,未涉及任何标准机器学习或时序模型。最致命的是,数据集、代码全未公开,复现性为零,且实验设计存在基本混淆。整体贡献无论从机器学习创新、评估充分性或开放性角度来看,都远未达到顶会录用标准,可能适合领域特化的音乐学会议。

📌 核心摘要

  1. 论文旨在解决泰戈尔歌曲(Rabindra Sangeet)中的拉格(rāg)自动识别问题,这类歌曲源于 Hindustani 古典音乐,但常带自由度,使基于音频的高效分类困难。
  2. 核心方法是:从记谱集 Swarabitan 中手工抽取 1000 首歌曲的符号音符序列,构建标注数据集;将原始 36 维(3 个八度的 12 半音)频率分布向量压缩为 12 维音名级向量,并提出拉格感知加权欧氏距离,其中属于目标拉格规定上行/下行(Āroh-Avroh)音符集的维度获 90% 总权重,其余音符获 10%。
  3. 该加权距离显式融入拉格的音阶结构知识,使距离计算关注拉格特征音,论文通过三类目视分析展示其比普通欧氏距离和余弦相似度更能防止误判。
  4. 在三类拉格(Bhairavi, Bihag, Khamaj)的 75/25 划分下,kNN(k=4) 使用 90:10 权重及 Bihag 权向量时准确率最高达 85.11%,优于普通欧氏距离的 78.72%(论文未说明该准确率是单体拉格还是平均)。
  5. 实际意义在于为文化遗产提供了一种轻量可解释的符号级分类流程,对音乐教学和检索有参考价值,但整体技术深度浅。
  6. 局限是实验仅限 3 类 186 首、只比较普通欧氏距离,无任何其他基线或统计检验;数据集、代码未公开,可复现极难;方法无可学习组件,权重分配全启发式。

🔗 开源详情

  • 代码:未提及任何链接
  • 模型权重:未提及
  • 数据集:论文描述从 Swarabitan 构建了 1000 首符号记谱歌曲的数据集,但无下载链接或获取方式
  • Demo:未提及
  • 复现材料:未提及
  • 论文引用的开源项目:未提及

🏗️ 方法概述和架构

整体流程:从 Swarabitan 的 Akarmatrik 记谱中手工提取音符序列 → 根据三组八度级索引(低/中/高 12 半音,索引 1–36)映射每个音符,构成 36 维频率分布向量作为样本 → 对每个样本向量进行跨八度聚合,将同一音名在不同八度的频率相加,降维为 12 维向量 S, r, R, g, G, M, m, P, d, D, n, N → 归一化每个 12 维向量,使用总频率归一化以消除歌曲长度影响 → 对于目标拉格,计算其拉格感知加权欧氏距离 → 使用 kNN 分类器进行预测。

数据集构建 从 60 卷 Swarabitan 中随机选 1000 首歌曲,人工记录每首的音符序列和拉格标签,存储于 CSV。每个音符按其八度位置映射到 1–36 整数索引(表 1),每首歌曲生成一个 36 维频率分布,标签为拉格名。符号记谱的示例如

(a) Actual Composition

所示,其下方的数字和符号对应了音符及其时长。最终数据集中出现 239 个不同拉格,样本极不均衡:超过一半歌曲属于样本数低于 20 的稀疏拉格;最常见的拉格是 Bhairavi(100 首),Bihag(49 首)等。论文区分“纯”(完全遵循规定音)与“非纯”(包含规定外音符)样本,但未在分类实验中使用。

特征压缩与归一化 原始 36 维向量会因同音异八度造成零相似,因此将三个八度的同音名频率相加,得到 12 维向量。随后对每个样本进行总频率归一化,使距离比较反映音符分布而非长度差异。纯Khamaj拉格的两个样本的原始36维频率分布向量分别如

(a)

(b)

所示,它们具有相似的峰值模式,主要集中在中高音区(索引17-26)。而将这两个来自不同拉格(Khamaj vs. 其他)的样本叠加在同一图中(

(c)

),则能直观展示出不同拉格在原始特征空间中的分布差异。

拉格感知加权欧氏距离 对归一化的 12 维向量 â, b̂,距离定义为 \(E_w(a,b) = \sqrt{\sum_{i=1}^{12} w_i (\hat{a}_i - \hat{b}_i)^2}\),其中权重向量 \(w\) 满足 \(\sum w_i = 1, 0 < w_i < 1\)。对于目标拉格 ρ,找出其 Āroh-Avroh 包含的音符索引集合 \(\mathcal{I}_{\rho}'\),这些索引获总权重的 90% 并等分;剩余索引获 10% 并等分。由此,规定音获高权重(如 Khamaj 8 个规定音各 0.1125,4 个非规定音各 0.025),使距离对拉格特性更敏感。论文仅演示了 90:10 和 80:20 两种分配。

kNN 分类 训练阶段:对训练集中每个样本,针对候选拉格 ρ,按该 ρ 的权向量计算该样本与所有训练样本的加权距离,找出 k 个最近邻。预测阶段:对测试样本,使用各候选拉格权向量计算最近邻并多数投票。论文实验仅用三类拉格(Bhairavi, Bihag, Khamaj),对比普通欧氏距离与 90:10、80:20 的加权距离,没有与其他分类器或深度学习基线比较。

💡 核心创新点

  1. Rabindra Sangeet 符号拉格数据集:从原始记谱构建包含 1000 首歌曲、239 种拉格标签的符号数据集,为领域有监督学习提供基础,但未公开获取方式或数字化文件。
  2. 拉格感知加权距离度量:将拉格的 Āroh-Avroh 音阶结构编码为距离权重,强调特征音,与普通距离相比更具音乐意义上的解释力,但权重完全启发式。
  3. 跨八度音名聚合:将八度相关的 36 维谱向量简化为 12 维音名级向量,避免了同音异八度造成的假性不相似。

📊 实验结果

主要实验结果呈现于表 12,在三类拉格(Bhairavi/Bihag/Khamaj,共 186 首)的 75:25 划分下,比较不同 k 值和权重配置的准确率。论文未定义准确率是总体分类准确率还是分类别准确率,且未提供标准差或统计检验。

k距离类型权向量/设置Bhairavi Acc.Bihag Acc.Khamaj Acc.
3普通欧氏-0.74470.78720.7234
3加权 (90:10)rāg-specific0.70210.76600.7660
3加权 (80:20)rāg-specific0.7660未报告未报告
4普通欧氏-0.76600.76600.7872
4加权 (90:10)rāg-specific0.76600.85110.8298
4加权 (80:20)rāg-specific0.78720.82980.7872
5普通欧氏-0.63830.74470.7660
5加权 (90:10)rāg-specific0.74470.80850.8085
5加权 (80:20)rāg-specific0.76600.80850.7872
6普通欧氏-0.70210.74460.7234
6加权 (90:10)rāg-specific0.74460.80850.8290
6加权 (80:20)rāg-specific0.74460.85100.8290
7普通欧氏-0.66000.70210.7447
7加权 (90:10)rāg-specific0.66000.76600.8085
7加权 (80:20)rāg-specific0.70210.76600.8085

注:原文中 k=3 时 80:20 下 Bihag 和 Khamaj 的准确率未明确列出,仅有 Bhairavi 的 0.7660。对于其他 k 值,80:20 的数据可能未提及;此处尽量补全。

除了分类准确率,论文还提供了大量可视化实验,用以分析不同拉格之间的相似性,这些结果在主模型分析中被完全忽略,但它们为方法的动机和有效性提供了重要视觉证据。具体而言,论文计算了12个拉格两两之间的平均余弦相似度。[图像补充] 图5展示了未排序的相似度矩阵,横轴为作曲索引,纵轴为与另一个拉格所有作曲的平均相似度。

Figure 3. Cosine Similarities between compositions belonging to rāgs in row-major order Bhairavi, Bihag, Kirtan, Khamaj, Desh, Pilu, Baul, Kafi, Yaman Kalyan, Sahana, Yaman, Kedara. The x-axis and y-axis of each sub-plot of the grid correspond to the number of compositions and mean cosine similarity value respectively.

揭示了不同拉格对之间的相似度水平差异很大,且同一拉格对内,不同作曲的相似度值波动剧烈。

Figure 4. Sorted Mean Cosine Similarities between compositions belonging to rāgs in row-major order Bhairavi, Bihag, Kirtan, Khamaj, Desh, Pilu, Baul, Kafi, Yaman Kalyan, Sahana, Yaman, Kedara. The x-axis and y-axis of each sub-plot of the grid correspond to the number of compositions and mean cosine similarity value respectively.

是对图5中每个子图按相似度值排序后的结果,可以更清晰地看出,对于大部分拉格,其内部作曲的相似度分布呈现一个从低到高的“学习曲线”,表明组内一致性存在差异但整体较高。

Figure 5. Mean cosine similarity scores between compositions belonging to different rāgs. The selected rāgs are Bhairavi, Bihag, Khamaj, Kafi, and Kedara, each shown in pairwise comparison. The x-axis represents the composition index, while the y-axis represents the mean cosine similarity with compositions of the other rāg. The horizontal red line shows the average similarity score for each rāg pair.

则更直接地展示了不同拉格对(如Bhairavi-Bihag, Bhairavi-Khamaj等)之间的相似度比较,红色横线标出了各对的平均相似度。这些可视化表明,同一拉格的作曲在特征空间中通常更相似(高平均值),而不同拉格的作曲相似度相对较低(低平均值),这从经验上验证了基于特征分布进行拉格分类的可行性,也为加权距离旨在放大这种差异提供了直观支持。然而,论文并未在“实验结果”章节系统讨论这些可视化发现,而是仅聚焦于kNN的分类准确率表格。

🔬 细节详述

  • 训练数据:自建符号集,1000 首歌曲,36 维频率向量,标签 239 种拉格。分类实验选用 3 个常见拉格共 186 首。数据集未公开,也无获取方式说明。
  • 损失函数:无(kNN 无可学习参数)。
  • 训练策略:kNN 惰性学习,仅存储训练样本的 12 维归一化特征。
  • 关键超参数:k 值 3–7;权重分配 90:10 和 80:20;所有样本均归一化。
  • 模型大小:无模型。
  • 训练硬件:未说明。
  • 推理细节:对测试样本,分别用各候选拉格的权向量计算加权距离,由 k 最近邻多数投票决定最终拉格。
  • 正则化或技巧:无。

⚖️ 评分理由

  • 创新性 (0.8/2):首次将 Rabindra Sangeet 拉格识别构建为有监督分类并手工构建数据集,具领域新颖性。但整体方法停留在经典 kNN 加启发式权重,无机器学习算法或理论突破,且数据集未公开,贡献有限。
  • 技术严谨性 (0.5/1.5):距离定义和权重构造的数学描述清楚,但无任何理论推导或证明。90:10 权重分配完全凭经验,无合理性论证或参数灵敏度分析。部分边界情况(如缺少必需音的拉格)未讨论。
  • 实验充分性 (0.3/1.5):仅在三类拉格上与普通欧氏距离比较,无任何标准分类器(如 SVM、XGBoost)或时序模型对比;无混淆矩阵、置信区间或统计显著性检验;未报告交叉验证或方差,仅基于单次 75/25 划分;未讨论类别不平衡的影响(如 Khamaj 只有 37 首);整体实验设计极弱,无法支撑加权距离普遍有效的结论。实验准确率报告方式不一致,难以解读。[图像补充] 论文补充了多张可视化图表(图5-图7)来分析拉格间的余弦相似度,这些图表展示了组内相似性较高、组间相似性较低的现象,为特征有效性提供了定性支持,但未能与定量分类结果建立严格关联,且这些分析未在实验结果正文中系统讨论,使得实验证据链不完整。
  • 清晰度 (0.6/1):文章组织结构尚可,图表有助理解。但多处存在语法错误与术语缺失(如 “parjaay” 未定义),方法细节如训练/测试划分是否分层、权重分配来源等未解释,降低可读性。
  • 影响力 (0.3/1.5):对 Rabindra Sangeet 文化遗产有保存价值,但机器学习方法贡献极微,难以被更广泛的研究社群复用。数据集无公开、无可比基线,阻碍其影响力。与主流音乐信息检索社区距离远。
  • 开源 (0.0/1.5):论文未提供代码、数据集、模型权重或演示链接,也无任何获取途径或后续开源承诺。得分为 0。
  • 可复现性 (0.2/0.5):虽给出了权重构造规则和 k 值,但数据集构建依赖人工阅读记谱,未提供数字化文件或详细标注指南;训练/测试划分的样本列表和随机种子均未说明,基本无法复现。
  • 工程/实践价值 (0.3/1.5):提供了一个轻量符号处理流程,但手工录入环节使其无法规模化应用,工程实用价值极低。

🚨 局限与问题

  1. 论文明确承认的局限:许多拉格样本极少;权重比例人为设定;仅用 kNN 未比较其他分类器;未引入时序特征;未来计划扩展数据集并学习权重。
  2. 审稿人发现的潜在问题:
    • 实验基线极度贫乏:仅比较未加权欧氏距离,无法判断加权距离相对于任何标准机器学习或简单统计特征(如音符比例)是否有优势。典型的分类任务基线如线性 SVM 或随机森林完全缺失。
    • 准确率指标定义混乱:表 12 中的准确率是分类别准确率还是总体准确率?论文未说明。若是分类别准确率,则未提供宏/微平均;若是总体准确率,则被分解的方式不成立。这降低了结果解释度。
    • 权重设计未经验证:90:10 与 80:20 的比例纯粹启发式,未进行其他比例消融或自适应学习,无法确保其最优性。是否引入反事实拉格权重?未说明。
    • 数据集不公开致命:没有代码和数据,工作完全不可验证。声称的“数据集构建贡献”在科学上无法证实。
    • kNN 在小样本上的不稳定性:186 样本、k≤7,且未报告标准差,结果波动可能由随机性主导。无交叉验证进一步加剧不可信度。
    • 拉格结构假设过强:权重设计完全基于 Āroh-Avroh,但 Tagore 歌曲常偏离规定音,这种硬性先验可能错误编码噪声。没有分析权重的错误匹配案例。

← 返回 2026-07-09 语音/音乐/音频论文速递