Beyond Dry References: Learning Relative Audio Effects Representations via Contrastive Distance Learning

📄 Beyond Dry References: Learning Relative Audio Effects Representations via Contrastive Distance Learning 标签:#音乐理解 #对比学习 #自监督学习 7.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #对比学习 | #自监督学习 | arxiv 👥 作者与机构 第一作者:Xinlu Liu(未说明) 通讯作者:未说明 作者列表:Xinlu Liu(未说明)、Huibin Lin(未说明)、Weixing Wei(未说明)、Zhenhai Yan(未说明) 💡 毒舌点评 RelFx 把“绝对效果状态”换成“相对效果距离”,方向确实聪明——至少在真实录音没有干声参考这件事上,它终于不再假装世上存在干净的 dry track。反称融合让同一个 embedding 既能表达加效果也能表达去效果,比 Fx-Encoder++ 那种单向往死里编码的范式更接近工程师的直觉,MUSDB18 平均 Ld 降 13.3% 是可以写进论文的硬数字。但别高兴太早:式(1)里 x’=x 的 special case 与后文“同段落相邻非重叠片段”的训练配对互相打架,读者得在符号泥潭里爬三个来回才搞懂;全部验证依赖 Ld 这种重建式指标,没有一个主观听感实验,真实效果链和未见链序全推给“未来工作”;模型权重、训练数据全都不公开,demo 页面倒是挺漂亮。一句话:思路是真好,验证是真糙——差一步从“好工作”变成“可信的好工作”。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 710 words

MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space

📄 MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space 标签:#音乐理解 #自监督学习 #音乐生成 #数据集 #基准测试 7.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #自监督学习 | #音乐生成 #数据集 | arxiv 👥 作者与机构 第一作者:Jinwen Zhou(Queen Mary University of London) 通讯作者:未说明 作者列表:Jinwen Zhou(Queen Mary University of London)、Huan Zhang(未说明)、Weixi Zhai(未说明)、Jinhua Liang(未说明)、Aidan O. T. Hogg(未说明)、Simon Dixon(未说明) 💡 毒舌点评 MAJEPPA 最持久、也最可能被后续工作引用的贡献,是那个横跨六水平、六场景的 3,979 段数据集和 EVPMR 基准;相比之下,“冻结 Aria-medium 加 LoRA,再叠三个对比损失”的方法组合更接近工程集成而非范式突破。问题在于论文把“既能生成又能理解”作为核心卖点,却明文承认没有做生成能力评测,转录质量也未核查,理解侧证据完整而生成侧几乎为空。UMP 因 token 方案限制只与 Aria 可比,Chopin PairAcc 标准差高达 9.4 且无显著性检验,这些都会让“全面优于基线”的表述显得过于激进。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 732 words

Measuring Cross-Cultural Style Diffusion Through Era Classification: US and Korean Popular Music

📄 Measuring Cross-Cultural Style Diffusion Through Era Classification: US and Korean Popular Music 标签:#音乐理解 #迁移学习 #模型评估 8.3/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐理解 | #迁移学习 | #模型评估 | arxiv 👥 作者与机构 第一作者:未说明 通讯作者:未说明 作者列表:Dasol Lee(未说明)、Minhee Lee(未说明)、Seonguk Ju(未说明)、Daewoong Kim(未说明)、Harin Lee(未说明)、Dasaem Jeong(未说明) 机构信息:原文未提供任何作者所属机构。 💡 毒舌点评 用 Billboard 训练的 era classifier 去给 Melon 歌曲“定年”,把跨文化风格延迟转成可量化的时间差,这个透镜比直接用体裁或情绪标签做跨文化比较更干净,也有一定新意。主要短板是主结论“1990年代滞后减半”基本停留在描述性统计层面,缺少显著性检验、零假设模型和更细粒度的声学归因;跨架构一致性在 2000 年代出现分歧,使得“收敛”这一表述在部分架构上并不成立。此外,Melon→Billboard 反向推断的源域模型精度过低(macro 52.4%),只能作为方向性佐证。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 706 words

Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis

📄 Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis 标签:#音乐理解 #变分自编码器 #无监督学习 #可解释性 7.1/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #变分自编码器 | #无监督学习 #可解释性 | arxiv 👥 作者与机构 第一作者:Seonguk Ju(机构未说明) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Seonguk Ju(机构未说明)、Seola Cho(机构未说明)、Sooin Chung(机构未说明)、Danbinaerin Han(机构未说明)、Dasaem Jeong(机构未说明) 💡 毒舌点评 用 VQ-VAE 给连续音高轮廓学一套离散词表,并把“相位、时长、音高、幅度略不同但形状相似”的装饰音压成同一个 token,这个对齐鲁棒重建损失是全文最有价值的想法,且代码和 demo 均公开,算得上诚实工作。但验证盘太小:唯一可比基线是自编码器+UMAP+K-Means,没有和任何其他无监督或自监督音频表征对比;sigimsae 探针离监督模型仍差一大截;模式分析也只是几个 token 的零散案例,没有整体统计或显著性检验。作为方法研究报告成立,但距离“可直接用于语料级音乐学分析”的强声明还有明显证据缺口。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 669 words

Beyond Piano: Cross-Instrument MIDI Velocity Estimation via Differentiable SoundFont Proxies

📄 Beyond Piano: Cross-Instrument MIDI Velocity Estimation via Differentiable SoundFont Proxies 标签:#音乐理解 #领域适应 #模型评估 7.3/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #领域适应 | #模型评估 | arxiv 👥 作者与机构 第一作者:Zhanhong He(未说明) 通讯作者:未说明 作者列表:Zhanhong He(未说明)、Hanyu Meng(未说明)、David Defeng Huang(未说明)、Roberto Togneri(未说明) 💡 毒舌点评 用可微分 SoundFont 代理把波形重建换成 PHE/OSF 参数匹配,提出了一条比 DDSP 波形监督更聚焦 velocity 的适配路线,并在无标签吉他数据(GAPS/FL)上取得一致提升。但核心结论仍缺少目标域真实 velocity 标签的直接验证;钢琴上的代理适配只是 sanity check,MAEVelo 10.5 与有监督的 3.9 差距明显,且在 SMD 上的响度相关未超过零样本基线。只覆盖钢琴和吉他,“cross-instrument"的普适性尚不足以服众。 ...

2026-08-11 · 更新于 2026-08-14 · 6 min · 1161 words

Beyond Call and Response: Modelling Reciprocal Coordination in Human-AI Vocal Ensembles

📄 Beyond Call and Response: Modelling Reciprocal Coordination in Human-AI Vocal Ensembles 标签:#歌唱生成 #生成模型 #音乐理解 #音频交互 5.5/10 | 创新 1.3/2 | 严谨 0.9/1.5 | 实验 0.4/1.5 | 清晰 0.9/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #歌唱生成 | #生成模型 | #音乐理解 #音频交互 | arxiv 👥 作者与机构 作者列表:Polina Proutskova(Industry Commons Foundation,Stockholm,Sweden) 唯一作者:Polina Proutskova 通讯作者:未单独标注;文首提供邮箱 polina.proutskova@industrycommons.net 机构:Industry Commons Foundation,Stockholm,Sweden 💡 毒舌点评 把“无指挥、无伴奏人声重唱”重新定义成没有外部时钟的多对多递归协调问题,并拿非等时性作为硬案例,这个视角确实比常见的“听-回应”音乐 AI 框架更贴近真实集体演唱。但整篇目前基本是一份研究议程:VocalLanes 只完成了采集和对齐,符号表示仍在开发中,状态推断、影响建模、AI 代理与比较评估全部处于 proposed 状态,关键声明没有任何端到端验证。以顶会标准看,缺的不是问题意识,而是能把“协调”落实到可测量结果上的实验闭环。 ...

2026-08-10 · 更新于 2026-08-14 · 3 min · 427 words

Frame-Level Pansori Mode Classification with Complementary Audio Representations

📄 Frame-Level Pansori Mode Classification with Complementary Audio Representations 标签:#音乐理解 #模型集成 #数据集 #基准测试 7.6/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐理解 | #模型集成 | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:Sangheon Park(机构未说明) 通讯作者:未说明 作者列表:Sangheon Park(未说明)、Seonguk Ju(未说明)、Suin Chung(未说明)、Danbinaerin Han(未说明)、Dasaem Jeong(未说明) 💡 毒舌点评 把长期被 MIR 忽视的韩国传统说唱体裁做成 46 小时帧级标注加多表征框架,数据与双划分协议是实打实的贡献,跨模态分歧分析也有音乐学说服力;但集成模型在更严苛的 Work-level Split 下打不过单一 Mel 特征,且标注只由一位专家完成、缺少信度统计,再加上模型权重未公开,整体叙事只能算“有洞察的基准工作”而非“高精度系统”。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 674 words

From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music

📄 From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music 标签:#音乐理解 #大语言模型 #多语言 #模型评估 5.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.6/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 5.5/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #音乐理解 | #大语言模型 | #多语言 #模型评估 | arxiv 👥 作者与机构 第一作者:Sangheon Park(佐治亚理工学院) 通讯作者:未说明 作者列表:Sangheon Park(佐治亚理工学院)、Claire Arthur(佐治亚理工学院) 💡 毒舌点评 论文用人工构建的 taxonomy 加双语自由描述数据,把“提示词语言”和“聆听描述语言”之间的结构性差异刻画得很清楚,Genre 可传播、Story/Narrative 高密度错位的发现对 TTM 交互设计有实际参考价值。但几乎所有关键结论都建立在单一 TTM 系统 Udio 和一个被试招募渠道不一致的中英样本上,作者却把“narrative 无法被声学编码”说成了生成系统的一般性缺陷,因果断言超过数据能支撑的范围。更扎眼的是,跨文化 presence 分析报告的 OR 值全部小于 1,正文却写韩语组“more”,编码方向没有交代清楚,读者无法判断结论是否与数据一致。如果能加入多系统生成对照、同一提示词的人工重写实验,并补充人类标注一致性指标,结论会扎实很多。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 802 words

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

📄 Helping Music Co-Creation Agents ‘Listen’ Well: Hierarchical Self-Supervised World Models for Understanding and Generation 标签:#音乐理解 #自监督学习 #音乐生成 #Transformer #音频理解 7.1/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #自监督学习 | #音乐生成 #Transformer | arxiv 👥 作者与机构 第一作者:Scott H. Hawley(Belmont University, Department of Chemistry & Physics) 通讯作者:未说明 作者列表:Scott H. Hawley(Belmont University, Department of Chemistry & Physics) 💡 毒舌点评 论文把“AI 音乐制作人”这种偏产品化的愿景落成一个可验证的自监督符号音乐表征系统,有一个明确且自洽的工程约束:CPU 上也要能实时给出建议。方法上没有范式级突破,但“层级 Swin V2 + JEPA 式目标 + 软因子分解 + 像素空间流匹配”的组合在音乐领域有一定区分度,层级探针结果也基本支撑“时间尺度→表征层级”的核心隐喻。问题在生成侧:只有像素 F1、掩码区密度恢复和延迟指标,没有任何听感、音乐性或用户层面验证,也没有与任何现有音乐生成模型对比,因此“AI Rick Rubin”的生成价值只能算被演示,尚未被证明。此外,探针报告的“最佳层级”是在事后从多个层级中选出的,未做多重比较校正,证据强度偏弱。 ...

2026-08-06 · 更新于 2026-08-14 · 4 min · 725 words

Masked diffusion enables coherent beat tracking

📄 Masked diffusion enables coherent beat tracking 标签:#音乐理解 #扩散模型 #模型集成 #多任务学习 #音频理解 6.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #扩散模型 | #模型集成 #多任务学习 | arxiv 👥 作者与机构 第一作者:Francesco Foscarin(未说明机构) 通讯作者:未说明 作者列表:Francesco Foscarin(未说明机构)、Filip Korzeniowski(未说明机构)、Richard Vogl(未说明机构) 💡 毒舌点评 把 masked diffusion 从语言/图像生成迁移到节拍追踪,并用“双通道独立掩码+平衡反掩码+步间峰值拾取”解决事件稀疏、类不平衡与相邻伪峰问题,方向很漂亮,GTZAN 上无 DBN 条件下全面超过 Beat This 和 Gagneré ST-BCE,也让“连贯性”从口号变成了可测结果。但公开评测几乎只有 GTZAN 一个数据集,且三个关键设计没有做独立的组件级消融;与 SOTA 的对比数值又取自原论文而非统一重测,结论的普适性和归因强度仍显不足。 ...

2026-08-06 · 更新于 2026-08-14 · 4 min · 640 words