Local Chord Corruption Is Not Recognizer Replay: Chord-Condition Propagation in MIDI-SAG

📄 集中一击不等于真实部署:局部和弦损坏为何夸大了伴奏生成器的反应 英文题目:Local Chord Corruption Is Not Recognizer Replay: Chord-Condition Propagation in MIDI-SAG 一句话:论文把中央四秒三全音损坏与完整识别器回放放在同一冻结渲染管线里配对比较,发现前者在三类色度特征上都显著放大了条件传播,而匹配时间支撑与关系构成后差距大幅缩小,但全部证据仍限于单一生成器检查点与客观色度指标。 标签:#音乐生成 | #生成模型 | #音乐理解 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Weiwen Huang:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把局部三全音探针和完整识别器回放钉在同一生成器、同一轨道、同一窗口上硬碰硬,校准思路干净且在两条识别器路径上都复现了,值得肯定。但全部结论拴在一个冻结的 MIDI-SAG 检查点和 30 条配对窗口上,没有跨生成器、没有听感实验,所谓部署行为锚定更像是在自家渲染管线里自证。 📌 核心摘要 本文要回答歌声伴奏生成中局部合成和弦损坏能否代表部署时自动和弦识别输出的真实控制条件。做法是冻结人声轨道、生成器上下文、提示、种子与 12 秒评分窗,只切换和弦条件,对比中央 4 秒三全音替换与完整识别器序列回放经固定 MIDI-SAG 生成器后的输出传播,并用复制支撑掩码与关系构成计数的合成代理做校准。相对已有工作问生成器能否容忍错误和弦,本文转向评估问题,即局部探针与完整操作条件是否等价。在 30 条配对轨道上中央损坏在短时傅里叶变换色度、恒 Q 变换色度、色度能量归一化统计量三视图的变更目标效应与内部输出变化均大于卷积神经网络结合条件随机场完整回放,色度能量归一化统计量目标差距均值 0.462,29 条轨道为正。18 条独立诊断轨道上相对根音替换的整窗输出变化约为同根音质量翻转的 2.88 倍。支撑匹配与构成匹配各自大幅缩小回放距离,二者联合取得最低回放距离,并在深度色度结合条件随机场路径上复现。意义在于给出可复用的分离式评估协议,局部编辑测和声机制,完整回放锚定部署条件。局限是证据限于单一生成器检查点与有限筛选曲库,且以色度族客观特征为主而无主观听感验证。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 787 words

Artificial Rosetta Stone: Constrained Maximum A Posteriori (MAP) Reconstruction of Symbolic Raga Sequences via Order-k Markov Models

📄 把拉格从玄学拉回有限状态:当重建变成约束 MAP 的精确动态规划 英文题目:Artificial Rosetta Stone: Constrained Maximum A Posteriori (MAP) Reconstruction of Symbolic Raga Sequences via Order-k Markov Models 一句话:论文把受损哼唱的符号补全定义为带观测一致与语法可行的约束 MAP 优化,用对称狄利克雷平滑的 k 阶马尔可夫核与有限记忆动态规划求全局最优,在真实 Yaman 录音衍生序列上二阶模型取得 0.470/0.414/0.371 的缺失准确率,代价是丢弃连续音高与甘马克且仅在 6 条测试序列的小样本流水线自洽意义上成立。 标签:#音乐理解 | #自回归模型 | #音乐生成 | #理论分析 评分:6.8/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Saanvi Raghavendran:Abstract Math Institute Abhishek Bhattacharjee:Abstract Math Institute 💬 毒舌点评 亮点在于把印度古典音乐中常被混为一谈的概率建模、硬约束满足与历史真实性做了清晰切割,并对有限记忆约束下的约束最大后验(Constrained Maximum A Posteriori, Constrained MAP)给出了可验证的动态规划最优性证明,数学写作比多数计算音乐学论文更自律。短板是实证部分仅基于 6 条测试序列的 Yaman 自动转录流水线,且符号真值本身由同一套基频跟踪与主音估计产生,所谓真实数据评估本质是流水线自洽性检验,离档案级重建的证据标准差距很大。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1374 words

Accurate Plate Reverb Parameter Estimation Using Two-Stage Evolutionary Search

📄 把响度与形状拆开:用归一化解耦让板混响参数在病态地形中收敛 英文题目:Accurate Plate Reverb Parameter Estimation Using Two-Stage Evolutionary Search 一句话:从单条板混响脉冲响应反演 6 个物理参数时,论文用峰值归一化的 CMA-ES 形状搜索加未归一化的 μ 三等分搜索两阶段解耦,并在 50 条合成 IR 上以无压缩单分辨率 L1-STFT 损失实现 10^-14 量级 NMSE,代价是单样本最坏数百秒的黑盒评估与对边界拾音点的系统性失效。 标签:#音乐理解 #端到端 #模型评估 评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Byunghoo Park:机构信息未在 arXiv HTML 中可靠披露 Jayeon Yi:机构信息未在 arXiv HTML 中可靠披露 Takyoung Kim:机构信息未在 arXiv HTML 中可靠披露 Minje Kim:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把板混响物理反演这个病态多峰黑盒问题用归一化解耦的两阶段演化搜索拆得干净,并用逐项消融实锤无界对数压缩是收敛崩塌的元凶,诊断比方法本身更值钱。短板是全程只在两组各 50 条合成脉冲响应上自证,无真实录音、无噪声与模型失配测试、无多次种子统计,且单样本最多 400 重启与 30000 次仿真评估的最坏耗时超 600 秒,离实时与大规模部署相去甚远。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1482 words

CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations

📄 用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型 英文题目:CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations 一句话:针对对比学习全局强局部弱、JEPA 局部强却依赖 EMA 且易坍缩的矛盾,CoJEPA 用同一 ViT-1D 主干在类别令牌上做对比、在序列令牌上做掩码潜预测,以对比梯度替代 EMA 实现稳定,并在 7 个音乐任务上尤其以调性与和声取得显著增益,代价是深层谐波信息衰退与私有数据限制复现。 标签:#音乐理解 #自监督学习 #对比学习 #Transformer #音乐检索 评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Gabriel Meseguer-Brocal:机构信息未在 arXiv HTML 中可靠披露 Yuexuan Kong:机构信息未在 arXiv HTML 中可靠披露 Romain Hennequin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用对比学习梯度直接替代联合嵌入预测架构的指数移动平均教师,单主干在类别令牌与序列令牌上分工施加全局对比与局部潜空间预测,7.1M 参数在调性与和声任务上逼近 330M 的 MusicFM,思路干净且有效。短板是预训练依赖未公开的 22M 私有曲库且无代码权重,掩码比例在方法章与训练章表述矛盾,层间性能波动大却缺乏对预测器深度与损失权重的消融,稳定性声明缺少损失曲线与坍缩度量支撑。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1263 words

Vocal Music under Phoneme-Conditional Analysis

📄 歌声里藏着母语的口型:当音素的物理约束在旋律中留下指纹 英文题目:Vocal Music under Phoneme-Conditional Analysis 一句话:论文用同曲内音素条件分析检验罕见音素在歌唱中的声学残留,在 9 个语言 5024 首歌上以 35 维歌曲向量实现 85.5% 语言判别,同时揭示舌体手势保存而时长与基频竞争性衰减的分化,代价是 46% 曲目因对齐门控被丢弃且保存率依赖异源言语基线。 标签:#音乐理解 #对比学习 #模型评估 评分:8.0/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Hayoon Kim:机构信息未在 arXiv HTML 中可靠披露 Kyogu Lee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于将音系类型学罕见特征转化为可检验的声学假设,并用同曲内匹配控制把歌手、旋律、流派的混淆压到最小,解决了以往记谱量化导致节奏关联消失的分辨率陷阱。短板是所有保存率都依赖跨语料的文献基线而非同人同曲的言歌配对,且 46% 曲目因对齐门控被丢弃,音色通道上残余伴奏泄漏未被量化,使最大的 MFCC 效应恰好落在最不可信的通道。 📌 核心摘要 论文要回答无伴奏歌声是否携带可测量的语言身份,以及该身份能否追溯到具体音素的发音约束。方法核心是音素条件分析(phoneme-conditional analysis),以同一首歌内标记音素(marker)与匹配非标记对照的成对比较隔离发音效应,并在 5 个声学维度上度量差异。与以往依赖记谱 nPVI(normalized Pairwise Variability Index,归一化成对变异指数)或孤立研究声调-旋律对应的做法不同,该框架同时覆盖辅音库存的声学后果并统一节奏、旋律、音色评估。基于 9 种语言、5,024 首通过对齐门控的曲目构建的歌曲级向量在按艺术家分组的 9 分类中达到 85.5% 平衡准确率,显著高于 11.1% 随机基线,但作者明确将可分性是否源于音素局部效应的累积列为开放问题。该工作为音乐信息检索(Music Information Retrieval,MIR)提供了语音学可解释的语言判别线索,局限在于仅覆盖 9 种语言且为榜单流行曲、保存率依赖异源言语基线、以及对齐压缩与声源分离残余带来的测量下界。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1274 words

Weakly Supervised Tabla Stroke Transcription via an Adaptive Dynamic Rhythm Language Model (ADRM)

📄 只给顺序不给时间:用会遗忘的节奏记忆补上塔布拉转录的弱监督缺口 英文题目:Weakly Supervised Tabla Stroke Transcription via an Adaptive Dynamic Rhythm Language Model (ADRM) 一句话:为解决塔布拉逐点对齐标注昂贵的问题,论文用 CTC 声学模型生成候选格,再以全局塔拉统计与局部指数遗忘记忆互补的 ADRM 做离线重打分,在四套数据上将符号错误率相对降低约 19% 至 35%,代价是毫秒级定位仍弱且依赖格的质量。 标签:#音乐转录 #RNN #音乐理解 #自监督学习 #数据集 评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Rahul Bapusaheb Kodag:机构信息未在 arXiv HTML 中可靠披露 Vipul Arora:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把自动语音识别(Automatic Speech Recognition,ASR)中连接时序分类(Connectionist Temporal Classification,CTC)+ 语言模型重打分的老套路完整搬到弱监督塔布拉鼓点转录(Tabla Stroke Transcription,TST)上,并用全局先验与局部自适应狄利克雷模型做出可解释的节奏约束,相对误码率(Stroke Error Rate,SER)下降 30% 左右是实打实的。短板是声学模型仍是 12 层卷积因子化时延神经网络(Convolutional Factorized Time-Delay Neural Network,C-TDNN-F)这种 ASR 古董,时序对齐 F1 在 50 ms 容差下仅 8.9% 却敢称可恢复时序,且所谓新数据集表演即兴数据集(Tabla Improvisation Dataset,TID)仅 133 分钟单人单鼓录制,泛化说服力有限。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1245 words

What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models

📄 听见了,就要指得出来:用可验证的时间证据检验音乐大模型的耳朵 英文题目:What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models 一句话:论文把“是否真的听见”形式化为按自然语言查询返回时间区间的定位任务,并用全合成钢琴渲染构建 MusicGroundingBench 来精确评测,发现现有音频大模型零样本几乎无法定位而任务微调后可达高精度,但合成单声部短片段的代价限制了向真实音乐的泛化。 标签:#音乐理解 #参数高效微调 #基准测试 评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kun Fang:机构信息未在 arXiv HTML 中可靠披露 Ziyu Wang:机构信息未在 arXiv HTML 中可靠披露 Ichiro Fujinaga:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把音乐 grounding 从空洞的 caption 正确率拉回到可验证的时间证据上,用全合成 MIDI 渲染实现符号到音频的精确对齐,任务定义清晰且可控。短板也同样源于这种可控:严格单声部钢琴、PianoTeq 9 Stage 合成、时长不超过 10 秒,与真实多声部、多音色音乐距离过远,零样本基线几乎全失效也让对比缺乏说服力,定位监督对理解的增益仅在单一骨干上显现,结论只能算探索性。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1216 words

Effects of HRTF Augmentation on Predicted Spatial Release from Masking in Music

📄 把空间感调得更夸张,音乐会更清晰吗? 英文题目:Effects of HRTF Augmentation on Predicted Spatial Release from Masking in Music 一句话:该研究用群体 PCA 残差放大来夸张头相关传输函数中的频变耳间级差,在正常听力模型上把空间释放掩蔽平均抬高约 3.08 dB,但代价是在中度听损模拟下增益缩至 1.05 dB 且助听压缩无法挽回,且全程仍是模型预测而非真人听音。 标签:#音乐理解 #空间音频 #助听器 评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Jack Webb:Dyson School of Design Engineering, Imperial College London, United Kingdom Christophe Lesimple:Sonova AG, Stäfa, Switzerland Volker Kuehnel:Sonova AG, Stäfa, Switzerland Lorenzo Picinali:Dyson School of Design Engineering, Imperial College London, United Kingdom 💬 毒舌点评 亮点在于把群体主成分分析(Principal Component Analysis, PCA)残差对比度放大这一简洁思路首次系统用于头相关传输函数(Head-Related Transfer Function, HRTF)频变耳间级差(Interaural Level Difference, ILD)增强,并用双模型在音乐场景下量化了空间释放掩蔽(Spatial Release from Masking, SRM)的增益与听损衰减,问题意识清晰且工程动机贴合助听场景。短板是全程无真人听音验证、仅依赖 vicente2020 与 bischof2023 两个语音/复杂音衍生模型的预测,且听损与宽动态范围压缩(Wide Dynamic Range Compression, WDRC)建模高度简化,导致对音乐场景分析(Music Scene Analysis, MSA)中音高、谐波与信息掩蔽等关键机制的结论外推力不足。 ...

2026-08-31 · 更新于 2026-09-04 · 6 min · 1097 words

Klangfarbenakkord and Klangfarbenharmonien Metric Space Models for Music on Informational Geometry 1

📄 当和声不再只谈音高:用搬运代价度量音色的几何 英文题目:Klangfarbenakkord and Klangfarbenharmonien Metric Space Models for Music on Informational Geometry 1 一句话:论文把归一化频谱当作概率分布,用一维最优传输距离以赫兹为单位拆解音色差异,并以三角形面积与方差度量和弦的融合度,却只在少量自采录音上给出个案验证。 标签:#音乐理解 #生成模型 #可解释性 #理论分析 评分:5.5/10 | 创新 1.3/2 | 技术严谨 0.9/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5 👥 作者与机构 Yusei Tamura:机构信息未在 arXiv HTML 中可靠披露 Shigekazu Ishihara:机构信息未在 arXiv HTML 中可靠披露 Ken Ito:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于将一维 Wasserstein 距离与频谱质心偏移解耦为可解释的音色差异量,并尝试把和声学从音高扩展到音色几何,概念上呼应了 Schönberg 的 Klangfarbenmelodie 命题。短板是全篇停留在 2 至 3 个音色的玩具示例与可视化热力图,没有可复现的基准、统计检验或与现有音色相似度度量的量化对比,更像一篇思辨性音乐学随笔而非可验证的信息几何模型。 ...

2026-08-31 · 更新于 2026-09-04 · 3 min · 582 words

MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance

📄 看得懂谱,听得出演奏,才算懂音乐:MuSP-Bench 为何要把乐谱与演奏放在一起考 英文题目:MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance 一句话:MuSP-Bench 用 490 道由音乐家围绕完整作品编写的长程题目,把乐谱意图与演奏实现之间的诠释性推理做成可控对比的基准,并用四种等价输入证明结构化符号在分析上最强而原始音频与图像的联合推理仍大幅失效。 标签:#音乐理解 #多模态模型 #基准测试 #模型评估 评分:6.2/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Milan Liessens Dujardin:机构信息未在 arXiv HTML 中可靠披露 Song-Ze Yu:机构信息未在 arXiv HTML 中可靠披露 Kevin Miao:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用490道人工长程题把乐谱意图(Score)与演奏实现(Performance)的诠释性推理做成可测基准,精准命中既有基准只做单图短ABC或只做音频感知的盲区,设计洞察到位。短板是仅18首古典钢琴+6段管弦乐、490题切分子集后统计功效薄弱,且仅测5个前沿模型、缺人类天花板与显著性检验,标注一致性与难度校准亦未量化,导致区分度与外推性仍模糊。 📌 核心摘要 既有音乐理解基准多孤立评估乐谱或音频感知,缺乏对乐谱意图与演奏实现之间跨模态、长时程诠释性推理的系统检验。为此论文提出MuSP-Bench(Multimodal Score-Performance Benchmark),由2名专业音乐家围绕18部完整古典钢琴作品/乐章与6段管弦乐摘录人工编写490道题目,其中460道为开放式预定义格式(音高、小节号、和弦进行、时间戳、乐句等,允许多答案以容纳歧义)、30道为选择题,覆盖音高、织体、和声、曲式、演奏技法与诠释等层级。基准按四维标注:模态(Modality,S/P/S&P/S/P)、时域跨度(Horizon,短19.2%/中25.1%/长36.1%/任意19.6%)、内容层级与操作类型,并支持音频(Audio)、演奏MIDI文本化(MIDI-as-text,ABC音名渲染)、ABC记谱与乐谱图像(Score Image)四种等价输入的对齐对比。实验评估GPT-5.6 Sol、Qwen3.6-Plus、Audio Flamingo Next、Muse Spark 1.2、Qwen3.5-Omni-Plus共5个前沿多模态大模型,发现结构化符号输入在分析类任务上最强,而图像与音频仅在调性、风格、作曲家等全局属性上占优,跨模态联合推理(S&P)仍大幅失效。该基准为面向教育与艺术实践的真实音乐智能提供了稀缺的长程跨模态评估基础,但样本局限于古典、题量与模型覆盖有限。 ...

2026-08-31 · 更新于 2026-09-04 · 3 min · 621 words