论文解读

真采样对为何还不够:用真实标注训练采样识别并拆分数据与配方的贡献

该文针对采样识别中人工合成对难以模仿真实制作变换的问题,提出在真实采样对上全监督训练的 SIE 模型与训练配方,并在三个基准上报告优于前最优的结果,同时用对照实验说明数据替换与架构配方各自的贡献与代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9874 字 阅读 →
论文解读

采样标注连成巨网时,按边切分为何必然泄漏

该工作从社区采样标注中挖掘出 9.2 万条标注并揭示按边随机切分会使 54% 测试音轨泄漏,提出基于连通分量切分并修剪巨型分量得到 11.4 万/0.6 万/1 万音轨的 WhoSampled130k,代价是丢弃 23% 节点并保留有界泄漏风险。

 · 更新于 2026-09-24 · 约 16 分钟 · 7623 字 阅读 →
论文解读

同一首歌,不同找法:用指令把音乐检索的七种关系拆开诊断

该研究把参考音频加自然语言指令作为融合查询,用构造时就定义好的七种风格歌词旋律音色关系诊断表示的默认偏好,最强证据是五类模型在七个任务上最高点估计互相反转且声学编码器与文本对齐编码器互补,而轻量文本条件融合未能一致提升主干。

 · 更新于 2026-09-24 · 约 19 分钟 · 9047 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

存档不是存文件:用对象/事件翻译把作曲过程留下来并放大参与

论文面对 Barlow 异构、过程性、软件依赖的原生数字遗产,提出以对象/事件框架加可扩展分类把过程翻译为可互操作元数据,证据是多 TB 硬盘遗产的原型编目与 Sibelius/MIDI/DOC/PDF 关联难题,代价是形式化必然不完备而需参与式持续修订。

 · 更新于 2026-09-24 · 约 21 分钟 · 10058 字 阅读 →
论文解读

用坐标找配乐:手工聚类守住可解释基线,深度生成模型换来连续检索

该文在 FME-24 上比较手工特征 k-Means 与 VaDE 加对比学习的情感检索,前者聚类更紧致而后者支持按坐标连续取歌,但两类结果都受样本少与情感区间压缩的限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9590 字 阅读 →
论文解读

把选片、排序、写稿、配乐装进同一个离散词表:AutoCut 如何做可控的广告剪辑

AutoCut 针对广告视频制作中多模态松散耦合与剪辑不可控问题,用残差向量量化把视频与音频变成与文本共享的离散词元并经两阶段训练统一推理,在 364 个样本的同一评测上取得排序准确率 0.10714 与脚本质量 84.6255 等最佳结果,代价是依赖已有素材库检索而不能从零生成像素。

 · 更新于 2026-09-24 · 约 20 分钟 · 9532 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只靠同曲更相似会学偏:用三种信号处理相似度把乐器相似表示拉回跨曲

针对按乐器算跨曲相似时仅用曲内三元组会学到重复线索的问题,该工作在预训练中按 1:1 混入曲内相似与三种信号处理相似度构造跨曲三元组,再用少量 ABX 偏好微调,并在 Slakh 四种乐器上用感知一致率验证,最强的 LocalTS+FPs 组合在 Clean 与 Cascade 下都提升了乐器平均分,但不同乐器最优线索不同且分离误差会改变行为。

 · 更新于 2026-09-24 · 约 18 分钟 · 8609 字 阅读 →
论文解读

把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉

音乐检索 | 7.3/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12385 字 阅读 →
论文解读

用对比学习给 JEPA 当老师:7M 参数如何靠目标设计逼近 330M 大模型

音乐理解 | 6.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10477 字 阅读 →
论文解读

AllMusicCaps:让专辑评论成为可检索音乐语义的补充监督

论文把专家专辑评论转为曲目级 caption,并在混合语料、编码层和目标函数的分轴比较中检验其适用范围。

 · 更新于 2026-09-24 · 约 20 分钟 · 9527 字 阅读 →
论文解读

Unified Music Identification for Tracks and Versions

音乐检索 | 8.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6149 字 阅读 →
论文解读

Steering dense music retrieval with open-vocabulary concept discovery

音乐检索 | 7.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6289 字 阅读 →
论文解读

Towards Robust Version Identification in the Wild: A Dataset, Benchmark, and Fine-Tuning Study

音乐检索 | 8.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7467 字 阅读 →
论文解读

Reflector: Arrangement-Aware Harmonic Retrieval for Sample-Based Composition

音乐检索 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5708 字 阅读 →
论文解读

MeloBottleneck: Self-Supervised Melody Skeleton Extraction with a Latent Subsequence Bottleneck

音乐理解 | 7.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8118 字 阅读 →
论文解读

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

音乐检索 | 5.4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6172 字 阅读 →
论文解读

Taste-aware music retrieval from audio embeddings

音乐检索 | 6.9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6947 字 阅读 →