真采样对为何还不够:用真实标注训练采样识别并拆分数据与配方的贡献
该文针对采样识别中人工合成对难以模仿真实制作变换的问题,提出在真实采样对上全监督训练的 SIE 模型与训练配方,并在三个基准上报告优于前最优的结果,同时用对照实验说明数据替换与架构配方各自的贡献与代价。
该文针对采样识别中人工合成对难以模仿真实制作变换的问题,提出在真实采样对上全监督训练的 SIE 模型与训练配方,并在三个基准上报告优于前最优的结果,同时用对照实验说明数据替换与架构配方各自的贡献与代价。
该工作从社区采样标注中挖掘出 9.2 万条标注并揭示按边随机切分会使 54% 测试音轨泄漏,提出基于连通分量切分并修剪巨型分量得到 11.4 万/0.6 万/1 万音轨的 WhoSampled130k,代价是丢弃 23% 节点并保留有界泄漏风险。
该研究把参考音频加自然语言指令作为融合查询,用构造时就定义好的七种风格歌词旋律音色关系诊断表示的默认偏好,最强证据是五类模型在七个任务上最高点估计互相反转且声学编码器与文本对齐编码器互补,而轻量文本条件融合未能一致提升主干。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
论文面对 Barlow 异构、过程性、软件依赖的原生数字遗产,提出以对象/事件框架加可扩展分类把过程翻译为可互操作元数据,证据是多 TB 硬盘遗产的原型编目与 Sibelius/MIDI/DOC/PDF 关联难题,代价是形式化必然不完备而需参与式持续修订。
该文在 FME-24 上比较手工特征 k-Means 与 VaDE 加对比学习的情感检索,前者聚类更紧致而后者支持按坐标连续取歌,但两类结果都受样本少与情感区间压缩的限制。
AutoCut 针对广告视频制作中多模态松散耦合与剪辑不可控问题,用残差向量量化把视频与音频变成与文本共享的离散词元并经两阶段训练统一推理,在 364 个样本的同一评测上取得排序准确率 0.10714 与脚本质量 84.6255 等最佳结果,代价是依赖已有素材库检索而不能从零生成像素。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对按乐器算跨曲相似时仅用曲内三元组会学到重复线索的问题,该工作在预训练中按 1:1 混入曲内相似与三种信号处理相似度构造跨曲三元组,再用少量 ABX 偏好微调,并在 Slakh 四种乐器上用感知一致率验证,最强的 LocalTS+FPs 组合在 Clean 与 Cascade 下都提升了乐器平均分,但不同乐器最优线索不同且分离误差会改变行为。
音乐检索 | 7.3/10
音乐理解 | 6.5/10
论文把专家专辑评论转为曲目级 caption,并在混合语料、编码层和目标函数的分轴比较中检验其适用范围。
音乐检索 | 8.2/10
音乐检索 | 7.7/10
音乐检索 | 8.0/10
音乐检索 | 7.7/10
音乐理解 | 7.5/10
音乐检索 | 5.4/10
音乐检索 | 6.9/10