英文题目:Automatic Curation of Large-Scale, High-Quality, Multi-Category Music Source Separation Dataset

会议身份:conference:interspeech:2026:conference-paper-id:ji26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #音乐 #音乐源分离

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Yu Ji:机构信息未能从会议 PDF 纯文本可靠映射
  • Shuo Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yuetonghui Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Mengmei Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Qiang Ji:机构信息未能从会议 PDF 纯文本可靠映射
  • zerui Han:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音乐源分离的输入是多乐器混音,输出是钢琴鼓等独立音轨,难点在于网络爬取的独奏查询常混入人声他种乐器与噪声导致标签错位。作者构建三段式流水线:先定义七类固定音轨分类体系,再为每类训练单源检测器筛选纯净片段,最后用多语言独奏关键词爬取视频并经检测器清洗拼接为可用音轨。筛选输出直接作为清洗后数据集进入分离模型训练,使弱标签过滤与混音合成解耦,而非依赖分离模型自身容忍噪声。与直接混用爬取数据相比,该机制差异在于把高阈值二分类显式建模为质量数量权衡点,而非扩大合成规模。在MoisesDB与MedleyDB验证集和测试集构成的评测基准下,联合ACMID清洗数据训练模型的平均信号失真比SDR为6.05 dB,高于仅基线数据训练模型的平均信号失真比SDR 4.89 dB。该结论适用边界受限于流行乐常见乐器与相近录音分布,对民乐与高度重叠合奏的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决哪一环?

本文输入是公开平台上可爬取的独奏乐器视频音频,目标是产出可直接用于训练音乐源分离模型的大规模、高质量、多类别单乐器音频集合。音乐源分离这个任务可以白话理解为把一首混好的歌拆回各个乐器分轨,例如把钢琴、鼓、贝斯、吉他、弦乐和管乐分别还原出来,后续可用于伴奏制作、练习和混音。

初学者容易误以为只要把混合音频丢给大模型就能学会拆分,但监督训练真正依赖的是大量与混合一一对应的干净单轨,如果单轨本身混入了其他乐器、人声或噪声,模型就会学到错误的对应关系。本文要解决的正是这一环:在不靠人工逐段试听的前提下,从标签很脏的网络数据中自动挑出真正纯净的单乐器片段。论文把贡献归纳为 4 步:设计 7 类乐器分类体系,为每类训练单源检测器,用多语言关键词爬取原始音频,再用检测器自动清洗得到最终数据集。

摘要报告检测器 7 类平均准确率为 97.14%,用清洗后数据训练主流模型在标准基准上平均信号失真比提升 1.16 dB。需要保留的关键信息是 7 个主类为钢琴、鼓、贝斯、原声吉他、电吉他、弦乐和管乐铜管木管类,人声被明确排除,原因是已有数据集中人声已较丰富。输出不是分离模型本身,而是一套清洗流程加清洗后的数据集及其验证效果。

音乐源分离 × 固定分轨数据集: 音乐源分离负责把混合音频拆成各乐器独立声轨,固定分轨数据集负责规定每次拆分固定输出哪几个声轨并提供对应监督;二者搭配的原因是分离模型需要稳定、可比的训练目标,组合意义在于把 7 个常用乐器固定为输出集合,使训练、评测和跨方法比较都在同一分轨定义下进行。

本解读默认从原文独立写作,事实只依据本次收到的论文原文证据与官方原图像素,不引入外部评价。关于代码与权重,原文脚注给出了仓库链接,但本次资源核验状态为未发现可用绑定,因此不能声称当前已公开或可下载,只能说原文声明拟开放爬取脚本、检测器实现与预训练权重,复现前需自行确认链接可达性。

已有数据集路线为何不够用?

已有路线可按分轨是否固定来区分。固定分轨数据集在所有混合中保持相同的声部构成,例如常见的四轨是人声、贝斯、鼓和其他,这种做法的好处是评测标准统一、跨方法可比、训练流程简单。另一类是可变分轨数据集,乐器种类更多更细,但细到具体曲目的特殊编制时通用性下降。论文指出当前研究有两个主要限制,一是人工构建数据集费时费力,二是主流数据多为粗粒度四轨,缺少细粒度乐器级标注。

网络爬取曾被用来扩大数据量,例如从视频平台收集候选独奏,但查询吉他独奏可能实际返回包含贝斯、鼓和环境噪声的合奏,这就是典型的标签噪声与音频标签错配。已有去噪思路包括对带噪伪标签做自修正等,但本文选择了一条更直接的路线:不假设爬取标签可信,而是为每个目标乐器单独训练一个只认本乐器的纯净度判断器。理解这条路线很关键,后文所有清洗、阈值和拼接操作都是为它服务的。

要判断的问题是什么,难在哪里?

要判断的核心问题是给定一个 3 秒音频片段,它是否只包含目标乐器。例如给定目标为钢琴,输入可能是纯钢琴,也可能是钢琴加小提琴、钢琴加人声讲解、鼓加噪声等,模型只需输出纯净或混杂的二值判断。难处有 3 层。第一层是标签不可靠,爬取时的关键词不能作为真值,只能作为候选。第二层是干扰多样,负样本可能来自其余 6 类乐器、人声、语音和噪声的任意组合,数量从一个到 5 个不等。

第 3 层是响度陷阱,如果纯净段普遍更响或更轻,分类器可能偷懒只看能量而不听音色。为此论文在构造训练数据时对负样本做了响度归一化,并按乐器设定不同的目标响度区间,例如钢琴设在负 25 到负 20 响度单位附近,迫使模型依赖音色而非绝对响度。举例来说,这就像让学生闭眼辨别教室里是否只有钢琴在响,不能靠声音大就判为钢琴,还要能排除混入的脚步声和说话声。

阈值选择同样困难,阈值太低会留下噪声,阈值太高会把数据删到不够训练分离模型,后文用小规模人工试听来定这个平衡点。

三步流水线如何从关键词走到干净数据集?

整体流程按学习依赖可分为 3 段。第一段是为每个乐器训练二分类器,输入为单声道 16 千赫兹采样率的 3 秒片段,基于预训练音频编码器判断是否只含该乐器,这些分类器是后续清洗的工具。第二段是从视频平台用多语言查询收集每个乐器的原始视频,抽取音频并转为 48 千赫兹立体声,形成未清洗原始集。

第 3 段是对原始集中每首曲目按 3 秒切分,降采样为单声道 16 千赫兹送入对应乐器的二分类器,定位纯净目标乐器出现的时间位置,丢弃混杂段,再从原始 48 千赫兹音频的对应位置截取保留段,段间加淡入淡出后拼接为清洗后曲目,全部曲目处理完即得最终高质量集。分类体系上采用 7 个主类,其中弦乐和管乐铜管木管类下设多个子类的查询词,例如弦乐覆盖大提琴、中提琴、小提琴和低音提琴,管乐覆盖长号、小号、大号等,其余主类只查主干关键词。

查询模板统一为乐器加独奏,并本地化为 9 种语言以扩大跨语言覆盖。

多语言关键词爬取 × 自动清洗: 多语言关键词爬取负责用乐器加独奏模板在 9 种语言下扩大召回得到候选独奏音频,自动清洗负责用对应乐器检测器逐段打分并只保留高置信度纯净段;搭配理由是前者解决数据量问题、后者解决数据纯度问题,组合意义是形成可扩展的大规模高质量数据生产线。

以下导读帮助建立全景后再看细节:先把流程看成工具制造、原料采集和质检入库 3 段,不要把爬取量直接等同于可用量,质检段的阈值才是决定最终规模与纯度的阀门。

看图路径: 1. 先找到三段式主链:训练分类器、爬取原始音频、分类推理清洗;2. 再看清洗分支中每个乐器对应独立分类器后的保留与丢弃分叉;3. 最后确认保留片段经拼接后形成每首清洗后歌曲并汇总为最终数据集

原论文 Figure 2:Our proposed procedure.

论文图 2。原论文 Figure 2:“Our proposed procedure.”。

该流程图展示了从分类器训练到数据清洗再到汇总入库的完整链路。图中可见每个乐器拥有独立的乐器分类器,推理时对切分后的片段做是否仅为本类的二选一判断,判断为否的丢弃,判断为是的保留并拼接。保留后标注为清洗后歌曲,再对每首歌重复即汇总为最终清洗集。这种设计把多分类难题拆成 7 个专用二分类问题,每个分类器只精通一种乐器的纯净度,避免了一个模型同时分辨 7 类加噪声的复杂性。

检测器内部如何把波形变成纯净概率?

沿一个样本走完全程有助于复述。输入是一个单通道 3 秒片段,采样率 16 千赫兹。先做安全归一化,即用最大值加极小量做分母来缩放波形,避免极端幅度导致梯度不稳定。归一化波形送入冻结的预训练音频编码器,论文最终选用 Dasheng,该编码器基于掩码自编码器框架,在音乐与环境分类上表现较好,训练和推理期间参数均冻结。

编码器输出是随时间变化的高维表示,先沿时间维做平均池化得到定长向量,再经 3 层线性加修正线性单元逐级降维,隐藏维度依次为特征维、特征维一半和特征维 1/4,最后经线性层输出标量逻辑值并用 S 型函数转为纯净概率,以 0.5 为界输出 0 或 1。冻结意味着梯度只更新后端分类头,不回传到编码器,监督来源是人工组织的纯净段与人工混合的混杂段,优化目标是二分类正确性。

单源检测器 × 标签噪声: 单源检测器负责判断一个 3 秒片段是否只含有目标乐器,标签噪声指网络爬取时查询词与实际音频内容不一致带来的错误标注;搭配理由是用检测器对爬取片段逐段复核,组合意义是把不可靠的弱标签转换为经模型验证的纯净片段,从而切断噪声进入分离训练。

以下导读针对分类器结构图:从顶部输入形状看起,注意单通道与采样率标注,再向下确认冻结标记只包住编码器而不包括分类头。

看图路径: 1. 从顶部单通道 3 秒输入沿箭头向下跟踪到安全归一化;2. 确认中间冻结音频编码器输出的时间步与嵌入维度标注;3. 逐层查看平均池化后三层降维与最后一层输出单个标量的变化

原论文 Figure 1:Our proposed audio classification model.

论文图 1。原论文 Figure 1:“Our proposed audio classification model.”。

该图自上而下依次为输入音频、安全归一化、冻结的音频变换器编码器、二分类器和输出标量。二分类器内部可见平均池化后接 3 层线性加激活逐级压缩维度,最后经线性加 S 型函数输出单个概率值。像素中可辨认嵌入维度为 768,中间维度逐级降至 256、128 和 64,最终输出维度为 1。这种先冻结大编码器再训练小分类头的安排,使每个乐器只需约万量级正负样本即可训练,后文训练节会交代这些样本如何构造。

编码器与分类头各自承担什么,阈值如何工作?

编码器与分类头的分工需要紧接说明。编码器负责提供对乐器音色鲁棒的表示,分类头负责在该表示上学习本乐器纯净与混杂的边界。搭配理由是预训练已见过大量音频,冻结可保留通用听觉能力并降低训练成本,新增作用是每个乐器获得一个专用质检员,而不是一个通用乐器识别器。阈值是 S 型输出后的工作点,原文默认以 0.5 做 0 或 1 判决,但在清洗阶段会把阈值提高到 0.9 以上以换取更高纯度。阈值越高,保留越严,数据越纯但量越少。

论文用 10 首覆盖 7 类乐器的爬取歌曲做阈值消融,清洗前总时长 1.43 小时,阈值 0.9 时保留 0.68 小时且仍有少量非目标噪声,0.99 时保留 0.54 小时且噪声明显减少,0.995 时保留 0.41 小时且仅少数片段有轻微干扰,0.999 时仅保留 0.05 小时但几乎无干扰。3 位录音专业研究生经付费主观评估确认了这一趋势。最终选用 0.995,理由是 0.999 虽最干净但保留时长不足以训练后续分离模型。

冻结音频编码器 × 二分类器: 冻结音频编码器负责把波形映射为高层声学表示且参数不更新,二分类器负责在该表示上做纯净与混杂的二选一判决;搭配理由是借助自监督预训练获得的乐器判别能力并只训练轻量后端,组合意义是以较少标注训练出 7 个乐器各自专用的清洗工具。

复述时要注意阈值不是模型参数,而是推理阶段的决策工作点,改变它不需要重训,只会改变保留与丢弃的划分。清洗时保留段直接从原始 48 千赫兹音频按时间位置截取,并在边界加淡入淡出以避免拼接伪影,这是保证高音质的关键动作。

检测器用什么数据、增强和编码器对照训练?

检测器训练数据来自 MedleyDB 训练部分与 MoisesDB 按 8 比 1 比 1 划分的训练部分,按 7 类重新组织。为平衡类别,补充了巴赫 10、弦乐合奏、合成吉他谱和钢琴等对应乐器片段。验证与测试使用 MedleyDB 与 MoisesDB 的验证测试划分。每个乐器训练集包含约 10,000 个正样本段与约 10,000 个负样本段。正样本从目标乐器干净音频随机裁 3 秒得到。

负样本随机混合 1 到 5 个干扰源,干扰数为 1 时从其余 6 类目标乐器选一个,干扰数大于 1 时从其他乐器、目标乐器自身、人声、语音和噪声组成的候选池中有放回抽取,混合后做响度归一化并按类别设目标响度区间。在线数据增强对正负样本同样施加:概率 0.5 加混响,用 10 种脉冲响应经快速傅里叶变换卷积模拟厅堂房间等声学,混响时间随机采 0.3 到 1.5 秒;概率 0.3 做动态压缩,阈值 0.1 到 0.3、压缩比 2 到 4;概率 0.5 做均衡,随机提升低频、衰减高频、增强中频或通用参量调节。

最后全部重采样到 16 千赫兹用于训练。编码器选择做了消融,在同一二分类框架下比较 Dasheng、Music2Latent 与卷积神经网络编码器,用准确率、精确率、召回率和 F1 评价 7 类。报告显示 Dasheng 在几乎所有类别和指标上最高,Music2Latent 在个别乐器有竞争力,卷积基线最低,因此最终检测器集成 Dasheng,7 类平均准确率达 97.14%。原文未报告优化器、学习率、轮数等超参数,这是复现时需要补齐的缺项,不能从模型名推定。

分离实验比什么,条件是否一致,指标向哪边好?

分离实验要回答清洗是否有用。做法是用 6 种不同训练数据配置训练同类主流分离模型,再在同一验证测试划分上比较。6 种配置为只用 MoisesDB 加 MedleyDB、只用合成大集 Slakh、只用未清洗爬取集、只用清洗后全集、清洗后每类约 10.45 小时的均衡子集,以及 MoisesDB 加 MedleyDB 再加清洗后全集。数据集时长在论文表中以小时为单位报告,未清洗集总量远大于清洗后,例如管乐类未清洗超 2000 小时而清洗后仅 100 小时量级,说明大部分爬取内容被判为混杂而丢弃。

验证测试均用 MoisesDB 与 MedleyDB 的验证测试划分,与检测器训练节的划分协议一致。指标为信号失真比,单位为分贝,数值越高表示分离越好。比较的公平性在于模型结构与评测集相同,差异只来自训练数据。但需注意域对齐偏置:测试集来自 MoisesDB 与 MedleyDB,因此只用这两者训练的基线天然占优,不能仅凭此断言清洗集在所有场景最强,关键要看清洗相对未清洗的提升,以及叠加后的增益。训练部署成本如显卡型号、时长和推理延迟在原文未报告,这限制了对效率的判断。

清洗带来多大提升,哪类最受益,哪类仍困难?

主结果按问题组织:测的是不同训练数据带来的分离质量,比较对象包括真实小数据、合成大数据、未清洗大数据与清洗后数据,指标方向为信号失真比越高越好。报告显示只用 MoisesDB 加 MedleyDB 平均约 4.89 分贝,在单用配置中最强,这符合其与测试集域对齐的预期。只用 Slakh 平均约 2.32 分贝,尽管时长可观但表现较差,支持合成数据存在分布失配的判断。只用未清洗爬取集平均约 2.24 分贝,原因是标签噪声与污染普遍。

只用清洗后全集平均约 4.63 分贝,相对未清洗有实质提升,验证了自动清洗的有效性。均衡的 11 小时子集平均约 3.41 分贝,略低于清洗后全集,支持数据量重于完全均衡的解释。将 MoisesDB 加 MedleyDB 与清洗后全集联合训练达到最高平均约 6.05 分贝,相对基线平均增益 1.16 分贝,表明高质量真实数据具有互补价值。分乐器看,清洗后在弦乐与管乐等细粒度类别上改善明显,但原声吉他与电吉他等仍相对困难,这与检测器在原声吉他上准确率相对较低的现象一致。

信号失真比 × 数据分布失配: 信号失真比负责度量分离输出与真实目标声轨的接近程度,数值越高越好,数据分布失配指合成数据与真实录音在音色、混响和演奏上的差异;搭配理由是只看时长会误判合成数据的价值,组合意义是用同一真实测试集上的信号失真比揭示清洗后的真实录音比更长的合成数据更有效。

下表提出比较问题:在测试集与基线域对齐的前提下,清洗是否缩小了与人工标注数据的差距,合成大数据的时长优势能否弥补分布差异,指标方向为分贝越高越好。表头单位为小时与分贝,数据格为原文裸值,阅读时需结合表头理解单位,不自行逐格追加百分号。

数据集或训练配置钢琴时长小时鼓时长小时贝斯时长小时弦乐时长小时管乐时长小时
MoisesDB 加 MedleyDB6.5623.148.982.561
未清洗爬取集902.5392.497.55908.522259.72
清洗后全集483.2116.0411.697.84102.64

表后解释需要同时看到收益与代价。收益是清洗后保留了可观的真实独奏时长,尤其钢琴类保留最多,为分离训练提供了此前缺少的细粒度数据。代价是过滤比例极高且类别不均衡依然存在,鼓贝斯等保留仅十余小时,而钢琴达约 100 小时。未胜出项是合成集 Slakh,尽管在部分乐器上时长远超真实小数据,但在真实测试上并未胜出,这构成对唯规模论的反例。均衡子集的回落也说明单纯凑均衡而削减总量可能得不偿失。

训练数据钢琴分贝鼓分贝贝斯分贝弦乐分贝平均分贝
MoisesDB 加 MedleyDB4.368.066.723.724.89
清洗后全集4.367.115.254.914.63
基线加清洗后全集6.078.056.845.936.05

表后进一步解释可部署收益。核心可运行策略是基线真实数据叠加清洗后数据,平均从 4.89 分贝升至 6.05 分贝,增益 1.16 分贝,且在 7 个分轨上普遍改善,而非仅靠某一轨拉高平均。未胜出项是只用未清洗集,其平均仅 2.24 分贝,说明不经清洗直接用爬取数据训练分离模型不可行。限制是该增益是在与基线同域的测试上测得,跨域泛化与人工试听偏好尚未评测,不能把分贝提升直接等同于听感提升。

阈值与编码器消融支持什么,又付出什么?

消融围绕两个问题:哪种编码器更适合单源判断,阈值如何权衡质量与数量。编码器消融在同一分类头下比较 3 种编码器,评价为准确率、精确率、召回率与 F1。报告显示 Dasheng 几乎全面最高,例如鼓与贝斯准确率达 99% 上下,弦乐与管乐也在 97% 以上,而原声吉他相对最低约 92.6%,这预示后续该乐器清洗与分离更难。Music2Latent 在部分乐器接近,但弦乐与管乐明显落后。卷积基线在多类上接近随机,支持预训练表示的必要性。

阈值消融在 10 首歌上测试 0.9、0.99、0.995 和 0.999 四档,保留时长从 0.68 小时、0.54 小时、0.41 小时骤降至 0.05 小时,主观评估确认纯度随阈值上升而提高。最终选 0.995 是在纯度与可用量之间的折中。

以下导读聚焦质量数量权衡图:先看清洗前总柱作为参照,再从左向右跟踪四档阈值柱高的下降速度,注意最后一档的断崖式收缩。

看图路径: 1. 先确认横轴为清洗前与四个阈值条件、纵轴为小时数;2. 比较柱高随阈值从 0.9 升至 0.999 的单调下降趋势;3. 重点观察 0.995 到 0.999 处保留时长急剧收缩的代价

原论文 Figure 3:Duration Distributions Before and After Cleaning Un- der Different Thresholds(unit: hours)

论文图 3。原论文 Figure 3:“Duration Distributions Before and After Cleaning Un- der Different Thresholds(unit: hours)”。

该柱状图横轴为清洗前与四档阈值条件,纵轴为小时数,柱顶标注 1.43、0.68、0.54、0.41 和 0.05。可见阈值从 0.9 升至 0.995 时保留量逐步减少,而升至 0.999 时仅剩 0.05 小时,说明过严阈值虽最干净但会失去训练价值。这支持论文不选 0.999 而选 0.995 的安排理由,也提示复现时若换一批歌曲,绝对保留量会变,但单调下降趋势与断崖代价仍值得复核。

哪些结论有边界,哪些验证还没有做?

需要区分直接报告、有限解释与未验证推测。直接报告的是检测器平均准确率、清洗前后时长变化与分离信号失真比数字。有限解释的是合成数据表现差归因于分布失配,以及均衡子集回落归因于总量更重要,这些解释与数字一致但未做因果隔离实验,只能表述为支持而非证明。未验证的是听感、误判率细节、延迟与成本。

原文未报告训练分离模型的具体结构超参数、硬件与耗时,也未报告清洗推理的吞吐与人工评估的打分细则,除 10 首歌的小规模试听外缺乏大规模听感评测。结论部分出现平均准确率 97.5% 的写法,与摘要和方法部分的 97.14% 不一致,原文内部存在数字冲突,此处明确标注冲突而不自行调和,复现应以各表逐类数字重新计算为准。类别上吉他类检测与分离仍较弱,清洗后时长不均衡可能使模型偏向数据多的钢琴类。

此外测试集与基线训练集同源,清洗集的跨数据集泛化、民乐等新类别的扩展效果均为待验证,不能从方法通用性推定在新乐器上必然同样有效。

要复现应先做什么,需要哪些具体条件?

复现应按依赖顺序先做检测器再做清洗最后做分离。第一步按 7 类组织 MedleyDB 与 MoisesDB 的训练验证测试划分,并补充对应乐器片段以平衡类别,裁 3 秒片段构造约万量级正负样本,负样本混合 1 到 5 个干扰并做响度归一化与增强。第二步冻结 Dasheng 编码器,只训练后端平均池化加 3 层降维加 S 型输出的分类头,以 0.5 为分类界,评价用准确率、精确率、召回率与 F1。

第三步用乐器加独奏模板的多语言关键词爬取视频,转为 48 千赫兹立体声,按 3 秒切分并降采样到单声道 16 千赫兹做推理,以 0.995 为清洗阈值,从原 48 千赫兹音频截取保留段并加淡入淡出拼接。第 4 步用清洗后数据与基线数据训练分离模型,在 MoisesDB 与 MedleyDB 验证测试划分上以信号失真比评测。关键信息条件是输入采样率与声道在训练与清洗阶段不同,截取必须回到原始高采样率音频,否则会损失音质。缺项是优化器、学习率、轮数、批量大小与硬件预算原文未交代,需自行搜索并记录。

关于开放性,原文声明开放爬取脚本、检测器代码与权重,但本次未能确认可达,复现前必须先验证链接与版本,不应假设开箱即用。

何时值得尝试,还需补哪项验证?

当已有人工标注分离数据不足、尤其缺少弦乐、管乐和区分原声电吉他的细粒度数据时,这套先爬取再用专用检测器清洗的路线值得尝试。它的适用条件是目标乐器有足够可爬取的独奏内容,且能接受用阈值换纯度、用过滤换规模。当目标是人声或已有大量干净数据的类别时,额外爬取的边际收益可能有限。当应用对听感伪影敏感时,不能只看信号失真比,还需补大规模盲听与伪影分析。

当关心公平性时,需补按乐器、演奏技法和录音质量分组的误差分析,避免总量偏向钢琴导致其他乐器被忽视。后续验证至少应包括在独立于 MoisesDB 与 MedleyDB 的真实曲目上测试分离增益,报告清洗的误杀率与漏检率,以及记录端到端耗时与成本。教学层面的误解需要澄清:爬取量大不等于训练量大,清洗后保留量才是有效规模;检测准确率高不等于分离必然好,中间还隔着混合构造、模型容量与评测域的影响。

阈值 0.995 不是普适最优,只是本文 10 首歌试听与后续训练需求下的折中,换数据应重做阈值校准。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总