📄 CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source Separation
标签:#音乐源分离 #数据集 #基准测试 #多通道 #音频理解
7.3/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.9/1.5 | 清晰 0.6/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5
✅ 7.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐源分离 | #数据集 | #基准测试 #多通道 | arxiv
👥 作者与机构
- 第一作者:Enric Gusó(Eurecat, Centre Tecnològic de Catalunya,未注明具体学院/系)
- 通讯作者:未明确说明
- 其他作者:Xavier Serra(Universitat Pompeu Fabra,根据过往信息应隶属其 Music Technology Group,但论文未明确说明机构)
💡 毒舌点评
一篇被“工程落地”掩盖了“学术灵气”的工作。作者把语音增强的“脏化-清洗”老方子,一丝不苟地糊在了音乐源分离这面新墙上:现场噪声音源库(CrowdioSet)和场馆冲激响应库(PaRIRset)填补了数据空白,但方法本身是 WHAM!/WHAMR! 的复刻,毫无架构或理论惊喜。合成跟唱的 pipeline 更是提着木偶线模仿真人,音色转换模型一通操作,结果依然与主唱高度相关,不仅没做成加分项,反而在消融实验里“查无此人”,贡献纯粹停留在“生成了这个数据但效果未知”的水平。最终的分离结果依然在极低 SDR 区间挣扎(人声最高仅 3.26 dB),离“可用”还有十万八千里,更像是一份扎实的数据集论文而非方法突破。
📌 核心摘要
本文针对音乐源分离(MSS)模型无法泛化至观众侧现场录音的问题,构建了两个新数据集和一个增强训练基线。CrowdioSet 包含从 Freesound 精选的 4819 条真实环境声与事件声(如欢呼、掌声、背景交谈)和一条初步的合成跟唱生成管线(使用 Antares AVOX Choir 效果器与零样本歌声转换模型 HQ-SVC 处理 MUSDB18HQ 和 MOISESDB 的全部人声干声)。PaRIRset 则是在 40 个专业演出场馆,利用 Zylia ZM-1 麦克风阵列通过指数扫频法(20 Hz–20 kHz)采集的冲激响应(RIR)数据集,并通过极性翻转、尾部增益、波束成形等方式增强至约 2200 条立体声 RIR。以 SCNet 为骨干,通过在线数据增强(随机混合观众噪声、卷积 RIR)训练了四种模型(clean/rev/noisy/noisyrev)。实验表明,noisy 模型能将含噪混响场景下的人声 SDR 从 1.46 dB 提升至 3.26 dB,同时保持干净场景性能极少折损(人声 SDR 9.97 vs. 10.05 dB);PaRIRset 相较仅用语音增强 RIR 的基线取得统计显著增益(p=0.027)。在主观 AB 测试中,noisy 模型的人声分离和观众噪声隔离均获显著偏好。但工作受限于合成跟唱效果不佳、混响+噪声联合训练早停,且缺乏对于噪声成分与多架构的深入消融。
🔗 开源详情
- 代码:项目主页提供仓库入口,地址:https://enricguso.github.io/crowdioset_parirset。
- 模型权重:通过项目主页获取,论文未提供独立的存储链接。
- 数据集:CrowdioSet(含详细许可元数据)与 PaRIRset 均可在项目主页获取。CrowdioSet 中源自 Freesound 的文件遵循其原始许可(CC0、CC-BY 3.0/4.0、CC-BY-NC 3.0/4.0、Sampling+ 1.0等)。PaRIRset 是自建数据集。
- 演示(Demo):论文未提及独立的 Demo 页面,但项目主页可能包含。
- 复现材料:训练细节在论文 Section 4.1 中说明,与代码共同构成复现依据。无独立的补充材料或附录。
- 论文中引用的开源项目:
- SCNet [29]:开源 MSS 模型,未给出链接。
- HQ-SVC [2]:零样本歌声转换模型,未给出链接。
- MUSDB18 [23]:已提供链接。
- MOISESDB [19]:未提供链接。
- Freesound [1]:已提供链接。
- ACE [5], MIT IR Survey [31], SLR28 [13]:均为通用 RIR 库,未提供链接。
🏗️ 方法概述和架构
本工作围绕“将语音增强范式迁移至现场音乐源分离”这一核心思路,构建了一条从数据集生成到模型评估的完整流水线。
下图展示了从数据源生成到模型训练的完整数据退化模拟与在线训练流水线。

该流程图清晰地描绘了CrowdioSet(环境声、事件声、合成跟唱)与PaRIRset如何在线与干净的音乐源混合,以模拟现场录音,并输入SCNet模型进行训练。
1. 数据退化模拟框架 核心思想是将干净的录音棚多轨数据(MUSDB18HQ 与 MOISESDB),通过添加观众噪声(CrowdioSet)和卷积场馆冲激响应(PaRIRset)的方式,模拟现场观众侧录音的声学退化过程。退化操作在线执行,为模型提供源源不断的新组合。
2. CrowdioSet 数据集构建 该数据集旨在系统性地覆盖音乐演出现场的三种观众声音类别:
- 环境声与事件声:从 Freesound 基于关键词(crowd, audience, applause 等)下载并经过严格人工筛选,最终保留 4819 条文件(总计约 105 小时),被分类为持续的背景噪声(ambiences, 2409 条)和瞬态突发噪声(events, 2410 条),并为每一条文件提供了开放许可协议信息。
- 合成跟唱声:一条初步生成管线,针对 384 条人声干声生成群杂。它并行使用两个支路:(a) 通过 Antares AVOX Choir 插件创建 32 声部的合唱效果;(b) 利用零样本歌声转换模型 HQ-SVC,以 200 个 Freesound 清唱样本作为音色源进行转换(半数保持原曲调,半数调整至目标采样音域)。转换结果通过基于色度特征 MAE 和歌手嵌入余弦相似度的组合评分进行排序,取前 64 路,再经过音节级增益/时长抖动、随机声像和延时处理,最后按听觉比例混合而成。
3. PaRIRset 数据集构建 为解决通用语音增强 RIR 与演唱会 PA 声学环境不匹配的问题,作者测量了 40 个专业场馆的冲激响应:
- 采集方案:在调音位(FOH)用 beyerdynamic MM1 和 Zylia ZM-1 阵列,播放 6 秒指数扫频信号(20 Hz–20 kHz),经解卷积得到原始 RIR。
- 后处理:进行底噪裁剪、左右声道时间对齐,并针对 Zylia 麦克风进行了-4 dB 的高频搁架滤波(3.5 kHz)以补偿频响。
- 增强策略组合:最终版的 PaRIRset 数据集是 SE RIR 库(ACE, MIT IR Survey, SLR28)与多级增强策略的组合,总计约 2200 条立体声 RIR:
- D1 (基础):极性翻转与尾部增益({‑6,‑1.5,0,1.5,3.5} dB),形成 20 倍扩充。
- D2 (Zylia 胶囊):加入 Zylia 阵列的 19 通道原始胶囊录音。
- D3 (波束成形):加入通过 Zylia Studio 算法生成的 19 个不同指向/极性模式的虚拟话筒录音。
- 策略 D4(跨场馆直达声-混响尾拼接)因效果不佳被弃用。
- 空场补偿:训练时对 RIR 尾部再乘 \(U(0,1)\) 随机衰减,以补偿空场混响比满场时偏长的问题。
4. SCNet 模型训练与在线增强 采用开源模型 SCNet 作为骨干,不改动网络结构。训练过程动态地将音乐源、CrowdioSet 噪声成分、PaRIRset 的 RIR 进行在线随机组合。具体实现为:对每个 batch,随机抽取观众噪声(各成分出现概率 \(p_v=p_a=p_e=0.5\),增益 \(g \sim \mathcal{U}(0,1)\))与音乐源混合,之后整体与随机挑选的 RIR 进行卷积。共训练四个配置变体:clean(干声)、rev(加混响)、noisy(加观众噪声)、noisyrev(噪声+混响)。训练时去除了 EMA,并针对不同退化复杂度微调了初始学习率({4,3.5,2,2}×10⁻⁴)。
💡 核心创新点
- 首个面向现场音乐的观众噪声数据集 CrowdioSet:收集并整理了面向音乐演出的真实环境声库,区别于一般城市噪声,首次为 MSS 提供了系统化的观众干扰数据。
- 首个覆盖专业演唱会 PA 系统的冲激响应数据集 PaRIRset:填补了通用语音/会议室 RIR 与大型扩声系统声学特性之间的空白,采集自 40 个真实场馆和多样化的 PA 品牌。
- 将语音增强范式成功应用于音乐源分离:证实了 WHAM!/WHAMR! 式的数据增强策略可显著提升现场录音分离性能,并可维持对录音棚素材的泛化能力。
- 全在线、随机化的增强训练架构:噪声成分、增益、RIR特性均在训练时动态、随机组合,消除了预生成大规模退化数据的存储和灵活性瓶颈,并为后续研究提供了一个可快速配置的实验框架。
📊 实验结果
核心客观指标-各源 SDR(平均值 ± 标准差 dB,括号内为 clean 条件)
| 模型 | 人声 (vocals) | 鼓 (drums) | 贝斯 (bass) | 其他 (other) |
|---|---|---|---|---|
| clean | \(1.46_{\pm 3.4}\) (10.05) | \(7.04_{\pm 3.6}\) (10.62) | \(4.15_{\pm 3.5}\) (8.97) | \(1.43_{\pm 3.5}\) (6.69) |
| rev | \(1.10_{\pm 3.6}\) (9.01) | \(\mathbf{8.23}_{\pm 3.1}\) (9.86) | \(5.36_{\pm 3.7}\) (7.77) | \(\mathbf{3.63}_{\pm 2.4}\) (5.98) |
| noisy | \(\mathbf{3.26}_{\pm 2.9}\) (9.97) | \(7.00_{\pm 3.3}\) (10.68) | \(3.91_{\pm 3.6}\) (8.85) | \(1.79_{\pm 3.2}\) (6.69) |
| noisyrev | \(3.15_{\pm 3.1}\) (9.07) | \(8.19_{\pm 3.3}\) (9.98) | \(\mathbf{5.66}_{\pm 3.6}\) (7.86) | \(3.55_{\pm 2.7}\) (5.88) |
| SAM Audio† | \(-0.45_{\pm 1.9}\) (3.72) | \(3.30_{\pm 2.6}\) (5.63) | \(1.30_{\pm 3.0}\) (5.14) | \(-1.82_{\pm 2.0}\) (-1.74) |
| †该模型基于扩散过程,SDR 分数可能因样本非对齐而偏低,仅作参考。 |
观众隔离 SDR
| 模型 | 无混响 | 有混响 |
|---|---|---|
| noisy | \(\mathbf{2.85}_{\pm 1.3}\) | \(1.25_{\pm 1.4}\) |
| noisyrev | \(1.55_{\pm 1.0}\) | \(\mathbf{1.56}_{\pm 0.9}\) |
| SAM Audio† | \(-1.94_{\pm 3.0}\) | \(-1.60_{\pm 2.7}\) |
PaRIRset 消融实验:在比较所有增强策略时,仅有包含 Zylia 波束成形数据的 D3 配置,相对于仅使用语音增强 RIR 的基线,取得了统计显著的性能提升(配对 t 检验,\(p=0.027\))。而 D1、D2 及 D4 的提升并不显著。
主观 AB 测试:在 10 段真实观众手机录音上,26 位评估者(含媒体研究者、专业音乐人或音响工程师)参与测试:
- 人声分离:noisy 模型以 105/130 票显著优于干净训练的 clean 模型(单侧二项检验,\(p < 10^{-12}\))。
- 观众隔离:noisy 模型以 119/130 票显著优于 SAM Audio 模型(\(p < 10^{-23}\))。
🔬 细节详述
- 训练数据与增强:在线混合观众成分(概率 0.5,增益 \(\mathcal{U}(0,1)\)); 卷积 RIR(尾部再乘 \(\mathcal{U}(0,1)\) 衰减);SCNet 默认的随机时移增强(≤2s);并采用跨 batch 的跨歌曲源重混(查塔)。
- 训练超参数:沿用 SCNet 原始配置,未明确说明损失函数(应为波形 L1 损失)。批大小 10(无观众)或 8(带观众)。优化器为 Adam,未提及具体调度器。共训练 200 轮,noisyrev 模型在 epoch 144 早停。
- 硬件/时间成本:单张 NVIDIA L40S GPU,每个模型训练耗时约 7 天。
- 推理:标准前向计算,无特殊解码策略。
- 评估细节:在 MUSDB18HQ 测试集上人为施加退化(25%不含混响、25%含原版 RIR、50%施加-6/-12 dB 混响尾衰减)。指标为主流 MSS 评测的 SDR,采用配对 t 检验(PaRIRset 消融)和二项检验(主观测试)。
⚖️ 评分理由
创新性 (1.2/2):[A_SUMMARY] 首次构建面向现场音乐的观众噪声数据集 CrowdioSet 和首个覆盖专业演唱会 PA 系统的冲激响应数据集 PaRIRset,填补了语音增强 RIR 与演唱会声学之间的空白,并提出了在线随机增强的训练框架。虽然整体方法迁移自 WHAM!/WHAMR!,但数据采集难度与领域独特性构成了明确的增量贡献。
技术严谨性 (0.8/1.5):[A_METHOD] 数据集的采集、筛选、后处理和补偿流程描述清晰,遵循了指数扫频法并进行了频响校准和空场补偿;但退化模型假设仅考虑线性卷积与加性噪声,完全忽略了 PA 系统的非线性失真、动态压缩等实际声学现象([A_LIMITS] 审稿人问题 3),这一简化假设限制了方法的真实场景泛化能力,构成技术严谨性上的不足。
实验充分性 (0.9/1.5):[A_RESULTS] 包含四个训练变体在不同退化条件下的 SDR 对比、PaRIRset 增强策略的消融(配对 t 检验)以及主观 AB 测试,统计检验较规范。但实验存在关键缺陷:仅在一款 SCNet 模型上验证,未能证明数据集可作为通用基准([A_LIMITS] 审稿人问题 2);合成跟唱组件完全未进行消融,无法判断其对性能的贡献([A_LIMITS] 审稿人问题 1);仅使用 SDR 作为客观指标,缺乏感知质量评估([A_LIMITS] 审稿人问题 4)。
清晰度 (0.6/1):整体组织合理,数据集构建和训练流程图示清晰。但合成跟唱管线描述篇幅较长,而实验部分对其只字未提,导致核心贡献与证据错位,读者难以把握该组件的实际价值和有效性([A_LIMITS] 审稿人问题 1),影响了阅读的连贯性。
影响力 (1.0/1.5):[A_SUMMARY] 数据集和基线填补了现场观众侧录音的音乐源分离空白,为后续研究提供了可复用的数据和训练范式,有望推动相关 MIR 任务(如助听、指纹识别)。但目前源分离 SDR 极低(人声最高仅 3.26 dB),短期内难以直接部署到实用系统,潜在影响受限于模型的原始性能。
开源 (1.5/1.5):[A_OPEN] 代码、模型权重、CrowdioSet 和 PaRIRset 数据集均已公开,提供了详细许可元数据并可通过项目主页获取,开源资源完整且文档充分,属于核心产物全部开放的高标准开源。
可复现性 (0.3/0.5):[A_METHOD] 论文披露了大部分训练超参数(学习率、batch 大小、epoch 数、增强参数)、硬件配置(单张 NVIDIA L40S、约 7 天训练)和早停轮次;但损失函数未明确说明(仅推断为波形 L1 损失),也未提及优化器的具体调度器,关键配置有少量缺失,扣减至 0.3。
工程/实践价值 (1.0/1.5):[A_METHOD] 所构建的在线数据退化框架(动态混合观众噪声与卷积 RIR)和完整的合成跟唱生成流水线具有较高的工程复用价值,可为相关应用快速搭建实验环境。然而,当前模型的分离效果距现场实用性仍有很大距离(SDR 普遍低于 5 dB),限制了其直接工程落地价值。
🚨 局限与问题
论文明确承认的局限:
- 在线混合参数(概率、增益)仅凭非正式主观试听确定,可能不是最优解。
- 合成跟唱组件隔离效果很差,原因是合成歌声与主唱音高、节奏高度相关,且原始干声中自带的混响/延迟效果使得分离更加困难。
- noisyrev 模型在第 144 轮就提前收敛,表明当前架构或超参数不能充分适应噪声与混响双重退化下的训练。
- 所有 PaRIRset 均在空场采集,虽有尾部随机衰减补偿,但混响特性与实际满场情况仍存差距。
审稿人视角发现的深层问题:
- 贡献与证据错位:跟唱生成管线是论文标榜的核心贡献之一,描述篇幅很长,但实验部分完全没有对其进行消融。我们无法判断分离性能的提升有多少来自跟唱,有多少来自更易分离的环境声和鼓掌。这导致“跟唱 pipeline”这个核心组件实际上处于“技术上实现了,但科学上未验证”的尴尬境地。
- 数据集通用性存疑:作为一份“数据集与基准”论文,仅在单一模型(SCNet)上进行验证是致命的。无法证明这些数据集对其他流行架构(如基于 Transformer 的 Bandit 或 Demucs)同样有效,严重削弱了 PaRIRset 和 CrowdioSet 作为“通用基准”的核心立论。
- 退化模型过于简化:论文假设现场录音仅是“线性卷积(混响)+ 加性噪声(观众)”,完全忽略了 PA 系统常见的非线性失真、动态压缩、限幅器保护、麦克风过载和声反馈(啸叫)等复杂情况。因此,其在“真实”现场录音上的泛化能力上限可能被高估,目前的提升仅仅是处理了线性和加性的退化。
- 评价指标体系不完整:SDR 是唯一的核心指标。对于音乐分离,尤其是感知质量极为重要的场景,没有任何非侵入式的感知质量指标(如 PESQ 的变体)或高级的音乐感知指标(如 [26])作为辅助,使得客观评价过于单薄。
- 任务实质与宣称的偏差:从极低的 SDR 分数来看,模型的功能实质上更接近“去噪与去混响”,并未能真正像处理录音棚多轨那样,分离出现场录音中的人声和乐器声。论文宣称的“Live Music Source Separation”可能在当前技术水平下过于乐观。