CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source Separation
📄 CrowdioSet and PaRIRset: Two Datasets Towards Live Music Source Separation 标签:#音乐源分离 #数据集 #基准测试 #多通道 #音频理解 7.3/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.9/1.5 | 清晰 0.6/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.3/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:高 | #音乐源分离 | #数据集 | #基准测试 #多通道 | arxiv 👥 作者与机构 第一作者:Enric Gusó(Eurecat, Centre Tecnològic de Catalunya,未注明具体学院/系) 通讯作者:未明确说明 其他作者:Xavier Serra(Universitat Pompeu Fabra,根据过往信息应隶属其 Music Technology Group,但论文未明确说明机构) 💡 毒舌点评 一篇被“工程落地”掩盖了“学术灵气”的工作。作者把语音增强的“脏化-清洗”老方子,一丝不苟地糊在了音乐源分离这面新墙上:现场噪声音源库(CrowdioSet)和场馆冲激响应库(PaRIRset)填补了数据空白,但方法本身是 WHAM!/WHAMR! 的复刻,毫无架构或理论惊喜。合成跟唱的 pipeline 更是提着木偶线模仿真人,音色转换模型一通操作,结果依然与主唱高度相关,不仅没做成加分项,反而在消融实验里“查无此人”,贡献纯粹停留在“生成了这个数据但效果未知”的水平。最终的分离结果依然在极低 SDR 区间挣扎(人声最高仅 3.26 dB),离“可用”还有十万八千里,更像是一份扎实的数据集论文而非方法突破。 ...