Neural Music Enhancement with Dual Time-Frequency Spectral Representations for Prediction and Discrimination
📄 一个管重建、一个管审美:用两套频谱分工修音乐 英文题目:Neural Music Enhancement with Dual Time-Frequency Spectral Representations for Prediction and Discrimination 一句话:针对在线音乐同时被噪声和混响污染且复调泛音难保真的问题,DSME 让短时傅里叶变换负责可逆的幅度相位重建、让恒 Q 变换负责符合八度感知的判别并辅以色度损失,在单库模拟三任务上取得客观与主观领先,代价是双变换训练更重且野外高采样验证缺席。 标签:#语音增强 | #生成对抗网络 | #音乐生成 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Fei Liu:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用短时傅里叶变换做预测、恒Q变换做判别的分工直觉漂亮且贴合音乐八度结构,色度损失也算对症下药。短板在于生成器基本沿用语音增强套路、判别器与损失的因果证据单薄,消融只做混合失真且部分指标反而倒挂,说服力打了折扣。 📌 核心摘要 非职业设备在非受控环境录制的在线音乐常同时受加性噪声与混响污染,复调、宽动态与严格听感要求使语音增强方法直接迁移效果有限。本文提出双谱音乐增强模型(Dual-Spectrum Music Enhancement,DSME),在生成对抗网络(Generative Adversarial Network,GAN)框架下让生成器预测短时傅里叶变换(Short-Time Fourier Transform,STFT)幅度与相位、让判别器在恒Q变换(Constant-Q Transform,CQT)域做八度分段判别,并辅以色度谱(Chroma Spectrum)损失约束音高与和声一致性。相对已有音乐去噪与复用管线,新意在于把可逆且预测友好的线性谱用于重建、把对数频率且变窗长的音乐友好谱用于对抗引导,二者各司其职。在Medley-solos-DB构建的去噪、去混响与混合失真三项任务上,DSME在频率加权分段信噪比等多项客观指标及混合失真ABX主观偏好上整体优于3个重训基线,混合任务主观偏好领先幅度显著。实际意义是为用户生成内容打标、推荐与转录提供更干净的前端,局限是仅在单数据集模拟失真与窄带采样下验证,对真实野外录音与高采样保真度的外推尚未证明。 ...