Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones
📄 Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones 标签:#语音增强 #CNN #RNN #多通道 #模型评估 5.1/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 📝 5.1/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音增强 | #CNN | #RNN #多通道 | arxiv 👥 作者与机构 第一作者:Oshan A. B. Yalegama(Department of Electronic and Telecommunication Engineering, University of Moratuwa, Sri Lanka) 第二作者:Wageesha N. Manamperi(School of Engineering, The Australian National University, Australia;其邮箱为 University of Moratuwa 邮箱,机构标注与邮箱存在不一致) 通讯作者:论文未明确标注通讯作者,仅通过脚注列出两位作者的邮箱 yalegamammoab.20@uom.lk 和 wageesham@uom.lk 💡 毒舌点评 本文首次把 ReTM 估计从协方差基线推进到监督深度学习,三种架构分别覆盖 STFT 深度卷积、时域滤波器组和 BiLSTM 时序建模,FuSNet 在仿真指标上确实有明显提升,LAeNet 的下游降噪效果也值得关注。但实验规模极小、完全依赖仿真,测试集在多数场景中只有 10 秒;正文与表格之间存在“场景 B 中 SCoNet MSE 优于 FuSNet”这类直接与数据相悖的表述;FuSNet 在下游语音增强中反而从 Baseline 的 4.07 dB 跌到 −1.19 dB,说明 ReTM 精度高不等于降噪有用;LAeNet 训练时拼接了目标信号却未说明推断输入,存在训练/推断不一致的严重疑点。再加上只给了音频样本、没有代码和权重,论文可靠性被明显拖累。 ...