📄 Deep Learning Based Relative Transfer Matrix Estimation for Multiple Sources and Multiple Microphones
标签:#语音增强 #CNN #RNN #多通道 #模型评估
5.1/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5
📝 5.1/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音增强 | #CNN | #RNN #多通道 | arxiv
👥 作者与机构
- 第一作者:Oshan A. B. Yalegama(Department of Electronic and Telecommunication Engineering, University of Moratuwa, Sri Lanka)
- 第二作者:Wageesha N. Manamperi(School of Engineering, The Australian National University, Australia;其邮箱为 University of Moratuwa 邮箱,机构标注与邮箱存在不一致)
- 通讯作者:论文未明确标注通讯作者,仅通过脚注列出两位作者的邮箱
yalegamammoab.20@uom.lk和wageesham@uom.lk
💡 毒舌点评
本文首次把 ReTM 估计从协方差基线推进到监督深度学习,三种架构分别覆盖 STFT 深度卷积、时域滤波器组和 BiLSTM 时序建模,FuSNet 在仿真指标上确实有明显提升,LAeNet 的下游降噪效果也值得关注。但实验规模极小、完全依赖仿真,测试集在多数场景中只有 10 秒;正文与表格之间存在“场景 B 中 SCoNet MSE 优于 FuSNet”这类直接与数据相悖的表述;FuSNet 在下游语音增强中反而从 Baseline 的 4.07 dB 跌到 −1.19 dB,说明 ReTM 精度高不等于降噪有用;LAeNet 训练时拼接了目标信号却未说明推断输入,存在训练/推断不一致的严重疑点。再加上只给了音频样本、没有代码和权重,论文可靠性被明显拖累。
📌 核心摘要
论文研究多源多麦克风录音中的相对传递矩阵(ReTM)估计,目标是摆脱传统相对传递函数对 W-disjoint orthogonality 的假设。作者提出三种监督学习框架:SCoNet 在 STFT 域使用二维深度可分离卷积,对每个频率分量独立学习从麦克风组 B 到组 A 的空间映射;FuSNet 在时域将 ReTM 的冲激响应直接参数化为 \(Q_A \times Q_B\) 个一维卷积滤波器,以可解释方式建模组间线性关系;LAeNet 使用共享权重的 BiLSTM 逐频带处理拼接后的 STFT 序列,再经全连接网络估计 ReTM 系数。与现有协方差估计基线相比,本文首次系统使用神经网络直接学习两组麦克风之间的空间映射。实验在四类仿真房间场景(A1、A2、B、C)中进行。FuSNet 在多数 ReTM 精度指标上最优,例如场景 C 平均 SDR 达 38.88 dB、MSE 达 −61.98 dB。LAeNet 在语音降噪应用中表现最好,场景 B 和 C 的 SDR 分别提升到 8.67 dB 和 7.03 dB,STOI 分别达 0.92 和 0.91。主要局限包括数据全部为仿真、多数场景测试录音仅 10 秒、无公开代码或权重、部分结论与表格数据相悖,以及 FuSNet 在 ReTM 精度和下游降噪效果之间存在明显断裂。
🔗 开源详情
- 代码:论文未提供代码链接。论文给出的 GitHub 仓库为 https://github.com/oshanyalegama/Denoised_ReTM_DL ,但论文仅说明可在此获取音频样本,未明确包含训练/推理代码。
- 模型权重:论文中未提及
- 数据集:论文中未提供数据集名称、获取链接或开源协议。实验数据为合成数据:使用开源工具箱 [8] 模拟房间脉冲响应,并混合声源(A1:两个白高斯噪声源;A2:空调噪声、音乐;B/C:语音、空调噪声、音乐),各麦克风加入 40 dB SNR 的 WGN 并降采样至 16 kHz。
- Demo:论文中未提及
- 复现材料:论文给出主要训练/实验配置:房间 \(6\times7\times3\) m,\(T_{60}=500\) ms;A1/A2/B 场景 \(Q=7\),\(Q_A=3\),\(Q_B=4\);C 场景 \(Q=12\),\(Q_A=5\),\(Q_B=7\);A1 训练/验证/测试为 3/1/1 分钟,其余场景训练/测试为 50/10 秒;FuSNet 窗口与上下文大小 8192 样本;SCoNet 与 LAeNet 使用 Hann 窗长 8192、50% 重叠的 STFT;损失为负 SDR 与 RSE 的加权和,\(\alpha=1\)、\(\beta=10\);优化器为 Adam,学习率根据验证集性能自适应下降。未提供检查点、预训练权重或附录。
- 论文中引用的开源项目:未提及具体名称和链接;文中仅提及“open-source toolbox [8]”用于房间脉冲响应建模。
🏗️ 方法概述和架构
本文提出三个监督学习框架,核心目标都是建立从麦克风组 B 到麦克风组 A 的空间映射,从而隐式或显式估计 ReTM。整体流程是:用房间冲激响应仿真生成多源多麦克风录音,将麦克风划分为 A/B 两组;模型接收组 B 的时域或 STFT 域信号,输出组 A 的估计信号;训练时用组 A 真实信号计算损失,测试时在未见录音上评估 ReTM 估计精度和下游语音增强效果。信号模型假设热噪声可忽略,源信号固定、环境平稳。ReTM 在频域定义为 \(\boldsymbol{\mathcal{R}}_{AB}(f) \triangleq \mathbf{H}_A(f)\mathbf{H}_B(f)^{\dagger}\),其中 \(\mathbf{H}_A(f)\) 和 \(\mathbf{H}_B(f)\) 分别为两组麦克风的声学传递函数矩阵,\((\cdot)^{\dagger}\) 表示 Moore-Penrose 伪逆,并要求 \(Q_B \geq \mathcal{L}\)(组 B 麦克风数不少于源数)。由此得到频域线性关系 \(\mathbf{M}_A(f,t) = \boldsymbol{\mathcal{R}}_{AB}(f)\mathbf{M}_B(f,t)\),其时域形式为 \(m_A^j(t) = \sum_{i=1}^{Q_B} r_{AB}^{ji}(t) * m_B^i(t)\)。论文的目标是学习 \(F_B(\cdot)\) 或 \(f_B(\cdot)\),分别满足 \(\mathbf{M}_A(f,t) = F_B(\mathbf{M}_B(f,t))\) 和 \(\mathbf{m}_A(t) = f_B(\mathbf{m}_B(t))\)。
SCoNet(STFT 域深度卷积网络):输入为麦克风组 B 的 STFT 表示 \(\mathbf{M}_B(f,t)\),将复数的实部和虚部沿通道维度堆叠,形成形状为 \(2Q_B \times F \times T\) 的类图像特征。网络采用二维深度卷积,作用于时间轴和通道轴上,不同频率分量之间不共享参数,从而获得频点相关的空间映射能力。深度卷积的输出按通道重新组织,得到组 A 的 STFT 估计 \(\hat{\mathbf{M}}_A(f,t)\)。SCoNet 的关键设计动机是用轻量深度卷积保持频率独立性,避免高维全连接带来的参数量爆炸;其代价是基本没有跨频带交互建模,对频谱整体结构的利用有限。
SCoNet 的模型架构如下图所示。

下图展示了 SCoNet 在 STFT 域使用深度卷积进行空间映射的过程,输入为麦克风组 B 的 STFT 表示,输出为组 A 的估计。
FuSNet(卷积滤波器与求和网络):在时域直接参数化式 (4) 中的冲激响应 \(r_{AB}^{ji}(t)\)。网络包含 \(Q_A \times Q_B\) 个可学习的一维卷积滤波器,每个滤波器对应一组“组 B 麦克风 \(i\) 到组 A 麦克风 \(j\)”的 ReTM 冲激响应。输入为非重叠的长度 \(L\) 段,并构造长度为 \(3L\) 的上下文窗口。论文称滤波器大小设为 \(L\),目的是使卷积输出匹配原始段长度。傅里叶变换域的乘法卷积关系要求窗口长度大于房间混响时间以满足 multiplicative transfer function 假设,因此 \(L\) 取 8192 样本。各滤波器输出按 \(j\) 分组求和,得到时域组 A 麦克风信号。FuSNet 的优势是可解释、参数量少、延迟低,但频率选择性不如 STFT 域模型,且对窄带非均匀频谱(如空调噪声、音乐)的 ReTM 估计精度有所下降。
FuSNet 的模型架构如下图所示。

下图展示了 FuSNet 在时域使用卷积滤波器组直接参数化 ReTM 冲激响应的过程,每个滤波器对应组 B 麦克风到组 A 麦克风的映射。
LAeNet(基于 LSTM 的自编码器网络):在 STFT 域操作。对每个频率 bin,将组 A 和组 B 的 STFT 拼接后输入共享权重的双向 LSTM(BiLSTM)层。每个频率 bin 的时间序列被独立处理,但所有频率 bin 共享同一套 BiLSTM 参数,以保持参数效率和跨频率泛化能力。BiLSTM 输出经层归一化稳定训练,再在时间维度上做平均,得到尺寸为 \(4(Q_B+Q_A)\) 的特征向量——这一维度来自复数 STFT 实虚部通道数 \(2(Q_B+Q_A)\) 经 BiLSTM 双向倍增至 \(4(Q_B+Q_A)\)。该特征向量随后经全连接网络 \(k(\cdot)\) 映射为 ReTM 系数,最后按式 (3) 由 \(\mathbf{M}_B(f,t)\) 得到 \(\hat{\mathbf{M}}_A(f,t)\)。LAeNet 的设计动机是利用 LSTM 对窄带时间相关性建模,并通过频率间共享参数保持高效;但论文没有清楚说明推理时是否仍需要组 A 信号作为输入,这带来训练/推断一致性的严重疑虑。
LAeNet 的模型架构如下图所示。

下图展示了 LAeNet 使用共享 BiLSTM 处理 STFT 数据的过程,图中显示输入为组 A 和组 B 的 STFT 拼接,用于估计 ReTM 系数。
损失函数与训练策略:损失采用时域负 SDR 与 STFT 域 RSE 的加权和 \(L = -\alpha L_{SDR}(\mathbf{m}_A, \hat{\mathbf{m}}_A) + \beta L_{RSE}(\mathbf{M}_A, \hat{\mathbf{M}}_A)\)。其中 \(L_{SDR} = \frac{1}{T}\sum_{t=1}^{T} 10\log_{10}\left(\frac{|m_A(t)|_2^2}{|m_A(t)-\hat{m}_A(t)|_2^2}\right)\) 最大化时域组 A 估计信号与目标信号的信号失真比;\(L_{RSE} = \frac{1}{FT}\sum_{t=1}^{T}\sum_{f=1}^{F} 10\log_{10}\left(\frac{|\hat{M}_A(f,t)-M_A(f,t)|^2}{|M_A(f,t)|^2}\right)\) 最小化频谱相对误差。\(\alpha=1\)、\(\beta=10\) 的设置使频谱误差项在训练中占据主导。训练使用 Adam 优化器,学习率依据验证集表现自适应下降。
💡 核心创新点
首次提出监督深度学习 ReTM 估计框架:此前仅有基于协方差矩阵的估计方法。本文将 ReTM 估计从统计关系建模转变为可训练的信号重建任务,为多源多麦克风空间映射学习开辟了监督范式。
三种覆盖不同域和归纳偏置的互补架构:SCoNet 以频点深度卷积保留频率独立性;FuSNet 将 ReTM 的时域冲激响应直接参数化为卷积滤波器组,具有可解释性;LAeNet 用共享 BiLSTM 捕捉窄带时间动态。三者提供不同表示、不同时频尺度上的建模选择。
时域与 STFT 域联合损失:通过加权组合负 SDR 和 RSE,训练目标同时约束时域波形质量和频谱相对误差。论文声称这种联合优化能增强跨表示一致性,减少只在单一域表现良好的伪影。
从 ReTM 估计精度到下游语音增强的联合评估:不仅报告五类估计指标,还测试了估计 ReTM 在已知噪声 ReTM 条件下的语音降噪效果,使研究工作更贴近应用闭环。
📊 实验结果
论文在四个仿真场景上评估:A1 为两个白高斯噪声源,A2 为空调噪声和音乐噪声源,B 为语音、空调噪声和音乐三源且 \(Q=7\) 麦克风,C 使用相同声源但 \(Q=12\) 麦克风。所有测试数据中 A1 为 1 分钟,A2/B/C 仅 10 秒。指标为 SDR↑、MSE↓、LSD↓、APD↓、RSE↓,报告形式为“通道 1/平均”。
以下表仅保留场景 B 和 C 的关键数据;论文未提供消融实验。
| 场景 | 方法 | SDR (dB)↑ | MSE (dB)↓ | LSD (dB)↓ | APD (rad)↓ | RSE (dB)↓ |
|---|---|---|---|---|---|---|
| B | Baseline | 16.1/16.29 | −36.65/−37.49 | 2.48/2.5 | 0.23/0.24 | −17.39/−16.85 |
| B | SCoNet | 22.42/21.96 | −42.78/−42.98 | 1.53/1.54 | 0.19/0.19 | −20.76/−20.33 |
| B | FuSNet | 22.51/21.91 | −45.12/−45.17 | 4.89/4.96 | 0.71/0.72 | −19.60/−19.16 |
| B | LAeNet | 22.36/21.88 | −45.01/−45.18 | 1.78/1.88 | 0.2/0.21 | −17.58/−17.21 |
| C | Baseline | 23.05/23.25 | −43.6/−43.35 | 1.03/1.09 | 0.15/0.15 | −34.03/−33.22 |
| C | SCoNet | 29.59/27.85 | −44.12/−43.27 | 1.06/1.17 | 0.14/0.16 | −28.63/−27.43 |
| C | FuSNet | 40.33/38.88 | −62.89/−61.98 | 1.95/2.10 | 0.15/0.16 | −34.07/−33.27 |
| C | LAeNet | 29.35/28.57 | −52.00/−51.77 | 1.39/1.49 | 0.14/0.15 | −20.15/−19.97 |
在所有估计指标中,FuSNet 在 A1、A2 和 C 场景的 SDR/MSE/RSE 上明显领先,但频域指标 LSD/APD 不稳定,场景 B 的 LSD 为 4.89/4.96 dB,明显劣于 Baseline 的 2.48/2.5 dB。LAeNet 在多数场景中优于 Baseline,但 RSE 常较差。论文正文声称“SCoNet performs best in scenario B with an MSE score lower than FuSNet”,但表 1 显示 SCoNet MSE 为 −42.78/−42.98 dB,FuSNet 为 −45.12/−45.17 dB,在“越低越好”的 dB 指标下 FuSNet 实际更好,该正文结论与表格数据直接矛盾。
计算复杂度方面,FuSNet 在 \(Q_A=3,Q_B=4\) 时参数 98.3k、延迟 1.07 ms;SCoNet 参数 196.7k、延迟 6.77 ms;LAeNet 参数 263.5k、延迟 1.80 s,推断延迟远超其他两个模型,限制了实时应用潜力。
语音增强结果如下表所示:
| 方法 | B SDR (dB) | B STOI | C SDR (dB) | C STOI |
|---|---|---|---|---|
| Noisy | −2.70 | 0.54 | −2.70 | 0.54 |
| Baseline | 6.06 | 0.87 | 4.07 | 0.85 |
| SCoNet | 6.45 | 0.87 | 4.96 | 0.87 |
| FuSNet | 2.21 | 0.80 | −1.19 | 0.67 |
| LAeNet | 8.67 | 0.92 | 7.03 | 0.91 |
LAeNet 在下游语音增强中表现最强。Baseline 和 SCoNet 接近。FuSNet 尽管 ReTM 估计精度最高,降噪后 SDR 在场景 C 中反而从 Baseline 的 4.07 dB 跌至 −1.19 dB,STOI 从 0.85 跌至 0.67,说明其时域 ReTM 估计在噪声源相对传递矩阵已知的语音增强流程中无法有效抑制噪声、反而引入严重失真。论文未提供统计显著性检验或多次随机种子实验结果。
🔬 细节详述
训练数据:使用论文未具体命名的开源工具箱 [8] 在 \(6\times7\times3\) m 矩形房间中仿真,\(T_{60}=500\) ms。声源和麦克风位置为随机或特定配置但未完整说明。A1 使用两个高斯白噪声源,训练/验证/测试分别为 3/1/1 分钟;A2 使用空调噪声和音乐,B 使用语音、空调噪声和音乐,C 使用与 B 相同声源;A2/B/C 训练 50 秒、测试 10 秒。所有麦克风信号添加 40 dB SNR 的高斯白噪声并下采样到 16 kHz。噪声和语音素材具体来源未说明。数据增强未提及。
损失函数:加权组合负 SDR 和 RSE,\(L = -\alpha L_{SDR} + \beta L_{RSE}\),\(\alpha=1\)、\(\beta=10\)。\(L_{SDR}\) 为时间域组 A 麦克风信号的平均信号失真比;\(L_{RSE}\) 为 STFT 域误差功率与目标功率比值的平均对数。
训练策略:Adam 优化器,学习率依据验证集性能自适应下降;具体初始学习率、warmup、batch size、epoch 数、学习率调度规则均未说明。
关键超参数:FuSNet 窗口和上下文大小为 8192 样本;SCoNet 和 LAeNet 使用 Hann 窗、窗长 8192、50% 重叠的 STFT;\(Q_A/Q_B\) 分别为 3/4 和 5/7;网络隐藏维度、层数、全连接网络 \(k(\cdot)\) 结构未说明。
训练硬件:仅给出推理延迟在 NVIDIA GeForce RTX 3090 GPU 上测量;训练 GPU 型号、数量、训练时间未说明。
推理细节:FuSNet 对非重叠段处理,使用上下文窗口;SCoNet/LAeNet 是否使用重叠相加重建、STFT 逆变换细节等未说明。该任务属于回归式预测,无 beam search、温度或流式解码设置。
正则化或稳定训练技巧:LAeNet 使用层归一化;其余模型未提及 dropout、权重衰减、梯度裁剪等稳定训练手段。
生成式 AI 披露:论文在致谢后声明使用生成式 AI 工具协助起草和润色部分脚本,并用语法检查模型提升语言清晰度和可读性。该披露不影响方法有效性的判断,但需注意人工核查的不可替代性。
⚖️ 评分理由
创新性 (1.2/2):首次提出三种监督深度学习框架估计 ReTM,分别覆盖 STFT 深度卷积、时域卷积滤波器组和 BiLSTM 时序建模,并引入时域 SDR 与 STFT RSE 的联合损失;但整体属于监督重建范式,创新幅度中等。
技术严谨性 (0.8/1.5):方法推导整体清晰,但 LAeNet 同时拼接组 A/组 B 的 STFT 作为输入,训练与推断输入存在不一致疑点;FuSNet 的 3L 上下文与 L 滤波器大小如何得到 L 输出未能严格解释,构成算法逻辑/实现层面的严谨性缺陷。
实验充分性 (0.8/1.5):有四类仿真场景、五类指标和下游语音增强评估,但仅与协方差基线比较,A2/B/C 测试仅 10 秒,无统计显著性检验或多次随机种子,且未提供关键消融;FuSNet 估计精度最高却在下游增强中明显断裂,说明评估证据不够充分。
清晰度 (0.6/1):正文存在“SCoNet 在场景 B 的 MSE 优于 FuSNet”与表格数据相悖的表述,且 LSD/RSE 公式和部分表格中正负号不一致或缺失,影响结果阅读与核验。
影响力 (0.7/1.5):研究面向多源多麦克风 ReTM 估计与语音增强,属于语音/音频处理核心方向;首次提出监督 ReTM 估计为多通道空间映射提供了新思路,对后续研究有潜在带动作用,但短期内影响相对有限。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.1/0.5):论文给出房间尺寸、T60、窗长、STFT 参数和损失权重等,但缺少初始学习率、batch size、epoch 调度、隐藏维度、层数、全连接结构及训练硬件/时间,关键配置大量缺失,难以直接复现。
工程/实践价值 (0.9/1.5):给出了参数规模与 GPU 推理延迟:FuSNet 参数 98.3k、延迟 1.07 ms,SCoNet 6.77 ms,LAeNet 1.80 s;显示一定工程分析和轻量模型潜力,但 LAeNet 实时性不足,尚未展示真实部署压力测试。
🚨 局限与问题
论文明确承认的局限:
- 模型假设所有声源位置固定、环境平稳。
- FuSNet 用于语音降噪时仍残留显著回声噪声,作者提出未来需结合去混响算法 [23,32] 改善。
- 作者指出未来工作将扩展到声源分离、语音去混响和最优麦克风分组策略。
审稿人发现的潜在问题:
- FuSNet 上下文长度与输出长度描述冲突:输入 \(3L\) 上下文窗口、滤波器大小 \(L\),如何得到原长度 \(L\) 的卷积输出未说明。若使用 valid convolution,输出长度应为 \(3L-L+1=2L+1\);若使用 same padding,输出应为 \(3L\)。原文表述与常规卷积语义不一致,直接影响网络实现和结果可复现性。
- LAeNet 训练/推断不一致疑点:方法描述中 LAeNet 将 \(\mathbf{M}_A\) 和 \(\mathbf{M}_B\) 两个 STFT 拼接后输入 BiLSTM,但在实际估计 \(\mathbf{M}_A\) 时是否应只输入 \(\mathbf{M}_B\) 未解释。如果训练和测试输入不同,则网络可能学到依赖目标信号的非因果映射,估计结果可能严重失真。
- 结论与数据不一致:正文称“SCoNet performs best in scenario B with an MSE score lower than FuSNet”,但表 1 显示 FuSNet 的 MSE 更低且更优,审稿人根据数据判断该表述应为错误。
- ReTM 估计精度与下游增强效果断裂:FuSNet 在 ReTM 估计的五类指标中多数最优,但在语音增强中 SDR 和 STOI 大幅劣于 Baseline。这暗示当前评估指标与目标应用的关联度不足,也对“准确估计 ReTM 即可提升语音增强”这一隐含逻辑构成挑战。
- 实验规模过小且无统计检验:A2/B/C 测试仅 10 秒,且没有多次实验的均值方差/置信区间,SDR/STOI 提升是否显著不可知。
- 缺乏关键消融实验:如损失函数权重 \(\alpha/\beta\)、窗长、上下文长度、STFT 重叠比例、模型深度等都没有消融。
- 学习映射可能依赖源信号分布:模型直接回归 A 组信号或 ReTM 系数,但没有约束保证输出是空间线性映射而非源依赖函数,影响在不同声源和噪声类型下的泛化。
- 基线过少:ReTM 估计只与协方差方法对比,没有与适配其他 ReTF/空间滤波深度学习方法或经典波束形成方法的更完整比较。
- 度量公式与符号问题:LSD 和 RSE 的正负号、表 A2 中 Baseline RSE 的第二个数值正负号缺失等,影响评审和复现。