📄 Feedforward Active Speech Suppression Based on Time Series Prediction of Speech Signals Using Neural Networks

标签:#语音增强 #主动降噪 #实时处理

5.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5

📝 5.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #主动降噪 | #实时处理 | arxiv

👥 作者与机构

  • 第一作者:Manami Nishikata(Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan)
  • 通讯作者:未说明
  • 作者列表:Manami Nishikata(Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan)、Shoichi Koyama(National Institute of Informatics, Tokyo, Japan;Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan)

💡 毒舌点评

本文的想法朴素但有一定吸引力:把语音时间序列预测注入 FxLMS 的梯度更新,试图缓解非平稳语音下自适应滤波跟踪滞后。然而,最刺眼的结果是 MLP 预测质量相当差(Pearson 相关系数仅 0.287),却与 oracle 预测的降噪效果几乎相同。这说明当前 NPR 指标或评估设计可能根本测不出预测精度带来的真实增益。更值得注意的是,论文在方法部分构建了参考与期望两个预测器,但实验只训练和使用了参考信号预测器,期望信号由已知主路径直接生成,期望信号预测器这一更大难点被完全回避。整体上,方法有参考价值,但距离主动语音抑制的实际部署仍非常遥远。

📌 核心摘要

本文要解决的是前馈主动噪声控制(ANC)中语音这类高度非平稳信号难以被传统自适应滤波器跟踪的问题。作者提出 SP-FxLMS,在标准 FxLMS 的基础上,将未来若干时刻的参考信号和期望信号预测值用于计算额外梯度项,并与当前、过去梯度组合更新线性控制滤波器。其核心创新在于把神经网络时间序列预测引入自适应滤波更新路径,而不是直接生成控制信号或滤波器系数。数值实验使用自由场仿真和 LibriSpeech 语料,结果表明使用过去、当前和未来梯度的 SP-FxLMS_F+P 比标准 FxLMS 平均 NPR 改善 5.03 dB,比仅使用过去梯度的 FxLMS_P 改善 1.45 dB。但实验仅训练和使用了参考信号 MLP 预测器,期望信号由已知主路径生成;MLP 平均 NMSE 为 1.67 dB、Pearson 相关系数为 0.287,仍与 oracle 预测结果接近。该方法理论上可改善非平稳 ANC 的跟踪性能,但实时推理耗时超过采样间隔,实际部署仍需进一步实现调整。

🔗 开源详情

  • 代码:论文中未提及代码链接
  • 模型权重:论文中未提及
  • 数据集:论文中未提及具体数据集名称、获取链接或开源协议;文中仅描述使用 LibriSpeech ASR corpus(dev-clean)中 speaker 1988 的语音数据,训练章节 ID 为 147956 和 148538,测试章节 ID 为 24833。
  • Demo:论文中未提及
  • 复现材料:论文中未提供代码、检查点或附录;给出的实验配置包括:控制滤波器长度 \(K=192\);步长 \(\mu_0=1\);预测长度 \(a=128\);过去长度 \(b=1024\);固定遗忘因子 \(\lambda=1.0\);可变遗忘因子 \(\lambda_{\min}=0.9\)、\(\lambda_{\max}=0.999\);NN 预测器为单隐藏层 MLP,输入长度 \(N=512\),预测长度 \(a=128\),1024 个 ReLU 隐藏单元,Adam 学习率 \(10^{-3}\),batch size 8,训练 50 epochs。
  • 论文中引用的开源项目:未提及具体开源项目名称或链接;仅引用算法/方法(如 FxLMS、RLS、Adam、多层感知机),未提供对应开源实现地址。

🏗️ 方法概述和架构

本文提出 speech-prediction-based FxLMS(SP-FxLMS),这是一个模块化而非端到端的系统。整体流程为:参考麦克风捕获主噪声 \(x_k\);控制滤波器 \(\boldsymbol{w}_k\) 对参考信号滤波生成扬声器信号 \(y_k\);次级路径 \(s_l\) 将 \(y_k\) 传播到误差麦克风,与期望信号 \(d_k\) 混合后形成误差信号 \(e_k\)。负责更新控制滤波器的自适应算法不再只使用当前时刻的瞬时梯度,而是依赖两个预测器:参考信号预测器和期望信号预测器。它们从当前及过去观测中预测未来 \(a\) 个样本的 \(\hat{x}_{k+1},...,\hat{x}_{k+a}\) 和 \(\hat{d}_{k+1},...,\hat{d}_{k+a}\)。

控制滤波器更新同时考虑当前梯度 \(\boldsymbol{\Delta}_k^{\mathrm{C}}\)、未来预测梯度 \(\boldsymbol{\Delta}_k^{\mathrm{F}}\) 和过去观测梯度 \(\boldsymbol{\Delta}_k^{\mathrm{P}}\)。未来梯度定义为

\[ \boldsymbol{\Delta}_k^{\mathrm{F}} = \sum_{j=1}^{a} \gamma_j^{\mathrm{F}} \mu_{k+j} \hat{e}_{k+j} \hat{\boldsymbol{x}}_{\mathrm{f},k+j}, \]

其中 \(\hat{e}_{k+j} = \hat{d}_{k+j} + \boldsymbol{w}_k^{\mathsf{T}} \hat{\boldsymbol{x}}_{\mathrm{f},k+j}\),\(\hat{\boldsymbol{x}}_{\mathrm{f},k+j}\) 是预测参考信号经过估计次级路径 \(\hat{s}_l\) 后的滤波向量。权值 \(\gamma_j^{\mathrm{F}} = \frac{\lambda^j}{\sum_{i=1}^a \lambda^i}\),由遗忘因子 \(\lambda\) 控制。过去梯度 \(\boldsymbol{\Delta}_k^{\mathrm{P}}\) 采用相同思想,用过去 \(b\) 个时刻的观测误差和滤波参考信号计算。最终更新为

\[ \boldsymbol{w}_{k+1} = \boldsymbol{w}_k - \frac{1}{|\mathcal{T}|} \sum_{\mathrm{T} \in \mathcal{T}} \boldsymbol{\Delta}_k^{\mathrm{T}}, \]

其中 \(\mathcal{T}\) 可为 \(\{\mathrm{C},\mathrm{F}\}\) 或 \(\{\mathrm{C},\mathrm{F},\mathrm{P}\}\)。该公式的含义是:用当前、过去和预测未来的瞬时梯度平均来近似期望梯度,以改善非平稳语音下的跟踪能力。复杂度为 \(O((K+a+b)L + (a+b)K)\),其中 \(K\) 是控制滤波器长度,\(L\) 是次级路径长度。

除了固定 \(\lambda\),论文还提出可变遗忘因子。它先对滤波参考信号向量的功率做滑动平均

\[ \rho_k = \alpha \rho_{k-1} + (1-\alpha)\frac{\|\boldsymbol{x}_{\mathrm{f},k}\|^2}{K}, \]

再通过

\[ \lambda_k = \lambda_{\max} - (\lambda_{\max} - \lambda_{\min}) \frac{\rho_k}{\rho_k + \rho_0} \]

动态调整遗忘因子,其中 \(\rho_0 = \|\boldsymbol{x}_{\mathrm{f},k}\|^2/K\)。其动机是语音信号包含有声和无声段,低功率段应使用更大遗忘因子以保持较长时间记忆,高功率段应使用更小遗忘因子以快速跟踪。

预测器采用多层感知机 MLP。输入是 \(N=512\) 长度的过去及当前参考信号或期望信号,并经过最大绝对值归一化;输出是未来 \(a=128\) 个样本的预测。MLP 为单隐藏层,1024 个隐藏单元,ReLU 激活。损失函数为预测值与真实值的均方误差:

\[ \mathcal{L} = \frac{1}{a} \sum_{j=1}^{a} \left( \hat{z}_{k+j} - z_{k+j} \right)^2, \]

其中 \(z\) 可为 \(x_k\) 或 \(d_k\)。期望信号 \(d_k\) 并非直接观测,而是通过 \(d_k = e_k - \sum_l \hat{s}_l y_{k-l}\) 重构得到。该方法的关键设计选择是:不直接用 NN 生成控制信号或控制滤波器,而是用 NN 预测未来信号,再将预测信号注入经典 FxLMS 梯度计算。这样做保留了线性自适应滤波的可解释性和稳定性,同时以模块化方式引入未来信息。

需要注意的是,论文第 4.3 节实验部分明确说明:仅训练和使用了参考信号预测器,期望信号由给定主路径直接生成,并没有实际训练或使用期望信号预测器。因此,方法框架中描述的期望信号预测器在实验验证中并未被覆盖。

对于每个时刻的推理,MLP 的平均耗时在 CPU 上为 \(1.19\times 10^{-4}\) s,高于 16 kHz 采样对应的 \(6.25\times 10^{-5}\) s 采样间隔,说明实时实现仍需优化。

💡 核心创新点

  • 未来预测梯度融入 FxLMS:传统 FxLMS 只使用当前时刻观测近似期望梯度,对非平稳语音跟踪滞后。本文引入未来预测信号构造 \(\boldsymbol{\Delta}_k^{\mathrm{F}}\),提前将未来误差信息用于当前滤波器更新。在 oracle 预测下可获得比 FxLMS 明显更好的 NPR。

  • 当前、未来、过去梯度的加权组合:此前 FxLMS 通常只使用当前梯度,而本文把当前、预测未来和过去观测三者统一到一个更新框架。与仅使用过去信号的 FxLMS_P 相比,SP-FxLMS_F+P 仍获得额外降噪收益。

  • 可变遗忘因子用于预测梯度加权:将 RLS 等领域中可变遗忘因子思想迁移到 SP-FxLMS,根据输入功率动态调整过去和未来梯度的相对权重。实验中固定 \(\lambda=1\) 反而较优,但该机制提供了调节自由度。

  • 用简单 MLP 预测而非复杂模型进行可行性验证:作者明确指出 MLP 不追求最佳预测精度,而是评估有预测误差时 SP-FxLMS 是否仍有效。结果显示低相关性的预测仍接近 oracle 水平,这为后续使用更轻量或更准确预测器提供了判断依据。

📊 实验结果

论文在自由场数值仿真中验证方法。主声源为 LibriSpeech dev-clean 语料,采样率 16 kHz;次级路径距离 1.0 m,主路径距离 1.5 m;误差信号加入 SNR=30 dB 白高斯噪声。控制滤波器长度 \(K=192\),步长 \(\mu_0=1\)(由初步实验从 \(\{0.1,0.5,1.0,2.0\}\) 中选取,未按方法单独优化),过去长度 \(b=1024\),固定遗忘因子 \(\lambda=1.0\)。评估指标为归一化功率抑制 NPR,越低越好;同时报告了帧级 NPR,帧长 1600 样本,帧移 800 样本。

使用真实未来信号时,随着预测长度 \(a\) 从 1 增加到 128,平均 NPR 总体下降并趋于饱和,SP-FxLMS_F+P 通常表现最好。固定遗忘因子优于可变遗忘因子。19 名说话人 boxplot 针对 SP-FxLMS_F,显示当 \(a\ge 32\) 时性能高度依赖说话人。

使用 MLP 预测时,仅预测参考信号,期望信号由已知主路径生成。预测长度 \(a=128\) 的平均 NMSE 为 1.67 dB,Pearson 相关系数为 0.287。MLP 参数数量 656,512,每次推理 MAC 数 655,360,CPU 平均推理时间 \(1.19\times 10^{-4}\) s。

下表保留论文中六种关键配置的平均 NPR 结果,涵盖标准 FxLMS、仅过去、仅未来、未来+过去及两种可变遗忘因子变体,用于展示核心消融对比:

方法平均 NPR (dB)
FxLMS-37.09
FxLMS_P-40.67
SP-FxLMS_F-40.67
SP-FxLMS_F+P-42.12
SP-FxLMS_F_VFF-40.18
SP-FxLMS_F+P_VFF-41.22

SP-FxLMS_F+P 相比 FxLMS 改善 5.03 dB,相比 FxLMS_P 改善 1.45 dB。在 NN 预测条件下,oracle 预测和 MLP 预测的平均 NPR 几乎相同。论文未给出与 RLS、仿射投影或 PFANC 等更相关改进方法的直接数值对比。

🔬 细节详述

  • 训练数据:LibriSpeech ASR corpus(dev-clean)。NN 训练使用 speaker 1988 的 chapter ID 147956 和 148538;测试使用同一说话人的 chapter ID 24833。主要关注参考信号预测,训练中只涉及 reference signal,期望信号由给定主路径生成。预处理为按最大绝对值归一化输入信号,采样率 16 kHz。论文未提及数据增强。
  • 损失函数:均方误差 \(\mathcal{L} = \frac{1}{a}\sum_{j=1}^{a}(\hat{z}_{k+j} - z_{k+j})^2\),用于训练参考信号 MLP 预测器;期望信号预测器在实验中未训练。
  • 训练策略:优化器为 Adam,学习率 \(1\times10^{-3}\),batch size 为 8,训练 50 个 epoch。未说明 warmup、学习率调度、权重衰减或 early stopping。
  • 关键超参数:预测器输入长度 \(N=512\),输出预测长度 \(a=128\),隐藏层 1 层,隐藏单元 1024,激活函数 ReLU。ANC 侧控制滤波器长度 \(K=192\),过去长度 \(b=1024\),步长 \(\mu_0=1\),固定 \(\lambda=1.0\);可变遗忘因子 \(\lambda_{\min}=0.9\),\(\lambda_{\max}=0.999\);滑动平均平滑系数 \(\alpha\) 未在文中给出具体数值。
  • 训练硬件:未说明训练使用 GPU/TPU 类型和训练时长;仅给出推理 CPU 为 Intel Core Ultra 7 155H。
  • 推理细节:MLP 一次推理平均耗时 \(1.19\times10^{-4}\) s,高于 16 kHz 采样间隔 \(6.25\times10^{-5}\) s;未提供部署到 ANC 梯度更新中的具体流式实现、lookahead 调度或批处理策略。
  • 正则化或稳定训练技巧:未说明。
  • 次级路径:假设次级路径由有限脉冲响应 \(s_l\) 建模,估计次级路径 \(\hat{s}_l\) 已知;未说明次级路径估计误差或失配实验。
  • 评估划分:每段语音持续时长 12 s,由同一说话人的章节拼接或截断;前 5 s 用于滤波器自适应,后 7 s 用于评估 NPR;帧级 NPR 使用 1600 样本帧、800 样本帧移计算。
  • 降噪指标:NPR 定义为 \(10\log_{10}\left(\frac{\sum_{k\in\mathcal{I}} \tilde{e}_k^2}{\sum_{k\in\mathcal{I}} d_k^2}\right)\),其中 \(\tilde{e}_k\) 是无传感器噪声的误差信号,\(\mathcal{I}\) 为评估区间。

⚖️ 评分理由

  • 创新性 (1.2/2):[A_METHOD] 将神经网络时间序列预测注入FxLMS梯度更新路径,并统一融合当前、未来和过去梯度,属于模块化增量创新;但预测器为简单MLP,整体未脱离经典自适应滤波框架。

  • 技术严谨性 (1.0/1.5):[A_METHOD] 给出了梯度组合、权值、可变遗忘因子和复杂度公式,推导较完整;但未从数学上分析预测误差对梯度估计偏差和滤波器收敛性的影响。

  • 实验充分性 (0.9/1.5):[A_RESULTS][A_LIMITS] 提供了FxLMS、FxLMS_P和SP-FxLMS变体的消融与平均NPR表格,但缺少RLS、仿射投影、PFANC等更强跟踪基线,步长未按方法单独优化,也未报告统计显著性;实验主要在自由场、已知次级路径下进行,期望信号预测器未实际训练验证,跨说话人和压力场景覆盖不足。

  • 清晰度 (0.7/1):[A_METHOD] 方法框架、公式和算法流程较清楚;[A_LIMITS] 中MLP预测质量低却与oracle降噪效果几乎相同这一反直觉结果说明关键结果解释不足,影响读者理解。

  • 影响力 (0.6/1.5):[A_SUMMARY] 面向语音增强/主动降噪这一音频相关任务,数值仿真中SP-FxLMS_F+P比标准FxLMS改善5.03 dB,对主动语音抑制算法研究有一定参考价值;[A_METHOD] 但核心仍是经典FxLMS的梯度更新扩展,影响范围较窄。

  • 开源 (0.0/1.5):[A_OPEN] 论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。

  • 可复现性 (0.3/0.5):[A_METHOD][A_LIMITS] 已披露控制滤波器长度、预测长度、MLP结构、优化器和多数超参数;但可变遗忘因子平滑系数α未给出数值,训练硬件和训练时长也未说明,复现仍有关键缺失。

  • 工程/实践价值 (0.8/1.5):[A_METHOD] 模块化设计保留了线性自适应滤波可解释性,且更新复杂度低于RLS;[A_SUMMARY] 但CPU推理耗时超过16kHz采样间隔,实时主动控制场景中的部署价值尚未实现。

🚨 局限与问题

  1. 论文明确承认的局限

    • MLP 预测准确率不高,并非优化预测架构的设计。
    • 推理时间 \(1.19\times10^{-4}\) s 超过 16 kHz 采样间隔 \(6.25\times10^{-5}\) s,实时处理需进一步实现调整。
    • 固定遗忘因子 \(\lambda=1\) 在实验中优于可变遗忘因子,说明可变遗忘因子机制优势有限。
    • 文中主要评估同一说话人的不同章节,未展示跨说话人泛化结果。
  2. 审稿人发现的潜在问题

    • MLP 预测质量低却与 oracle 预测结果几乎相同,这一反直觉现象说明当前 NPR 指标或实验设计可能无法揭示预测精度带来的真正增益。应增加 onset 段、低能量段、瞬时能量变化区的细粒度评估。
    • 缺少与 RLS、仿射投影、PFANC 等更强跟踪型基线的对比,无法说明未来预测比已有高精度跟踪方法的相对价值。
    • 所有实验均在自由场且次级路径已知的理想条件下进行,未测试真实房间混响、次级路径估计误差、控制滤波器延迟和声反馈。
    • 步长 \(\mu_0\) 对所有方法固定,未按方法单独调参,可能影响公平性。
    • 没有提供统计显著性检验,性能差异可能是说话人内部噪声波动造成。
    • 理论框架包含参考信号和期望信号两个预测器,但实验只验证了参考信号预测器;期望信号预测器的实际效果、训练难度和误差传递均未被评估。
    • 论文未报告 MLP 训练时间和参数选择实验,难以评估实际部署成本。
    • 可变遗忘因子中滑动平均平滑系数 \(\alpha\) 未给出数值,影响复现和参数敏感性判断。

← 返回 2026-08-18 语音/音乐/音频论文速递