📄 Spatial-Frequency Cued Generative Fixed-Filter Active Noise Control Based on Deep Learning in Reverberant Environments
标签:#主动降噪 #声源定位 #多任务学习 #音频理解 #Transformer
6.9/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.5/1.5
✅ 6.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #声源定位 | #多任务学习 | #主动降噪 #音频理解 | arxiv
👥 作者与机构
- 第一作者:Boxiang Wang(南洋理工大学电气与电子工程学院 Smart Nation TRANS Lab)
- 通讯作者:未说明
- 作者列表:Boxiang Wang(南洋理工大学电气与电子工程学院 Smart Nation TRANS Lab)、Haowen Li(西北工业大学智能声学与沉浸式通信中心)、Dongyuan Shi(西北工业大学智能声学与沉浸式通信中心)、Junwei Ji(西北工业大学智能声学与沉浸式通信中心)、Ziyi Yang(西北工业大学智能声学与沉浸式通信中心)、Zhengding Luo(西北工业大学智能声学与沉浸式通信中心)、Woon-Seng Gan(南洋理工大学电气与电子工程学院 Smart Nation TRANS Lab)
💡 毒舌点评
论文抓住了传统GFANC忽略声源空间信息这一明确痛点,通过引入3D空间条件化和设计多任务CRNN,在模拟和实测中确实实现了更快的响应和更高的降噪量,其系统框架(离线库+在线双路)的工程思路清晰。然而,其核心价值高度依赖于“预定义网格点+离散分类”这一前提,当声源位置介于网格之间时,系统只能进行最近邻硬选择,空间维度上的连续适应性缺失。实验场景局限于单一、静止噪声源,对声源运动、多声源、设备布局变化等现实复杂性完全回避。0.5秒的帧处理延迟在ANC中已是显著的算法延迟,论文却以“delayless”为卖点,存在概念混淆。总体来看,这是一篇在受限场景下工程表现不错的方案,但离鲁棒、灵活的现实部署还有相当距离。
📌 核心摘要
- 本文旨在解决生成式固定滤波器主动降噪(GFANC)方法在混响环境中因忽略噪声源空间信息而导致性能下降的问题。
- 方法核心是提出一种空间-频率线索引导的GFANC(SF-GFANC)方法,利用一个多任务卷积循环神经网络(CRNN)同时估计噪声源的3D空间位置(距离、仰角、方位角)作为空间线索,以及预测子控制滤波器的组合权重作为频率线索,以联合生成适用于特定声源位置和频谱的控制滤波器。
- 与已有方法相比,新在首次将完整的三维空间信息(距离、仰角、方位角)系统性地引入GFANC框架,并建立了最优控制滤波器与声源3D位置关系的理论分析框架。
- 主要实验结果:在模拟和实测声学路径上,CRNN对未见过的环境和噪声类型的3D定位准确率高(例如方位角准确率>95%)。与传统FxLMS、SFANC、GFANC和FD-SFANC等基线相比,SF-GFANC在不同3D位置和噪声类型下均实现了更高的降噪量(NR)。例如,对于一个位于
(0.3m, 30°, 0°)的100-700Hz宽带噪声,SF-GFANC在首个0.5秒后即实现超过10dB的平均降噪,而FxLMS尚未收敛。 - 实际意义是为在复杂混响环境中部署响应更快、更稳定的自适应降噪系统提供了一种新的数据驱动框架。
- 主要局限性包括:理论分析基于镜像法等较强假设;实验验证局限于单一、静止噪声源场景;对声源连续运动、多声源、设备布局变化等更复杂情况未作探讨;开源计划为“将提供”,但代码仓库已存在。
表1:CRNN在不同未见环境和SNR下的性能(摘要,完整数据见论文表4)
| 指标 | 环境 | 方法 | SNR 10 dB | SNR 50 dB |
|---|---|---|---|---|
| 距离准确率 (%) | R1‘ | CRNN | 94.27 | 94.46 |
| 仰角准确率 (%) | R1‘ | SRP-PHAT | 79.60 | 87.52 |
| R1‘ | CRNN | 92.44 | 95.02 | |
| 方位角准确率 (%) | R1‘ | SRP-PHAT | 65.01 | 79.66 |
| R1‘ | CRNN | 97.23 | 97.83 |
🔗 开源详情
- 代码:https://github.com/Wang-Boxiang/Spatial-Frequency-Generative-Fixed-Filter-Active-Noise-Control
- 模型权重:论文中未提及是否开源训练好的CRNN模型检查点(Checkpoints)。
- 数据集:论文中使用的噪声数据包括公开的 UrbanSound8K 数据集(文中引用[27])。房间脉冲响应(RIR)使用 gpuRIR 库(文中引用[5])模拟生成。用于评估的实测声学路径(Measured Acoustic Paths)数据已上传至上述GitHub仓库,并在脚注1中说明:“Detailed path responses are available at https://github.com/Wang-Boxiang/Spatial-Frequency-Generative-Fixed-Filter-Active-Noise-Control”。
- Demo:论文中未提及
- 复现材料:论文在Table 2和Table 3中提供了关键的训练和仿真配置(如麦克风数量、采样率、滤波器长度、房间尺寸等)。但缺乏详细的复现脚本和步骤,例如未说明如何生成完整的训练数据、CRNN的具体实现代码是否完整等。
- 论文中引用的开源项目:
- gpuRIR: 一个用于模拟房间脉冲响应的GPU加速库(文中引用[5])。未在论文中提供具体链接,需通过文献引用[5]查找。
- UrbanSound8K: 一个用于城市声音分类研究的大规模数据集(文中引用[27])。未在论文中提供具体链接,需通过文献引用[27]查找。
🏗️ 方法概述和架构
本文提出的SF-GFANC是一个端到端的降噪系统框架,其核心流程是:首先离线构建一个覆盖不同3D空间位置的预训练控制滤波器库;然后,在线运行的多任务CRNN模型实时分析多通道参考信号,同时输出声源的3D空间分类和频谱组合权重;最后,根据这些线索从库中选取并组合生成一个针对当前声源环境最优的控制滤波器,用于实时噪声抵消。该系统分为离线准备和在线执行两个阶段。
主要组件/模块详解:
- 预训练控制滤波器库:这是一个离线构建的查找表。在特定的声学环境中(参考麦克风阵列、次级声源和误差麦克风位置固定),将噪声源可能存在的三维空间(球坐标)网格化。论文中定义为4个距离(0.2m, 0.3m, 0.4m, 0.5m)、3个仰角(-30°, 30°, 90°)和6个方位角(0°, 60°, 120°, 180°, 240°, 300°),共72个网格点。在每个网格点,使用20-2020Hz的宽带白噪声通过FxLMS算法预训练一个最优控制滤波器,并存储于库中。该库是空间条件化的基础。
- 多任务卷积循环神经网络(CRNN):这是方法的核心预测模型。
- 输入:对J通道(J=4)参考信号进行短时傅里叶变换(STFT),取其幅度谱和相位谱,沿通道维度拼接成一个
2J x F x T(8 x 513 x 64)的张量。 - 内部结构:首先通过三个卷积块提取时空-频域特征。每个卷积块包含一个2D卷积层、组归一化(Group Normalization)、ReLU激活函数和最大池化层(沿频率和时间维度)。随后特征图分为两个并行分支:
- 频率线索分支:对特征图进行时间维度平均池化,然后通过一个全连接层和Sigmoid激活函数,输出H=8个子控制滤波器的软组合权重向量
ĝ,用于捕捉噪声的频谱特性。 - 空间线索分支:对特征图进行频率维度平均池化降维,然后通过两个GRU层(带tanh激活函数)捕捉时间依赖性。GRU输出经过全连接层压缩后,分别馈入三个并行的全连接层,再通过Softmax激活函数,分别输出对A=4个距离类、B=3个仰角类和C=6个方位角类的概率分布
p^dist,p^elev,p^azim。
- 频率线索分支:对特征图进行时间维度平均池化,然后通过一个全连接层和Sigmoid激活函数,输出H=8个子控制滤波器的软组合权重向量
- 输出:上述四个向量,即空间线索(三个分类概率分布)和频率线索(组合权重向量)。该模型仅包含0.24百万参数和121.26M MACs,计算效率高。
- 输入:对J通道(J=4)参考信号进行短时傅里叶变换(STFT),取其幅度谱和相位谱,沿通道维度拼接成一个
- 控制滤波器生成器:这是一个确定性的算法模块。根据CRNN输出的空间分类结果(取每个维度最大概率对应类索引
â,b̂,ĉ),从预训练的控制滤波器库中检索出对应的滤波器w。然后,依据滤波器完美重建理论,在频域将该滤波器分解为H个子控制滤波器,得到其时域表示矩阵c。最后,将CRNN预测的软组合权重ĝ与这个子滤波器矩阵c进行内积运算,生成最终的混合控制滤波器w_gen。这个w_gen同时融合了空间和频率信息。 - 实时控制器:这是一个无自适应更新的执行单元。它使用生成器产出的
w_gen对实时输入的参考信号进行卷积(式29),产生抗噪声信号驱动次级声源。该控制器在采样率(16kHz)下运行,实现逐样本控制。控制滤波器w_gen由协处理器在帧率(0.5秒)下更新。
下图详细展示了用于联合估计3D空间位置和频率组合权重的多任务CRNN网络结构。

图中可见,网络包含卷积块提取时空特征,并分为两个并行分支分别输出空间分类概率和软组合权重。
组件间的数据流与交互:系统采用并行架构。协处理器(运行CRNN和生成器)与实时控制器并行工作。多通道参考信号同时送入两者。CRNN在帧级(如0.5秒)分析信号,生成空间-频率线索并更新w_gen;实时控制器则使用当前最新的w_gen进行逐样本卷积。两者通过共享和更新w_gen实现解耦和协同,在保持实时性的同时,避免了传统自适应算法的收敛延迟。
下图展示了所提出的SF-GFANC系统的整体架构和并行处理流程。

图中可见,协处理器在帧级运行CRNN以更新控制滤波器,而实时控制器在采样率下执行降噪,实现了计算密集型任务与实时控制的解耦。
关键设计选择及动机:
- 选择CRNN:卷积层擅长从多通道信号中提取与空间和频谱相关的特征,循环层(GRU)能捕捉噪声信号可能的时间动态,适合联合估计任务。
- 软组合权重:允许生成介于不同子带滤波器之间的混合滤波器,比硬选择更具灵活性,能更精细地匹配噪声频谱。
- 离线预训练库+在线生成:避免了FxLMS等自适应算法的收敛慢和不稳定问题,实现快速响应。库的构建将复杂的声学环境适应性离线解决。
- 多任务学习:让一个模型同时学习空间和频率相关特征,共享底层表示,比训练多个独立模型更高效。论文指出,联合损失允许CRNN学习共享表示并有效管理多个目标。
💡 核心创新点
- 引入完整的3D空间条件化框架:首次将噪声源的三维空间信息(距离、仰角、方位角)系统性地引入GFANC。之前的方法(如SFANC、GFANC)主要基于频率,FD-SFANC也仅考虑了方位角和频率。该创新通过理论分析(第3节)在镜像法假设下推导出最优控制滤波器与声源3D坐标(通过路径长度)的相关性,为空间条件化提供了理论基础。
- 设计多任务CRNN联合估计空间与频率线索:与以往使用独立模型进行声音定位或滤波器选择不同,论文设计了一个统一的CRNN架构,能同时输出3D空间分类和频率组合权重。这种设计更高效,且能让两种线索在特征层面产生有益的交互。
- 提出基于子滤波器组合的生成机制:继承了GFANC的核心思想,但将其置于空间条件化框架下。通过将预训练的空间特定滤波器分解为子带,再用频率线索动态组合,实现了对“空间位置”和“噪声频谱”这两个关键变量的解耦与灵活控制。
- 提供系统级的工程框架:提出了“离线库构建 + 在线双路并行(协处理器与实时控制器)”的系统设计,清晰地划分了计算密集型任务和实时任务,为延迟敏感的ANC应用提供了可行的工程思路。
📊 实验结果
论文在模拟和实测声学路径上进行了全面评估。
- CRNN定位与权重估计性能:在三个未见的模拟房间环境和不同信噪比(SNR 10-50 dB)下,CRNN的3D定位准确率均很高(例如方位角准确率均高于95%,距离准确率约92-95%),远优于传统的SRP-PHAT方法。组合权重的均方误差(MSE)维持在较低水平(约0.04-0.06)。这证明了模型在未见环境下的泛化能力。(论文表4完整数据)
下图评估了不同混响时间对SF-GFANC系统平均降噪量的影响。

图中可见,随着混响时间增加,降噪性能有所下降,但系统在强混响下仍能保持一定的噪声抑制能力。
表2:CRNN在不同未见环境和SNR下的完整性能(论文表4)
| 指标 | 环境 | 方法 | SNR 10 dB | SNR 20 dB | SNR 30 dB | SNR 40 dB | SNR 50 dB |
|---|---|---|---|---|---|---|---|
| 距离准确率 (%) | R1' | CRNN | 94.27 | 94.69 | 95.21 | 95.02 | 94.46 |
| R2' | CRNN | 91.83 | 92.10 | 93.04 | 92.96 | 92.69 | |
| R3' | CRNN | 92.87 | 94.33 | 94.17 | 94.40 | 93.96 | |
| 仰角准确率 (%) | R1' | SRP-PHAT | 79.60 | 83.27 | 83.17 | 85.56 | 87.52 |
| R1' | CRNN | 92.44 | 94.52 | 94.46 | 95.35 | 95.02 | |
| R2' | SRP-PHAT | 77.65 | 81.31 | 80.40 | 82.60 | 84.27 | |
| R2' | CRNN | 90.69 | 93.42 | 93.17 | 94.02 | 93.90 | |
| R3' | SRP-PHAT | 78.60 | 81.85 | 81.94 | 84.73 | 85.15 | |
| R3' | CRNN | 91.40 | 94.15 | 94.04 | 94.58 | 94.81 | |
| 方位角准确率 (%) | R1' | SRP-PHAT | 65.01 | 72.65 | 75.91 | 78.32 | 79.66 |
| R1' | CRNN | 97.23 | 98.10 | 97.67 | 97.71 | 97.83 | |
| R2' | SRP-PHAT | 60.29 | 69.05 | 69.90 | 71.44 | 75.22 | |
| R2' | CRNN | 95.85 | 96.15 | 96.25 | 96.19 | 96.19 | |
| R3' | SRP-PHAT | 61.83 | 70.61 | 72.99 | 76.02 | 77.23 | |
| R3' | CRNN | 97.10 | 97.33 | 97.81 | 97.71 | 97.04 | |
| 组合权重 MSE | R1' | CRNN | 0.0531 | 0.0406 | 0.0594 | 0.0496 | 0.0445 |
| R2' | CRNN | 0.0523 | 0.0386 | 0.0525 | 0.0472 | 0.0459 | |
| R3' | CRNN | 0.0527 | 0.0397 | 0.0551 | 0.0465 | 0.0447 |
- 降噪性能对比:与多种基线方法(FxLMS, SFANC, GFANC, FD-SFANC)进行了对比。
- 宽带噪声:对于一个100-700 Hz的噪声源,分别放置在3个不同的3D位置。结果表明,SFANC和GFANC由于其控制滤波器与噪声源位置不匹配,降噪效果可能很差甚至放大噪声。SF-GFANC则始终保持有效降噪(首个0.5秒后平均NR>10 dB),展现了位置自适应的优势。
- FD-SFANC对比:在包含距离和仰角变化的场景下(如
(0.3m, 30°, 60°)和(0.2m, -30°, 0°)),FD-SFANC(仅考虑频率和方位角)性能显著下降,降噪量有限,而SF-GFANC仍能维持约15 dB的降噪量。 - 时变噪声:在包含不同噪声类型(真空、洗衣机)和3D位置变化的25秒信号中,SF-GFANC能快速(0.5秒)适应变化,而FxLMS收敛缓慢。论文指出,轻微偏离预训练网格点会导致控制滤波器的小幅变化,从而维持一定的降噪能力。
- 实测路径:在实测房间(8x5.2x2.6 m, RT60=0.27s)中,使用未经重训练的CRNN和基于实测路径更新的滤波器库,对压缩机噪声(位置
(0.47m, 40°, 310°))和手钻噪声(位置(0.54m, -20°, 250°))均实现了超过10 dB的有效降噪,且响应快于FxLMS。
- 消融/重要性分析:通过固定SFANC/GFANC滤波器的位置而改变噪声源位置,实验直观地证明了不考虑空间信息会导致性能崩溃(甚至噪声放大),从而验证了3D定位的必要性(第5.3.2节)。
- 鲁棒性分析:在混响时间(RT60)从0.1秒增加到0.9秒的系列实验中,SF-GFANC的降噪性能虽呈下降趋势,但在RT60=0.9秒时仍能保持平均NR>7 dB,显示了其对强混响环境的一定鲁棒性。论文将此归因于模型在高度多样化的混响数据上进行了训练。
下图对比了在不同3D位置下,多种降噪算法对宽带噪声的抑制性能。

图中可见,当噪声源位置改变时,SF-GFANC始终能有效降噪,而传统SFANC和GFANC则可能性能下降甚至放大噪声。
🔬 细节详述
- 训练数据:由模拟和真实噪声信号与不同房间冲激响应(RIR)卷积生成。模拟噪声为20-2020 Hz范围内带限白噪声(最小带宽60Hz);真实噪声来自UrbanSound8K数据集。RIR使用gpuRIR库基于镜像法模拟,涵盖3种不同尺寸的房间(训练:6x4x3, 12x8x3.5, 16x14x4 m³;测试:7x5x3, 11x9x3.2, 15x13x4.2 m³),每房间8种(训练)/4种(测试)阵列位置,9种RT60值(0.1-0.9秒, 与房间大小对应),以及随机距离(0.1-0.6m)、仰角(-60°至90°)和方位角(0°-360°)。训练/验证/测试集划分严格,测试集使用完全未见的房间和RT60。
- 损失函数:采用多任务学习策略。对于3D位置分类(距离、仰角、方位角)使用交叉熵损失;对于组合权重回归使用均方误差(MSE)损失。总损失为所有任务损失之和(文中未说明各损失项的权重比例)。
- 训练策略:使用Adam优化器,初始学习率1e-3,基于验证集损失自适应衰减(若验证损失连续5个epoch未改善,则学习率乘以0.5),最小学习率1e-6。应用早停(耐心15个epoch)防止过拟合。
- 关键超参数:参考麦克风数J=4,控制滤波器长度Lc=1024,参考信号长度Lr=8000(采样率16kHz对应0.5秒),STFT频率点F=513,时间帧T=64。空间分类数:距离A=4,仰角B=3,方位角C=6。子控制滤波器数H=8。
- 训练硬件:未说明。
- 推理细节:CRNN在协处理器上以帧率(0.5秒)运行。实时控制器在采样率(16kHz)下使用生成的滤波器进行卷积。未说明CRNN具体层维度(如全连接层神经元数、GRU隐藏单元数)、训练批量大小(batch size)、总训练轮数(epochs)等细节。
- 正则化/稳定训练:使用了早停和学习率衰减。网络中使用了组归一化(Group Normalization)和ReLU激活。
⚖️ 评分理由
创新性 (1.3/2):首次将完整三维空间信息系统性地引入GFANC框架,并设计多任务CRNN联合估计空间和频率线索,但本质是整合已有技术,创新程度属于有效整合而非原理性突破。证据见摘要和方法概述。
技术严谨性 (1.2/1.5):理论分析在镜像法假设下推导出最优滤波器与声源位置相关,为方法提供支撑;但假设简化且未讨论CRNN误差传播和滤波器库分辨率权衡。证据见方法概述和局限问题。
实验充分性 (1.0/1.5):实验覆盖多种基线和噪声类型,但场景局限于单一静止噪声源,实测验证规模小,缺少统计显著性分析和与端到端方法比较。证据见实验结果和局限问题。
清晰度 (0.8/1):论文结构清晰,图表有效,但一些关键细节如控制滤波器“完美重建”的数学实现和CRNN具体配置未清晰说明。证据见方法概述。
影响力 (0.8/1.5):对主动降噪领域有明确贡献,但应用范围较窄,局限于单声源固定设备场景,且未与前沿方法比较。证据见摘要和局限问题。
开源 (1.0/1.5):代码仓库已存在并可访问,但训练好的CRNN模型检查点未提及开源,复现材料不完全。证据见开源详情。
可复现性 (0.3/0.5):论文提供了关键训练和仿真配置,但CRNN具体层数、神经元数量、batch size、epochs等细节缺失,影响精确复现。证据见方法概述和局限问题。
工程/实践价值 (0.5/1.5):提出了离线库+在线双路并行的系统框架,但对实际部署中的延迟影响、功耗、存储开销和复杂场景鲁棒性讨论不足。证据见局限问题。
🚨 局限与问题
论文明确承认的局限:
- 系统设计针对单声源场景。
- 未来工作将关注实时实现和部署。
- 理论分析基于镜像法这一简化声学模型。
审稿人发现的潜在问题:
- 场景局限性:实验设置高度受控(固定麦克风阵列和次级声源位置、单一静止声源)。在声源快速移动、存在多个竞争声源、或设备物理结构(麦克风/扬声器相对位置)发生变化时,方法的有效性未知。
- “无延迟”的表述存在误导:论文强调“delayless noise control”。然而,CRNN的推理延迟(0.5秒一帧)本身就引入了显著的算法延迟。对于频率变化极快或瞬态噪声(如冲击声),这可能导致跟踪失效。系统的“实时性”是通过将高延迟的CRNN计算与实时卷积解耦实现的,并非真正的低延迟控制。
- 空间离散化与硬分类的局限:系统依赖于CRNN将连续声源位置分类到预定义的离散网格点。当声源位于网格点之间时,只能依赖最近邻硬选择,这可能导致次优的滤波器选择。软组合权重仅作用于频谱维度,未能对空间维度进行连续插值或平滑过渡。
- 实测验证的规模:实测实验仅在一个房间中进行,且仅测试了两个声源位置。更广泛的实测验证(不同房间、不同设备配置)是必要的。
- 与端到端深度学习ANC的对比缺失:未与近年来直接使用神经网络估计抗噪声信号的端到端方法进行比较,其相对于这些方法的优势不明确。
- 理论假设与实际差距:理论分析基于镜像法,假设了矩形房间和理想反射。实际房间形状、散射体、非刚性边界等因素未被考虑,这可能导致理论与实践存在偏差。