📄 开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消?

英文题目:ABSE-NET: A Lightweight Neural Model for Active Binaural Speech Enhancement in Open-Fit Hearing Aids

一句话:为解决开耳式助听器通气孔泄漏污染增强语音的问题,ABSE-NET 用 BMVDR 做保留空间线索的粗增强,再用仅 0.112M 参数的轻量网络联合完成泄漏对消与失真补偿,在合成双耳数据上以 0.184G FLOPs 取得 PESQ 3.626 与 STOI 0.955,但验证仍局限于仿真声学环境。

标签:#语音增强 | #CNN | #主动降噪 | #助听器 | #模型压缩

评分:7.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • De Hu:机构信息未在 arXiv HTML 中可靠披露
  • Xue Du:机构信息未在 arXiv HTML 中可靠披露
  • Qingying Zhao:机构信息未在 arXiv HTML 中可靠披露
  • Qintuya Si:机构信息未在 arXiv HTML 中可靠披露

💬 毒舌点评

亮点在于把双耳最小方差无失真响应波束形成器(binaural minimum variance distortionless response beamformer,BMVDR)与轻量后滤波级联,用 0.112M 参数实现开耳式场景下的泄漏对消且摆脱耳内误差麦克风,工程指向清晰。短板是评估完全依赖 Hearpiece 实测头相关脉冲响应(head-related impulse response,HRIR)合成的 24 小时仿真数据,未见真实开耳助听器佩戴、非线性次级路径或主观听感验证,且核心公式中空间线索误差定义存在明显笔误,削弱严谨性观感。

📌 核心摘要

开耳式助听器为缓解闭耳式带来的堵塞效应而引入通气孔,但外部噪声经通气孔泄漏至耳道会污染增强语音并引发梳状滤波,导致传统双耳语音增强(binaural speech enhancement,BSE)失效。ABSE-NET 提出主动式双耳语音增强(active binaural speech enhancement,ABSE)级联框架,前级用双耳最小方差无失真响应波束形成器(BMVDR)做粗增强并保留空间线索,后级轻量神经网络(lightweight neural network,LNN)以前级输出与参考麦克风信号为输入联合完成泄漏对消与失真补偿。与依赖耳内误差麦克风的自适应滤波类 ABSE 不同,该方法仅在训练阶段使用误差信号,推理阶段无需耳内麦克风。在 Librispeech 与 NOISEX-92 合成、基于 Hearpiece 数据库的双耳仿真集上,ABSE-NET 以 0.184G 浮点运算量(floating point operations,FLOPs)取得 3.626 的感知语音质量评估(perceptual evaluation of speech quality,PESQ)与 0.955 的短时客观可懂度(short-time objective intelligibility,STOI),在参数量仅为对照方法约 1/28 的情况下保持竞争力。该工作为资源受限的可穿戴助听设备提供了可部署的主动增强路径,但当前验证仍局限于受控合成声学环境,外推至真实佩戴与个体化耳道特性仍需检验。

🔗 开源与复现资源

  • 代码:https://github.com/Bream101/ABSE-NET
  • 模型权重:论文中未提及
  • 数据集:论文中未提及获取链接与开源协议,使用的公开数据集包括 Librispeech 数据集用于干净语音、NOISEX-92 数据集用于噪声信号、Hearpiece 数据库用于头相关脉冲响应 HRIRs,未提供直接下载链接
  • Demo:论文中未提及
  • 复现材料:论文在第 4.1 节提供了训练配置,STFT 采用长度为 320 采样点且跳长为 160 采样点的 Hanning 窗,信号下采样至 16 kHz,信噪比 SNR 随机设为 -5 dB 至 0 dB,共生成 43200 个时长为 2 秒的样本约 24 小时,按 8:1:1 划分为训练集验证集测试集且无重叠,HRIRs 选自 24 个入射方向其中 12 个用于训练另外 12 个用于验证和测试,BMVDR 波束形成器采用理想或失配的 ATF 并通过语音活动检测估计 SCM,LNN 输入采用帧级归一化,FA 模块重复 L = 4 次,所有 RMB-Conv1D 层核大小为 {1,3,5}
  • 论文中引用的开源项目:论文中未提及具体链接,仅提及数据集与数据库名称包括 Librispeech 数据集、NOISEX-92 数据集、Hearpiece 数据库

🧭 深度解读

开耳式助听器为何把最难的噪声留在了耳道里?

闭耳式助听器把耳道堵住,隔音好但戴久了会产生堵塞效应,自己的说话声、咀嚼声在颅腔内被放大,闷胀不适。开耳式于是开了一个物理通气孔来泄压,佩戴舒适了,却打开了一条声音的捷径:外部的噪声和目标语音都会不经过任何处理,直接从通气孔漏进耳道。

这条泄漏路径让传统的增强逻辑失效。助听器外置麦克风阵列拾取声音,经过算法增强后由内置扬声器播放,本想送入干净语音,但泄漏进来的原始含噪信号已经在耳道内等着,二者在鼓膜处叠加。目标语音分量会与泄漏中的目标分量干涉,产生梳状滤波的空洞与峰值;噪声分量则直接拉低信噪比。换句话说,算法在电路域做得再干净,只要不管声学域的泄漏,最终听到的仍是被污染的版本。

更棘手的是,这个叠加发生在佩戴者耳道这个极小的声腔里。传统主动降噪需要把误差麦克风伸到耳道深处去实时监听残余误差,再用自适应滤波不断调整。但耳道狭窄,长期放置麦克风既不舒适也难实现。于是问题被重新定义:能否在训练时见过误差信号,推理时却不再依赖它,依然在耳道内实现对消?

已有路线为何在通气孔面前集体失灵?

双耳语音增强长期分两条路线。模型驱动以双耳最小方差无失真响应波束形成器(binaural minimum variance distortionless response beamformer,BMVDR)为代表,它在短时傅里叶变换域对多通道观测建模,约束参考麦克风处目标无失真,最小化输出干扰加噪声功率,闭式可解,计算高效且能保留空间线索。但它依赖声学传递函数(acoustic transfer function,ATF)与干扰加噪声的空间协方差矩阵(spatial covariance matrix,SCM)的准确估计,一旦估计有误,约束失配就会带来语音失真。

数据驱动则用深度网络直接学习映射,从掩码估计到端到端波形映射,性能强但往往参数量大、对训练测试失配敏感,且几乎都为闭耳式设计,根本没有考虑泄漏项。把这两类方法直接搬到开耳式,都会在耳道叠加这一步跌落。论文表 1 显示,BMVDR 在理想无泄漏时 SI-SDR 为 5.216 dB,一旦引入泄漏就跌至 0.878 dB,PESQ 从 3.437 降至 2.196,说明问题不在波束形成器本身,而在声学泄漏未被建模。

主动式双耳语音增强(active binaural speech enhancement,ABSE)试图把主动噪声控制(active noise control,ANC)与 BSE 融合。已有工作如 FxMWF 把二者统一为一个优化问题,用自适应滤波同时做增强与对消,但仍需耳内误差麦克风提供实时反馈。另一些纯数据驱动的 ANC 如 DeepANC、ASE-TM 虽可摆脱误差麦克风,却并非为助听器设计,且参数量分别高达 19.683M 与 3.224M,FLOPs 达 5.817G 与 14.417G,难以部署。ABSE-NET 的定位正在于此:保留 BMVDR 的空间约束优势,用极轻量网络替代自适应滤波,并在推理阶段彻底摆脱耳内麦克风。

主动噪声控制 × 双耳语音增强: 双耳语音增强(BSE)负责从多麦克风观测中提取并增强目标语音,关注语音质量与空间感知;主动噪声控制(ANC)负责利用扬声器发射与泄漏信号等幅反相的声波实现物理对消,关注耳道内的残余误差。二者结合为主动式双耳语音增强(ABSE)的原因是开耳式助听器的泄漏发生在声学域而非电信号域,单纯做 BSE 会在耳道内与泄漏叠加产生梳状滤波,只有让 BSE 的输出同时包含增强语音与对消信号,才能在鼓膜处得到干净结果。

泄漏与失真如何被写成一个可学习的映射?

在短时傅里叶变换域,多通道麦克风信号被建模为目标与干扰的 ATF 叠加:

\[\bm{y}(k,l)=\bm{a}(k)s(k,l)+\sum_{i=1}^{I}\bm{b}_{i}(k)n_{i}(k,l)+\bm{v}(k,l),\]

其中 k、l 为频点与帧索引,a(k) 与 b_i(k) 为 ATF,s 与 n_i 为目标与干扰,v 为背景与传感器噪声。BMVDR 的求解为:

\[\hat{\bm{w}}_{L}=\arg\min_{\bm{w}_{L}}\bm{w}^{H}_{L}\bm{R}\bm{w}_{L}\quad\text{s.t.}\quad\bm{w}_{L}^{H}\bm{a}=a_{L},\]

R 为干扰加噪声 SCM,a_L 为目标到左耳参考麦克风的 ATF,约束保证参考点目标无失真。

开耳式的关键增量在耳道内。若在耳道深处放置误差麦克风,其接收信号为:

\[e_{L}=g_{L}\cdot\bm{\hat{w}}_{L}^{H}\bm{y}+d_{L}\;\]

g_L 为扬声器到误差麦克风的次级路径,d_L 为经通气孔漏入的信号,包含目标与噪声。论文将后滤波要学习的映射明确写为:

\[\mathcal{F}(\bm{\hat{w}}_{L}^{H}\bm{y},y_{L})\mapsto-d_{L}/g_{L}+a_{L}s\]

第一项是反相泄漏对消信号,第二项是参考点干净目标。输入特意保留了参考麦克风原始含噪信号 y_L,因为若仅输入 BMVDR 输出,噪声已被过度抑制,网络将失去生成高质量-d_L/g_L 所需的噪声信息。这个公式把声学对消问题转化为监督学习问题:训练时用误差麦克风提供 d_L 与 g_L 的真值,推理时仅用外置麦克风即可推断对消量。

ABSE-NET 如何把波束形成与声学对消串成一条流水线?

ABSE-NET 对左右耳独立处理,左耳流水线可概括为:时频域粗增强 → 特征拼接 → 编码 → 分层精炼 → 解码重构 → 时域对消。外置 M 通道信号先经 STFT,BMVDR 给出保留空间线索的粗估计\hat{w}_L^H y,再与参考麦克风时频点 y_L 的实部虚部拼接成 4×F×T 张量 X,其中 F、T 为频点与帧数。

X 进入轻量神经网络(lightweight neural network,LNN)。编码器用单层重参数化多分支 1 维卷积(RMB-Conv1D)将 X 映射为 C×F×T 潜特征 H,解码器用全连接层将精炼后的特征 A 投回 2×F×T 复谱 U,经逆 STFT 转时域后经次级路径 g_L 传播,在耳道内与泄漏 d_L 相消,得到最终估计\hat{u}。

双耳最小方差无失真响应波束形成器 × 轻量神经网络: 双耳最小方差无失真响应波束形成器(BMVDR)是模型驱动的波束形成器,负责在参考麦克风处无失真地保留目标语音的同时最小化干扰加噪声功率,提供稳定但粗糙的初估计;轻量神经网络(LNN)是数据驱动的后滤波器,负责补偿 BMVDR 因声学传递函数估计误差带来的失真并生成反相泄漏对消信号。二者搭配的原因是单一 BMVDR 无法处理通气孔泄漏,单一神经网络则难以在极低参数下同时保证空间线索与实时性,级联后前级提供可解释的空间约束,后级专注于非线性残差建模,组合后才实现了无需耳内麦克风的主动增强。

在进入模块细节前,先建立对整体数据流的直观。图 2(a) 是理解级联逻辑的关键,它把电信号域的拼接与声学域的叠加画在了同一张图里。

看图路径: 1. 先看左侧说话人与噪声源的红线如何同时指向助听器与通气孔;2. 再看蓝色助听器本体上三颗空心外置麦克风与深处紫色实心误差麦克风的位置差异;3. 最后追踪黑色虚线表示的增强信号经扬声器与次级路径到达耳道的叠加过程

原论文 Figure 1:Acoustic leakage in semi-open-fit HAs.

论文图 1。原论文 Figure 1::“Acoustic leakage in semi-open-fit HAs.”。

图 1 先把物理矛盾说清楚。左侧说话人与噪声的能量分两路,一路经黑色虚线到达蓝色助听器本体上的三颗空心外置麦克风,这是算法能看到的;另一路经红色实线标注的 Leakage Signal 直接穿过通气孔进入耳道,这是算法看不到却必须抵消的。蓝色本体内部的黑色方块是扬声器,其发出的声波经黑色虚线与次级路径向右传播,在紫色实心误差麦克风处与红色泄漏叠加。图中误差麦克风深处的位置直观解释了为何推理时难以依赖它,也为后文仅在训练阶段使用它埋下伏笔。

图 2(a) 展示了 ABSE-NET 的完整前向路径。上方 Reference Mic. signal 经 STFT 得到 y_L,下方 All Mic. 经 STFT 与 BMVDR 得到\hat{w}_L^H y,二者在 Concat. 处拼接为 X。X 进入虚线框 LNN,依次经过 Encoder、重复 L 次的 F-TDL 与 ConvAtt 构成的 Feature Augmentation、Decoder 得到 U,再经 iSTFT 还原为时域波形,波形被拆为紫色 Clean Speech 与红色 Anti-leakage 两部分叠加,经 Loudspeaker 与 g_L 次级路径后在红色加号处与 Leakage Signal 对消,最终紫色虚线\hat{u}指向 Error Mic.。图(b)(c) 则分别展开了 F-TDL 与 ConvAtt 的内部结构,为下一节的模块拆解提供了路线图。

看图路径: 1. 沿图(a) 顶部两路 STFT 输入,观察参考麦克风信号 y_L 与 BMVDR 输出如何拼接成 X 进入 LNN;2. 在图(b) 中对比左侧 FDL 的 RMB-Conv1D 与右侧 TDL 的 C-RMB-Conv1D 的归一化与残差差异;3. 在图(c) 中追踪通道注意力先做 AVG Pooling 再做频率-时间注意力的 Eq.(11) 调制路径

原论文 Figure 2:Proposed ABSE-NET: (a) Overview of ABSE-NET, (b) Architecture of F-TDL block, (c) Architecture of…

论文图 2。原论文 Figure 2::“Proposed ABSE-NET: (a) Overview of ABSE-NET, (b) Architecture of F-TDL block, (c) Architecture of ConvAtt block.”。

图 2 的像素细节进一步明确了轻量设计的落点。图(a) 中 LNN 虚线框内浅蓝色 Feature Augmentation 区域标注×L,表明 F-TDL Block 与 ConvAtt Block 重复堆叠。图(b) 左侧 Frequency Dependency Learning 分支可见 Layer Norm 后接 RMB-Conv1D 与 Linear+SiLU 的瓶颈,而右侧 Time Dependency Learning 分支则将卷积替换为 C-RMB-Conv1D 并加入 Group Norm+SiLU。图(c) 左侧 Channel Attention 先做 AVG Pooling 再经 2 级线性压缩,右侧 Frequency-Time Attention 则在橙色 Eq.(11) 处汇合,两路分别经 Linear 与 AVG Pooling 生成标量与空间图。这种分区着色与箭头走向说明,频率与时间、通道与谱时被刻意解耦处理。

F-TDL 为何要把频率与时间拆开学?

语音的谱时依赖来自两个正交维度。频域上,能量集中在基频及其谐波,且 STFT 加窗会造成频谱泄漏,相邻频点高度相关;时域上,浊音具有短时准周期性,且房间脉冲响应长度常超过 1 帧,导致帧间卷积。若用同一个注意力同时建模两者,计算量与参数量都会膨胀,不适合助听器。

F-TDL 因此拆为频率依赖学习(FDL)与时间依赖学习(TDL)两个子块串联,均带残差与层归一化。FDL 对每帧独立、权重跨时间共享:3 层线性层构成 C→C1→C 的瓶颈,首尾配 SiLU 激活,中间插入 RMB-Conv1D 沿频率维做深度卷积。训练时多分支输出为:

\[\bm{Y}_{train}=\bm{\Psi}+\sum_{q\in\mathcal{K}}\mathcal{P}(\bm{\Psi},\bm{r}_{q}),\]

其中 Ψ∈R^{C×F}为输入,P 为深度卷积,K={1,3,5}。推理时融合为单一卷积:

\[\bm{Y}_{infer}=\mathcal{P}(\bm{\Psi},\bm{r})\]\[\bm{r}=\bm{r}_{q_{3}}+\mathcal{Z}(\bm{r}_{q_{2}})+\mathcal{Z}(\bm{r}_{q_{1}})+\bm{r}_{I},\]

Z 为零填充对齐,r_I 为恒等分支转化核。TDL 则权重跨频率共享,将 RMB-Conv1D 替换为因果版本 C-RMB-Conv1D,感受野仅含历史与当前帧,保证流式实时性。其通道先经线性+SiLU 从 C 扩展至 C2=24,再经 C-RMB-Conv1D 与组归一化精炼,最后投影回 C,避免在压缩表示中丢失细粒度时序动态。

频率依赖学习 × 时间依赖学习: 频率依赖学习(FDL)处理每 1 帧内沿频率维的依赖,捕捉基频谐波结构与 STFT 加窗带来的频谱泄漏,权重跨时间共享;时间依赖学习(TDL)处理跨帧的时间依赖,捕捉浊音准周期性与房间脉冲响应导致的帧间卷积,权重跨频率共享并使用因果卷积。二者搭配是因为语音的谱时结构是正交的,若只建模 1 维,另 1 维的失真会残留,F-TDL 将二者串联并分别用轻量卷积实现,才在不依赖多头自注意力的前提下完成了全谱时建模。

重参数化多分支 1 维卷积 × 因果卷积: 重参数化多分支 1 维卷积(RMB-Conv1D)在训练时用核大小{1,3,5}的多分支并行卷积加恒等分支捕捉多尺度上下文,推理时通过零填充对齐融合成单一卷积核以降低开销;因果卷积(C-RMB-Conv1D)则进一步将感受野严格限制在当前及历史帧,杜绝未来信息泄露。二者结合的意义是 FDL 需要非因果的多尺度频域建模以看清谐波,而 TDL 需要因果的时序建模以保证实时流式处理,分别选用对应变体才兼顾了表达力与可部署性。

ConvAtt 如何用两次轻量注意力替代三维注意力?

F-TDL 提取的谱时特征仍需自适应筛选,但直接在 C×F×T 上做 3 维注意力代价过高。卷积注意力块(convolutional attention block,ConvAtt)顺序推断通道与频率-时间两类注意力。

通道注意力为:

\[\bm{\Phi}^{\prime}=\bm{M}_{C}(\bm{\Phi})\odot\bm{\Phi},\]

M_C∈R^{C×1×1}经频率-时间维全局池化后,经 Linear+SiLU 压缩至 C3=4 再经 Linear+Sigmoid 还原至 C 得到,逐通道加权。频率-时间注意力为:

\[\bm{A}=\bm{M}_{FT}(\bm{\Phi}^{\prime})\odot\bm{\Phi}^{\prime},\]\[\bm{M}_{FT}(\bm{\Phi}^{\prime})=[1-\alpha\cdot\rho(\bm{\Phi}^{\prime})\cdot\bm{G}(\bm{\Phi}^{\prime})],\]

其中 G∈R^{1×F×T}由 3 层线性(C→C4→C→1)得到,ρ∈R^{1×1×1}由 Linear+ 平均池化得到标量门控,α=0.3 为超参数。这种 1-α·ρ·G 的形式既保留了空间图 G 的细粒度,又用标量 ρ 做全局门控,避免过度抑制。

通道注意力 × 频率-时间注意力: 通道注意力负责在 C 个特征通道间做全局池化后加权,筛选哪些抽象语义通道更重要;频率-时间注意力负责在 F×T 平面上生成 1×F×T 的空间权重,决定在哪个频点和哪 1 帧上加强或抑制。二者顺序推断而非联合计算 3 维注意力的原因是直接计算 C×F×T 注意力开销过大,分离后先做通道筛选再做谱时精炼,既保留了自适应能力,又将计算量控制在可穿戴设备可接受范围内。

整个特征增强模块(feature augmentation module,FA)将 F-TDL 与 ConvAtt 重复 L=4 次,潜特征维度 C=16,C1=8,C2=24,C3=4,C4=4,编码器单层 RMB-Conv1D 无恒等分支,解码器为全连接层,整体参数仅 0.112M。

损失与训练如何同时约束保真度与可懂度?

ABSE-NET 的优化目标直接对应耳道内的最终波形\hat{u}与干净目标 u。损失函数为:

\[\mathcal{L}=-\text{SI-SDR}(\bm{\hat{u}},\bm{u})-\lambda\cdot{\text{STOI}}(\bm{\hat{u}},\bm{u}),\]

λ=10。SI-SDR 对全局增益不敏感,聚焦波形重构质量;STOI 最大化三分之 1 倍频带时域包络相关性,提升可懂度。训练时误差麦克风参与提供 d_L 与 g_L 监督,推理时不再需要。

训练配置对复现至关重要。STFT 采用 Hanning 窗,窗长 320 点、跳长 160 点,16 kHz 采样,对应 20 ms 窗与 10 ms 跳。BMVDR 的 SCM 经语音活动检测估计,ATF 可为理想或带到达方向误差的估计值。LNN 输入做帧级归一化以缓解能量波动。优化器为 Adam,初始学习率 3×10^-3,批量大小 6,训练 60 轮至损失平稳。FA 深度 L=4,核集合{1,3,5}为默认。

尺度不变信号失真比 × 短时客观可懂度: 尺度不变信号失真比(SI-SDR)衡量波形层面目标分量与残余失真的能量比且对全局增益不敏感,负责优化重构保真度;短时客观可懂度(STOI)衡量三分之 1 倍频带时域包络的相关性,负责优化人耳可懂度。二者加权求和的原因是仅优化 SI-SDR 可能得到数值高但听感差的信号,加入 STOI 后损失函数同时约束波形精度与感知相关性,权重 λ=10 即是在两者间做平衡。

因果性由 TDL 中的 C-RMB-Conv1D 保证,推理时多分支已融合为单核,理论上可实现流式处理,但论文未量化具体算法延迟与分块大小,这是从 FLOPs 到真实延迟的缺口。

数据如何合成,实验在什么条件下比较?

要评估开耳泄漏下的主动增强,必须构造可控的双耳泄漏数据。论文基于 Hearpiece 数据库的头相关脉冲响应(head-related impulse response,HRIR),该库提供 3 个外置麦克风与 1 个耳内误差麦克风的实测 HRIR。洁净语音来自 Librispeech,噪声来自 NOISEX-92。

样本通过卷积生成:将洁净与噪声分别与 HRIR 卷积得到双耳分量,再以 -5 dB 至 0 dB 随机信噪比混合,模拟日常助听器低信噪比场景。共生成 43200 个 2 秒样本约 24 小时,按 8:1:1 划分为训练、验证、测试且严格无重叠。HRIR 选取 24 个入射方向,12 个用于训练,12 个用于验证与测试,同子集内相邻方向间隔 15°,以检验空间泛化。所有信号下采样至 16 kHz。

评估框架覆盖 3 维:语音质量用 SI-SDR、感知语音质量评估(PESQ)、短时客观可懂度(STOI)、CSIG、CBAK、COVL;空间线索保持用耳间强度差误差 ΔILD 与耳间相位差误差 ΔIPD;效率用参数量与 FLOPs。基线分两类:模型驱动含 BMVDR(含泄漏与无泄漏两版本)与 FxMWF;数据驱动含 DeepANC 与 ASE-TM,均在同一合成集上重训练以适配 ABSE 任务。

根据论文正文整理的数据集与实验协议如下:

维度具体构成关键参数作用与说明
洁净语音源Librispeech16 kHz, 2 秒/样本提供目标语音多样性
噪声源NOISEX-92随机 SNR -5~0 dB模拟低信噪比挑战
空间脉冲响应Hearpiece HRIR3 外置 +1 耳内麦克风, 24 方向提供双耳与泄漏、次级路径的真实声学特性
方向划分12 训练 / 12 验证测试相邻 15°间隔检验空间泛化,非简单记忆
样本规模43200 样本约 24 小时8:1:1 划分, 无重叠保证训练与测试分离
时频配置Hanning 窗 320 点, 跳 160 点20 ms 窗, 10 ms 跳, 16 kHz决定算法延迟与频率分辨率
训练配置Adam 3e-3, batch 6, 60 轮, L=4, K={1,3,5}C=16, λ=10, α=0.3轻量设计的核心超参
评估指标SI-SDR↑ PESQ↑ STOI↑ CSIG↑ COVL↑ ΔILD↓ ΔIPD↓参数量↓ FLOPs↓质量、空间、效率 3 维权衡

该协议的优点是可控且可复现,代价是完全合成,未包含真实耳道个体差异、非线性次级路径、风噪与运动伪迹。

主比较要回答:在同一 Hearpiece 合成测试集(12 方向测试,SNR -5~0 dB)上,ABSE-NET 是否以显著更低的成本达到与最强数据驱动方法相当的语音质量,并优于传统自适应滤波?指标方向为参数量与 FLOPs 越低越好,SI-SDR、PESQ、STOI、CSIG、COVL 越高越好,ΔILD、ΔIPD 越低越好。

根据论文表 1 报告值整理的主结果如下:

比较条件参数量(M)FLOPs(G)SI-SDR(dB)↑PESQ↑STOI↑ΔILD↓结论支持
未处理---2.7811.6090.775-下界参照
BMVDR w/o AL (理想无泄漏)--5.2163.4370.9294.375闭耳理想上限
BMVDR (含泄漏)--0.8782.1960.8614.054泄漏导致性能崩塌
FxMWF (自适应滤波 ABSE)--3.7233.1810.9253.998线性滤波部分缓解
DeepANC (19.683M)19.6835.8172.6832.4490.8543.690大模型未适配助听器场景
ASE-TM (3.224M)3.22414.41710.4503.5730.9533.121最强 SI-SDR 基线
ABSE-NET (0.112M)0.1120.1849.8693.6260.9553.047轻量下 PESQ/STOI 最优

表中可见,泄漏使 BMVDR 的 SI-SDR 从 5.216 dB 跌至 0.878 dB,PESQ 从 3.437 降至 2.196,验证了开耳场景对传统 BSE 的破坏。ABSE-NET 以 0.112M 参数与 0.184G FLOPs 取得 9.869 dB SI-SDR、3.626 PESQ、0.955 STOI、4.655 CSIG、4.169 COVL,其中 PESQ、STOI、CSIG、COVL 为 7 种方法中最优,SI-SDR 次于 ASE-TM 的 10.450 dB 约 0.581 dB,但参数量降低约 28.8 倍、FLOPs 降低约 78.4 倍。空间线索上 ΔILD 3.047 为最小,ΔIPD 0.251 次于 ASE-TM 的 0.242。

未胜出项与边界同样重要。SI-SDR 未超越 ASE-TM 说明在纯波形失真比上更大容量的 Transformer-Mamba 仍有优势;DeepANC 虽参数量最大但 SI-SDR 仅 2.683 dB,说明直接迁移通用 ANC 框架到助听器泄漏任务并不有效。所有数字均来自同一合成管道与固定 STFT 配置,未报告多次随机种子方差与显著性检验,0.581 dB 的差距是否稳健尚不能判断,也不能推出在真实耳道与个体化次级路径上的表现。

为直观验证上述数值提升是否对应真实的谐波还原与噪声底抑制,论文在同一测试句上提供了波形与语谱图的可视化对比,适合在此观察时域包络与频域结构的联合变化。

看图路径: 1. 对比(a) 干净信号与(b) 未处理信号的波形振幅与频谱中黄色高能量噪声底;2. 观察(c)BMVDR w/o AL 虽恢复谐波但仍残留的水平条纹与能量空洞;3. 验证(d)ABSE-NET 在 0-1 kHz 低频段谐波连续性与时域包络对(a) 的还原度

原论文 Figure 3:Visualization of waveforms and spectrograms across different signal processing stages: (a) Clean,…

论文图 3。原论文 Figure 3::“Visualization of waveforms and spectrograms across different signal processing stages: (a) Clean, (b) Unprocessed, (c) BMVDR w/o AL, (d) ABSE-NET.”。

图 3 以四列呈现同一句语音的处理过程。每列上方为时域波形振幅±0.1,下方为 0-4 kHz 语谱图能量 -100 至 -60 dB。左侧纵轴为 Amplitude 与 Frequency(kHz),横轴为 Time(s),颜色条从黑到黄表示能量升高。

可见(a) 干净信号的谐波条纹清晰,(b) 未处理被黄色噪声底覆盖。(c)BMVDR w/o AL 虽恢复部分谐波但高频仍模糊。(d)ABSE-NET 的低频谐波连续性与波形包络最接近(a),背景更黑,说明其在抑制泄漏的同时未引入额外谱失真。不过该单例不能代表统计平均,仍需结合表 1 的平均指标来判断。

哪些模块是性能的支柱,哪些只是锦上添花?

消融要回答:F-TDL 与 ConvAtt 是否为必要,以及多尺度卷积与堆叠深度如何影响效率与质量。所有消融均在同一 Hearpiece 合成集上进行,指标同主实验。

根据论文表 2-4 报告值整理的关键消融如下:

消融条件控制变量参数量(M)FLOPs(G)SI-SDR(dB)PESQSTOI解释
K={5} 单核基线单一尺度0.1120.1847.9183.2830.932多尺度缺失导致粗细粒度不兼顾
K={1,1,1} 同构多分支相同感受野0.1110.1758.1343.4750.945增加分支但无尺度多样性
K={3,3,3} 同构多分支相同感受野0.1110.1798.9843.5570.947中等核优于小核但仍次优
K={1,3,5} 异构多分支多尺度融合0.1120.1849.8693.6260.955小核捕局部、大核捕上下文,最优
SpatialNet 替代 F-TDL架构替换0.1191.3138.8093.5970.951参数相近但 FLOPs 高 7.1 倍且性能低 1.06 dB
w/o FDL移除频率分支0.0050.1485.6102.5270.819频域建模为基础,移除跌幅最大
w/o TDL移除时间分支0.1060.0616.4723.1330.893时序精炼必要但次于频域
w/o F-TDL 仅留 ConvAtt移除全部谱时学习0.0010.0241.7692.1690.775注意力 alone 失效,甚至不如 FxMWF
CBAM 替代 ConvAtt注意力替换0.1100.1938.1283.1230.935ConvAtt 在更低 FLOPs 下更优
w/o ConvAtt移除注意力0.1100.1647.4412.9390.9280.02G 开销换来显著增益

净收益最公平的对比是 F-TDL vs SpatialNet:参数量 0.112M vs 0.119M 相近,FLOPs 0.184G vs 1.313G 低约 7.1 倍,SI-SDR 却高 1.06 dB,说明频率-时间解耦的轻量卷积比复杂注意力更适合可穿戴约束。

失败项同样具有教学意义。w/o F-TDL 仅保留 ConvAtt 时 SI-SDR 跌至 1.769 dB,低于线性 FxMWF 的 3.723 dB,构成负结果,证明注意力不能替代谱时特征提取;w/o FDL 跌至 5.610 dB,跌幅大于 w/o TDL 的 6.472 dB,说明频率依赖是后续时间精炼的基础。RMB-Conv1D 的异构核{1,3,5}优于所有同构多分支与单核,验证了多尺度必要性。

不能由该表推出的是:消融未报告多次运行方差,FLOPs 优势未转化为实测延迟,且 FA 深度 L 从 2 增至 5 时 SI-SDR 从 9.327 dB 升至 10.304 dB,PESQ 从 3.427 升至 3.708,参数仅从 0.108M 增至 0.113M,FLOPs 从 0.094G 增至 0.230G,说明深度与性能呈近线性关系,但最优 L=4 仍是经验权衡,未给出在真实硬件上的功耗曲线。

当声学传递函数不准时,轻量网络还能兜底吗?

实际中 ATF 不可得,论文通过到达方向(DOA)误差引入 ATF 失配来检验鲁棒性。DOA 误差设为 0°、7.5°、15°三档,ATF 通过查询个性化 HRTF 获得。

根据论文表 6 报告值整理的鲁棒性结果如下:

DOA 误差方法SI-SDR(dB)PESQSTOIΔILDΔIPD说明
BMVDR w/o AL5.2163.4370.9294.3750.391理想上限
BMVDR0.8782.1960.8614.0540.351泄漏已导致崩塌
ABSE-NET9.8693.6260.9553.0470.251轻量网络显著补偿
7.5°BMVDR w/o AL3.4283.2540.9174.4430.397失配开始显现
7.5°BMVDR0.1122.0170.8554.0940.351接近未处理
7.5°ABSE-NET8.2183.4550.9513.6470.299仍保持 8 dB 以上
15°BMVDR w/o AL1.6373.0770.8744.6880.415仅略优于未处理
15°BMVDR-1.0101.7470.8164.4200.383甚至劣于未处理
15°ABSE-NET6.4343.0010.9044.1910.3446 dB 以上提升,空间误差最小

随着 DOA 误差增大,所有方法性能下降,但 BMVDR 对失配极敏感:15°时 BMVDR w/o AL 仅 1.637 dB,BMVDR 甚至 -1.010 dB,说明约束失配会直接破坏波束形成器。ABSE-NET 在 15°时仍保持 6.434 dB SI-SDR 与 3.001 PESQ,且 ΔILD、ΔIPD 在所有误差下均为最小,说明 LNN 确实补偿了 BMVDR 的失真并抑制了泄漏。

一个反直觉细节是:BMVDR 在空间线索上反而优于 BMVDR w/o AL(ΔILD 4.054 vs 4.375),论文解释为泄漏中包含部分目标信号,客观上保留了原始空间信息。这提醒我们,SI-SDR 与空间误差并非单调相关,评价需多维。

该实验的边界在于:DOA 误差仅通过查询 HRTF 引入,未建模真实场景中 SCM 估计误差、次级路径非线性与个体耳道差异,且未报告在更大误差或动态声源下的表现。

在仿真之外,还有哪些关键验证缺席?

论文坦承未来工作需进一步提升效率并部署至实际开耳式助听器,暗示当前仍为仿真验证阶段。评估完全基于 Hearpiece 合成数据与固定 SNR -5 至 0 dB,未涵盖真实耳道个体差异、非线性次级路径、风噪与运动伪迹等实际扰动,外部有效性存疑。

技术严谨性上,空间线索误差公式写作 ΔIPD=1/TF Σ(arctan(|\hat{u}_L|/|\hat{u}_R|)-arctan(|u_L|/|u_R|)),即用幅度比的反正切而非相位差,若按此实现则指标不可信,论文亦被指出存在明显笔误,削弱了空间保持结论的可信度。

实验层面,未报告多次随机种子下的方差、置信区间或统计显著性检验,难以判断 9.869 dB 与 10.450 dB 等差距是否稳健。基线中 DeepANC 与 ASE-TM 为重训练适配,未说明是否同等调优且两者原始设计并非针对助听器场景,公平性需更细致消融。轻量优势以 FLOPs 衡量但未给出真实延迟、内存与功耗,且 STFT 320 点窗与 160 点跳对应的算法延迟未量化。训练批量大小 6 较小且未讨论归一化稳定性,损失中 STOI 的可微近似实现也未披露。

这些缺席并不否定级联思路的价值,但意味着从仿真到可佩戴设备的距离,仍需真实佩戴、主观听感与个体化耳道特性的检验来填补。

若要复现,需要哪些精确配置与缺失信息?

复现 ABSE-NET 需严格对齐数据生成与模型配置。数据侧:Librispeech 与 NOISEX-92 分别提供语音与噪声,Hearpiece 提供 HRIR,24 方向中 12 训练 12 测试,相邻 15°,43200 个 2 秒样本,SNR -5~0 dB,16 kHz,8:1:1 无重叠划分。时频侧:Hanning 窗 320 点、跳 160 点,帧级归一化,BMVDR 的 SCM 经 VAD 估计。模型侧:FA 重复 L=4,核集合{1,3,5},特征维 C=16、C1=8、C2=24、C3=4、C4=4,α=0.3,λ=10,编码器单层 RMB-Conv1D 无恒等分支,解码器全连接。训练侧:Adam 3e-3,batch 6,60 轮。代码已公开于https://github.com/Bream101/ABSE-NET

缺失信息同样关键:论文未说明 GPU 型号、数量与训练时长,未披露 STOI 可微近似的具体实现,未报告多次种子方差,模型权重与数据集获取链接、协议未提供,Demo 未提及,推理阶段的流式块大小与实测延迟未量化。这些缺口使得从论文到一键复现仍需额外摸索,尤其是在将 FLOPs 转化为真实助听器芯片上的功耗与延迟时。

对于刚入门的研究生,建议先以论文提供的 STFT 与 BMVDR 闭式解为起点,复现无泄漏与含泄漏的基线落差,再逐步加入 FDL 与 TDL,观察 w/o FDL 与 w/o TDL 的显著跌落,以建立对谱时解耦必要性的体感。

轻量主动增强为可穿戴助听器打开了哪条路径?

ABSE-NET 的核心判断是:开耳式的泄漏不应在电信号域后处理,而应在声学域主动对消;对消不应依赖耳内麦克风的实时反馈,而应通过监督学习隐式估计-d_L/g_L。BMVDR 提供可解释的空间约束与粗估计,LNN 负责非线性残差,二者级联后以 0.112M 参数实现了在合成数据上 PESQ 3.626、STOI 0.955 的最优感知质量,并在 DOA 失配 15°时仍保持 6.434 dB SI-SDR,显示出对模型误差的补偿能力。

其方法论启示在于轻量设计的系统性:用 RMB-Conv1D 的多分支训练单核推理、用 FDL/TDL 的维度解耦替代注意力、用通道与谱时分离的 ConvAtt 替代 3 维注意力,每一步都在保持建模能力的同时削减 FLOPs,最终比 ASE-TM 降低 28.8 倍参数与 78.4 倍 FLOPs。这种为资源受限设备做减法的思路,比单纯追求 SOTA 数字更具工程价值。

收束时需回到边界:所有优势目前仅在受控合成声学环境中验证,真实耳道的个体化、非线性与动态性尚未检验,空间误差公式的笔误也提醒我们对指标实现保持审慎。下一步最有价值的检验不是在更大合成集上刷分,而是在真实佩戴、主观听感与芯片级功耗测量中,验证这条无需耳内麦克风的主动增强路径是否真的舒适、可部署且可信。

📎 论文与评分元数据

标签:#语音增强 | #CNN | #主动降噪 | #助听器 | #模型压缩

7.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #CNN | #主动降噪 | #助听器 | arxiv

⚖️ 评分依据与证据(展开查看)

逐维得分、全文证据与扣分边界
  • 创新性 (1.4/2):提出 BMVDR 粗增强级联 LNN 联合实现泄漏对消与失真补偿,推理阶段无需耳内误差麦克风,F-TDL 解耦频率与时间依赖并引入异构核 {1,3,5} 的 RMB-Conv1D 与 ConvAtt 轻量注意力,属于有证据支撑的系统级组合创新。

  • 技术严谨性 (1.0/1.5):ΔIPD 公式写作 arctan(|u_L|/|u_R|) 的幅度比而非相位差,存在明显推导笔误影响指标可信度;承认 ATF 不可得与 DOA 误差导致约束失配,但未给出误差界或鲁棒性证明。

  • 实验充分性 (1.0/1.5):覆盖 BMVDR、FxMWF、DeepANC、ASE-TM 4 类基线及 F-TDL 与 ConvAtt 直接消融,SI-SDR 9.869 dB 与 PESQ 3.626 为最优;但该结论仅在单一 Hearpiece 合成管道与 -5 dB 至 0 dB 固定配置下测试,未报告方差、置信区间与显著性检验,无跨数据集与真实耳道验证。

  • 清晰度 (0.7/1):级联流程与 F-TDL、ConvAtt 结构描述完整,但空间线索公式符号混淆且未解释 STOI 可微实现,图表仅展示合成集结果,真实延迟与流式块大小未量化,影响可读性。

  • 影响力 (0.9/1.5):面向开耳式助听器堵塞效应与泄漏污染这一明确音频痛点,以 0.112M 参数实现 3.626 PESQ 与 0.955 STOI 的可部署路径;但验证局限于 24 小时合成数据,无真实佩戴与主观听感,领域外溢有限。

  • 开源 (1.0/1.5):代码已在 https://github.com/Bream101/ABSE-NET 公开,满足部分核心产物开放;但模型权重未提及,Librispeech、NOISEX-92、Hearpiece 均未提供获取链接与协议,Demo 未提及,文档不完整。

  • 可复现性 (0.3/0.5):已披露 STFT Hanning 窗 320 点跳 160 点、16 kHz、L=4、核集合 {1,3,5}、C=16 等维度及 alpha 0.3、lambda 10、Adam 3e-3、batch 6、60 轮等训练配置;但硬件型号、训练时长、STOI 可微近似与多次种子方差缺失。

  • 工程/实践价值 (1.2/1.5):以 0.112M 参数与 0.184G FLOPs 取得 9.869 dB SI-SDR,较 ASE-TM 降低约 28.8 倍参数与 78.4 倍 FLOPs 且保持 PESQ 最优,C-RMB-Conv1D 保证因果性;但仅以 FLOPs 为代理,未报告真实延迟、内存与功耗的部署测量。


← 返回 2026-09-02 语音/音乐/音频论文速递