📄 CoFi-Lite: Pushing the Limits of Ultra-Lightweight Speech Enhancement

标签:#语音增强 #CNN #模型压缩 #高效推理 #流式处理

7.3/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5

7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音增强 | #CNN | #模型压缩 #高效推理 | arxiv

👥 作者与机构

  • 第一作者:Leyan Yang(南京大学现代声学实验室,NJU-Horizon智能音频实验室)
  • 通讯作者:Jing Lu(南京大学现代声学实验室,NJU-Horizon智能音频实验室)
  • 作者列表:Leyan Yang(南京大学现代声学实验室,NJU-Horizon智能音频实验室)、Dahan Wang(南京大学现代声学实验室,NJU-Horizon智能音频实验室)、Xiaobin Rong(南京大学现代声学实验室,NJU-Horizon智能音频实验室)、Jiadong Zhao(南京大学现代声学实验室,NJU-Horizon智能音频实验室)、Jing Lu(南京大学现代声学实验室,NJU-Horizon智能音频实验室)

💡 毒舌点评

本文在极端计算约束下将语音增强性能推向新高,展示了“螺蛳壳里做道场”的精细工程能力,其粗细粒度解耦与跨路径融合的设计思路清晰且有效。然而,方法本质上是已有模块(MB block, CRN)的精心组合与压缩,创新更多体现在架构搜索与权衡上;且仅用demo页面展示结果,未提供代码和模型,使论文的可复用性和后续影响力大打折扣。

📌 核心摘要

本文针对超轻量级语音增强模型在边缘设备上的部署需求,旨在进一步降低计算复杂度同时保持性能。作者提出CoFi-Lite模型,其核心是将频谱建模解耦为并行的粗粒度和细粒度两条路径:粗路径处理全频带包络,细路径专注于低频细节恢复。两条路径通过一个新颖的跨路径融合(CPF)模块进行交互。该方法的新颖之处在于明确针对低频建模能力不足的问题进行架构设计,通过并行互补路径和显式交互来协同提升。实验结果表明,基础版CoFi-Lite仅需12.87M MACs/s和83.12k参数,在PESQ指标上以2.16分超越了需要31.97M MACs/s的Level II基线模型GTCRN(2.07分)。其放大版本在32.91M MACs/s的复杂度下,性能与需要40.80M MACs/s的AdaptCRN相当。该工作的实际意义在于为极端资源受限的设备提供了更高效的语音增强方案。主要局限性在于仅使用带噪相位进行重建,限制了理论性能上限;同时,论文仅提供了在线演示,未开源代码或模型。

🔗 开源详情

  • 代码:论文中未提及代码链接
  • 模型权重:论文中未提及
  • 数据集:论文中未提及具体获取链接或开源协议。文中提到使用了“DNS3 dataset”、“Mandarin corpus from DiDiSpeech”以及“official DNS Challenge 2020 test set”。
  • Demo:https://acceleration123.github.io/CoFiLite-demo/
  • 复现材料:论文中未提及提供检查点或代码。但论文中详细说明了训练配置和参数设置,可用于复现。关键信息包括:
    • STFT参数: 32 ms平方根汉宁窗,16 ms跳跃长度,FFT大小512。
    • 训练: 使用Adam优化器,线性预热后接余弦退火。训练200个epoch,每批次8个样本,学习率从\(10^{-6}\)线性增加到\(10^{-3}\)(前25,000次迭代),然后余弦衰减。
    • 数据集构建: 生成了72,000个10秒的噪声-干净语音对用于训练(共200小时),以及各1000个对用于验证和测试。
    • 模型细节: 提供了CoFi-Lite及其放大版本(CoFi-Lite (Large))的详细架构参数,如压缩比、通道数、RNN隐层维度等。
  • 论文中引用的开源项目:

🏗️ 方法概述和架构

CoFi-Lite是一个端到端的频域语音增强模型,其核心流程为:输入带噪语音信号,经STFT转换为复数频谱后,通过两条并行的编码器-解码器路径(粗路径和细路径)分别提取特征,经跨路径融合(CPF)模块交互后,生成两个理想比掩码(IRM),最终与输入幅度谱相乘并结合带噪相位重建语音。

下图展示了CoFi-Lite模型的整体架构,清晰呈现了粗路径、细路径以及它们之间的跨路径融合(CPF)模块。

Figure 1: (a) The overall diagram of the proposed CoFi-Lite, where Re\u200b(⋅)\\text{Re}(\\cdot) and Im\u200b(⋅)\\text{Im}(\\cdot) denote the operations of extracting real and imaginary parts, respectively. (b) The details of the MB block. (c) The detail

图中详细描绘了从STFT输入到iSTFT输出的完整数据流,并可视化了MB块和CPF模块的内部结构,有助于理解模型的并行解耦设计。

1. 粗路径(Coarse Path):负责建模全频带的频谱包络。输入为幅度谱的对数值,但先通过带宽合并(BM)模块和子带特征提取(SFE)模块进行压缩和初步特征提取。BM模块采用等效矩形带宽(ERB)滤波器组压缩截止频率\(f_{\text{low}}\)以上的高频信息。SFE模块用于提升频谱利用效率。编码器由三个MB(Mobile Block)块堆叠而成,每个MB块包含点卷积(PW-Conv)、深度可分离卷积(DW-Conv)和另一个PW-Conv,并集成时域循环注意力(TRA)模块以替代原始的因果时频注意力(cTFA)模块,以简化结构并提升效率。MB块配置保持了批归一化(BN)和仿射PReLU(APReLU)。编码器通过跨步卷积逐步降低频率分辨率,总压缩比为16。解码器结构对称,并利用跳跃连接与编码器对应层相连。输出经sigmoid激活后,通过带宽分裂(BS)模块(BM的逆操作)生成覆盖全频带的掩码 \(\mathbf{M}_{\text{c}}\)。

2. 细路径(Fine Path):专注于恢复低频(\(\leq f_{\text{low}}\))的精细细节。输入为低频带的幅度、实部和虚部,均经过动态范围压缩(经验指数0.7)和SFE处理,以保留更多对低频感知重要的相位信息。其编码器仅包含一个MB块,采用(1,2)的跨步沿频率维度下采样,以在保持较高频率分辨率的同时控制计算量。解码器结构对称,直接输出经sigmoid激活的低频区域掩码 \(\mathbf{M}_{\text{f}}\)。

3. 跨路径融合(CPF)模块:位于两条路径的瓶颈层之后,是实现互补增强的关键。它将两条路径编码器输出的中间特征 \(\mathbf{E}_{\text{c}}\) 和 \(\mathbf{E}_{\text{f}}\) 扁平化并拼接,然后通过一个全连接(FC)层压缩至低维潜在空间(维度为\(H\))。压缩后的特征经过层归一化(LN)、ELU激活和一个分组GRU(2组)处理,以捕捉融合特征的时序模式。随后再用一个FC层恢复至原始维度,并分离、重塑回原始形状,与原始输入相加(跳跃连接)后,分别送回各自的解码器路径,得到增强特征 \(\mathbf{D}_{\text{c}}\) 和 \(\mathbf{D}_{\text{f}}\)。这一设计允许两条路径在瓶颈处进行高效的信息交换与协同增强。

4. 最终增强:模型预测的 \(\mathbf{M}_{\text{c}}\) 和 \(\mathbf{M}_{\text{f}}\) 被依次应用于输入幅度谱:对于低频区域(频率索引 \(f \leq f_{\text{low}}\)),使用 \(\mathbf{M}_{\text{c}}\) 和 \(\mathbf{M}_{\text{f}}\) 进行双重掩模;对于高频区域,仅使用 \(\mathbf{M}_{\text{c}}\)。增强后的幅度谱与带噪相位结合,通过iSTFT得到时域信号。模型采用与GTCRN相同的损失函数进行训练,目标为包含早期混响(100ms内)的语音。

💡 核心创新点

  1. 粗-细粒度并行解耦架构:针对超轻量级模型在低频建模能力不足的痛点,将单路径CRN拆分为专注于全频带包络的粗路径和专注于低频细节的细路径。这解决了直接压缩整个网络会导致低频性能快速下降的问题。实验证明,这种解耦设计(ID3)相比仅使用粗路径(ID1)或仅使用细路径(ID2)能取得更优的PESQ和SI-SNR。
  2. 跨路径融合(CPF)模块:在两条并行路径的瓶颈层之间引入显式的特征交互机制,通过压缩、循环处理、恢复的流程,实现粗细粒度信息的互补增强。这是区别于简单并行或级联结构的关键。消融实验(ID5 vs ID3)显示,引入CPF后PESQ从2.02大幅提升至2.16,证明了交互的有效性。
  3. 针对极低复杂度的精细设计:在组件选择(如用TRA替代cTFA)和路径设计上(细路径仅用一个MB块,高频率分辨率)都进行了面向效率的权衡。最终模型在12.87M MACs/s的极低复杂度下,性能超越了复杂度更高的Level II基线GTCRN,实现了计算效率的新突破。
  4. 细路径引入相位信息:不同于粗路径仅使用幅度谱,细路径的输入包含了低频段的归一化实部和虚部,以尝试捕获对低频感知重要的相位细节,这符合低频区域对相位更敏感的声学特性。

📊 实验结果

实验在DNS3和DNS Challenge 2020数据集上进行,对比了多个超轻量级基线模型。

1. 主实验(DNS3测试集)

  • Level I(<20M MACs/s):CoFi-Lite(12.87M MACs/s)在PESQ(2.16)、ESTOI(76.10)、SI-SNR(11.80)和DNSMOS P.835 OVRL(3.05)上均显著优于所有缩放后的基线模型,也优于计算量更高的Level II基线GTCRN(31.97M MACs/s, PESQ 2.07)。
  • Level II(>30M MACs/s):CoFi-Lite Large(32.91M MACs/s)的性能(PESQ 2.30, OVRL 3.09)与当前SOTA AdaptCRN(40.80M MACs/s, PESQ 2.30, OVRL 3.08)相当,但计算成本降低了19.34%。

完整的DNS3测试集性能对比(表I)

ModelsParams (k)MACs/s (M)RTFPESQESTOI (×100)SI-SNRDNSMOS P.808DNSMOS P.835 OVRLSIGBAK
Noisy---1.4066.905.612.821.632.051.86
Level I: Below 20M MACs/s
GTCRN (Small)7.9113.630.0401.8872.1810.073.382.532.883.76
LiSenNet (Small)12.4615.570.0311.9472.7410.493.362.582.933.80
UL-UNAS (Small)56.4313.630.0542.0574.8711.163.472.602.943.81
AdaptCRN (Small)34.9812.970.0472.0675.1511.193.502.652.993.85
CoFi-Lite83.1212.870.0332.1676.1011.803.532.703.053.85
Level II: Over 30M MACs/s
GTCRN23.6731.970.0502.0775.1111.303.482.632.983.81
LiSenNet36.7855.770.0352.1776.1911.743.532.693.033.85
UL-UNAS171.3334.910.0662.2577.6912.073.552.693.013.86
AdaptCRN134.5140.800.0532.3078.1512.353.592.753.083.88
CoFi-Lite (Large)221.3132.910.0362.3077.9412.433.562.753.093.88

2. DNS Challenge 2020测试集结果

ModelsNo ReverbWith Reverb
OVRLSIG
Noisy2.483.39
Level I: Below 20M MACs/s
GTCRN (Small)2.993.31
LiSenNet (Small)3.003.32
UL-UNAS (Small)3.083.36
AdaptCRN (Small)3.113.39
CoFi-Lite3.153.43
Level II: Over 30M MACs/s
GTCRN3.093.38
LiSenNet3.093.37
UL-UNAS3.133.40
AdaptCRN3.203.45
CoFi-Lite (Large)3.193.44

3. 关键消融实验(DNS3测试集)

  • 路径与CPF效果:单粗路径(ID1)PESQ=1.97, 单细路径(ID2)PESQ=1.53, 双路径无CPF(ID3)PESQ=2.02, 双路径有CPF(ID5)PESQ=2.16。CPF带来了显著的+0.14 PESQ增益。
  • 细路径压缩比(\(R_f\)):当\(R_f\)从2增加到4和8时,PESQ从2.16分别下降到2.12和2.09,表明深压缩会严重损害细路径的低频建模能力。
  • 截止频率(\(f_{low}\)):\(f_{low}\)从17增加到65(2kHz)时,PESQ从2.08提升到2.16;进一步增加到97时,PESQ为2.15,提升不明显,表明2kHz是捕获主要语音低频细节的有效分界点。

完整的消融实验结果(表III)

IDs\(R_c\)\(R_f\)\(f_{low}\)CPFParams (k)MACs/s (M)PESQESTOI (×100)SI-SNR
116-6519.7112.371.9773.7310.68
2-2659.2412.051.5370.148.41
31626521.2312.242.0274.0610.81
41626590.8013.442.0674.9811.20
51626583.1212.872.1676.1011.80
61646571.1811.892.1275.7211.55
71686566.2011.462.0975.3111.41
8826595.0613.842.1676.1011.73
93226578.1412.442.1476.0111.77
101621758.7911.512.0875.3011.39
111623366.9011.902.1175.6911.58
121629799.3514.092.1576.2511.72

🔬 细节详述

  • 训练数据:基于DNS3数据集,并加入DiDiSpeech的普通话语音。生成200小时(72000个10秒片段)的训练数据,SNR在-5至15 dB间均匀采样,并使用房间脉冲响应(RIR)进行卷积。训练目标为包含早期混响(100ms内)的语音。
  • 损失函数:论文未具体说明,仅注明“采用与[23]相同的损失函数”。
  • 训练策略:使用Adam优化器,初始25000次迭代学习率从\(10^{-6}\)线性预热到\(10^{-3}\),随后余弦退火至250000次迭代。总训练200个epoch,每epoch 1250次迭代,批大小8。
  • 关键超参数
    • STFT:32ms平方根汉宁窗,16ms帧移,512点FFT。
    • 截止频率\(f_{low}\) = 65(对应2kHz)。
    • BM模块:保留前65个频带,将192个高频带压缩为64个。
    • MB块输出通道数:均为6(基础版)。
    • CPF隐藏维度\(H\):76(基础版),102(Large版)。
    • 分组GRU:2组。
  • 训练硬件:未说明。
  • 推理细节:使用ONNX Runtime在Intel i5-14600KF CPU上测量RTF(流式推理,零算法延迟)。不使用未来帧。

⚖️ 评分理由

  • 创新性 (1.5/2):论文针对超轻量级语音增强中低频建模不足的瓶颈,提出了粗-细粒度并行解耦架构和跨路径融合模块,设计思路清晰有效,但核心组件(如MB块、CRN框架)均非原创,创新主要体现在已有模块的精心组合与压缩上,缺乏全新计算原语。

  • 技术严谨性 (1.3/1.5):方法描述清晰,架构图详细,数学公式正确,实验设计合理且通过消融研究验证各组件有效性,但未深入讨论使用带噪相位重建对理论性能上限的具体影响,存在一定的技术局限性。

  • 实验充分性 (1.2/1.5):实验对比了主流超轻量级基线及其缩放变体,在多个指标和数据集(DNS3、DNS2020)上验证性能,包含关键设计的消融实验,但缺少统计显著性检验,且未在更多样化数据集上验证泛化性。

  • 清晰度 (0.9/1):论文结构标准,从引言到方法、实验、结论逻辑清晰,图表对理解模型架构帮助大,术语解释清楚,但部分公式的解释可以更详尽。

  • 影响力 (0.8/1.5):本工作直接针对语音增强的边缘部署实际痛点,提出了在极端计算约束下保持高性能的有效方案,对轻量级模型发展有明确价值,但专注于超轻量级细分方向,性能提升主要在效率权衡上,对整个领域广泛影响力有限。

  • 开源 (0.2/1.5):论文目前只提供可访问的在线演示页面,未发布核心代码、模型权重或训练数据。

  • 可复现性 (0.3/0.5):论文提供了详细的模型架构描述、超参数设置和训练流程,这些信息足以复现模型架构和训练过程,但损失函数的具体形式未给出需查阅参考文献,且训练硬件未说明。

  • 工程/实践价值 (1.1/1.5):论文具有明确的工程导向,所有设计围绕极低MACs和参数展开,提供了详细的复杂度分析(包括每模块分解)和RTF测试,直接面向边缘设备部署,但未提供在实际移动或嵌入式设备上的部署测试或能耗分析。

🚨 局限与问题

论文明确承认的局限

  1. 当前采用仅使用带噪相位重建的策略,这为模型性能设置了理论上限。作者表示这是权衡计算复杂度后的选择。
  2. 性能评估基于桌面CPU的RTF,可能无法直接反映在目标边缘平台(如ARM Cortex-M, DSP)上的实际表现,作者将此列为未来工作。

审稿人发现的潜在问题

  1. 创新本质:虽然设计有效,但本质上是CRN框架下对已有组件的精心压缩和组合,而非提出全新的计算原语或范式。其成功更依赖于细致的架构搜索和权衡,创新深度有一定局限。
  2. 开源缺失:论文结论部分强调了方法的优越性和潜力,但未提供代码和模型,使得声明无法被快速验证和采纳,与顶会鼓励开放科学的趋势不符。
  3. 性能天花板:在极低复杂度约束下,不进行相位恢复意味着模型的性能存在明确的理论天花板。论文未深入探讨在这一约束下进一步提升的可能瓶颈是什么。
  4. 数据集单一性:所有实验主要基于DNS3数据集及其衍生测试集,尽管这是标准做法,但缺乏在其他公开或真实场景噪声数据集上的验证,可能影响对其泛化能力的完整评估。

← 返回 2026-07-14 语音/音乐/音频论文速递