英文题目:DroFiT: A Lightweight Band-Fused Frequency Attention Toward Real-Time UAV Speech Enhancement

会议身份:conference:interspeech:2026:conference-paper-id:lee26n_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#Transformer #高效推理 #单通道 #流式处理 #语音增强

评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jeongmin Lee:机构信息未能从会议 PDF 纯文本可靠映射
  • Chanhong Jeon:机构信息未能从会议 PDF 纯文本可靠映射
  • Hyungjoo Seo:机构信息未能从会议 PDF 纯文本可靠映射
  • Kyuhong Shim:机构信息未能从会议 PDF 纯文本可靠映射
  • Taewook Kang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

单通道无人机自我噪声下语音增强需在极低信噪比下从宽带周期性螺旋桨与电机谐波中恢复目标语音的幅度与相位,谐波基频随转速缓慢漂移,通用降噪难以兼顾质量与端侧资源。该工作先用全频带与子频带双路径编码器以不同压缩比分工提取全局谱上下文与低频细节,前置时间卷积网络承接双路径特征以稳定慢变谐波与平稳结构。随后频率维Transformer对拼接后的全/子带令牌做跨路径联合注意力融合,使全局上下文与细粒度低频细节在共享注意力空间互补,相对单带与循环基线减少跨带干扰。融合特征经解码重建频谱并由后置时间卷积网络在时域精炼动态,再经掩码生成块估计复数掩码与含噪短时傅里叶变换复乘并逆变换重构波形。在VoiceBank-DEMAND混合DJI Flip悬停噪声的模拟测试集下,DroFiT(w/o Post-TCN)的SI-SDR为9.54,高于DCCRN-E的SI-SDR9.51。该结论适用边界受限于单机型悬停噪声、固定pyroomacoustics仿真与约1300条远场扬声器回放真实录音,尚未验证多机型、运动、风噪与大混响外推。模型以168k参数实现帧级流式推理,计算量较DCU-net与SMoLnet-T降低9–26倍,但原文未披露训练成本所需的硬件与时长细节。

🔗 开源与复现资源

  • 演示资源:https://ml-sp.github.io/DroFiT/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

无人机上听清人声难在哪里?

输入是单麦克风采集的含噪语音,目标是从强无人机自噪声中恢复可懂的干净语音。必须保留的信息包括噪声的宽带周期谐波特性、极低信噪比条件、单通道无额外硬件的约束,以及低功耗平台的存储与功耗预算。输出是增强后的时域波形,可供后续听音或识别使用。

无人机螺旋桨与电机产生的自噪声不是普通的背景 babble 噪声,它宽带、周期、谐波强,且声源距离麦克风很近,因此在负几十分贝信噪比下会完全淹没语音谱结构。论文把任务限定为单通道增强,原因是不想增加阵列麦克风硬件。对刚入门的研究生,关键动作是先理解信噪比的含义:负值越大表示噪声越强,负 30 分贝意味着语音能量远小于噪声。

部署约束是本文的另一半问题。作者指出实用系统的存储预算常在几百 KB 量级,单次乘加、片上静态存储访问与片外动态存储访问的能耗比约为 1 比 6 比 200。这意味着参数多不仅是模型大,还会引发频繁的片外搬运,直接增加功耗。因此轻量不仅指参数少,还包括运行时峰值内存与乘加数。论文演示页当前可用,已公开音频示例,地址为官方演示链接,可对照听感理解极低信噪比的含义。

已有哪些路线,为什么还不够省?

同输入同目标的路线包括时域端到端增强与时频域掩码增强。时频域早期多用幅度掩码,近年转向复数域同时估计实部与虚部,以利用相位重建波形。论文引用深复数卷积循环网络与深复数 U 型网络作为复数建模代表,引用双信号变换长短期记忆网络作为流式代表。

无人机专用路线包括面向无人机的深复数 U 型网络评估,以及为无人机噪声设计的轻量复数谱映射方法 SMoLnet-T。论文报告前者质量较好但计算与存储开销大,后者参数少但采用分块处理,需要存储大特征图,容易溢出片上存储并触发昂贵的片外访问。流式模型虽能降低延迟与激活存储,但参数仍超出片上容量,导致权重需要走片外。

教学上要区分两类省:参数省与激活省。参数省看权重能否放进片上,激活省看推理时中间特征峰值是否小。SMoLnet-T 属于参数省但激活不省,DroFiT 希望两者都省。相关工作的对照条件在原文中是统一重训练,而非直接引用旧论文数字,这为后文公平比较打下基础。

论文把问题切成哪两半来解?

论文把增强拆成时间建模与频率建模两半。时间半处理无人机缓慢漂移的准平稳谐波,频率半处理语音主导的精细结构。这样的切分对应两个观察:无人机基频随转速缓慢变化,远慢于语音发音动态;语音可懂度线索集中在低频,需要非均匀的精细保留。

举例说明:比如一段 5 秒 16 kHz 语音,若用 1024 点傅里叶变换与 512 点跳长,会得到约数百帧、513 个频点的谱图。无人机噪声在该谱图上表现为随时间缓慢起伏的横向谐波条纹,语音则表现为快速变化的竖向音节块。前者适合用时间卷积平滑跟踪,后者适合用频率注意力恢复。例子仅为帮助理解表示形态,不代表论文的某一样本数值。

因此方法全景是先压缩频率轴降低计算,再用时间模块稳定噪声,再用频率模块恢复语音,最后用时间模块精修并生成复数掩码。增量推理要求模型支持逐帧流式,不能依赖未来长上下文 1 次看完全句。

DroFiT 让一个样本走完需要经过什么?

一个样本的旅程从含噪波形的短时傅里叶变换开始,得到实部与虚部 2 通道谱。编码器同时走两条路:全带路径用 1 维卷积沿时间独立处理、沿频率压缩,并用全局卷积捕捉长程谱依赖;子带路径把频谱切成 5 组做幅度表示并分组压缩。两路特征经预置时间模块与频率 Transformer 融合,再经解码器与后置时间模块,最后生成复数掩码并与输入谱复数相乘,经逆变换得到增强波形。

下图是论文给出的系统意图:无人机噪声与干净语音混合成未知含噪输入,经单麦克风进入 DroFiT 后输出干净波形,目标是实现可靠的无人机听觉。读图时注意输入输出都是波形示意,不是具体信噪比曲线。

看图路径: 1. 先找到左侧无人机红色噪声波形与下方蓝色干净语音波形汇合成黑色含噪波形的箭头;2. 再看中间麦克风符号进入 DroFiT 方框后输出右侧蓝色干净波形的路径;3. 确认外层虚线框标注的 Drone noise Reduction system 包含哪些模块;4. 对比输入端问号标记的未知混合与输出端感叹号标记的恢复意图

原论文 Figure 1:DroFiT suppresses UAV ego-noise and restores clean, intelligible speech in order to enable…

论文图 1。原论文 Figure 1:“DroFiT suppresses UAV ego-noise and restores clean, intelligible speech in order to enable reliable UAV audition.”。

该示意图显示左侧红色波形代表无人机噪声,蓝色波形代表干净语音,二者相加形成黑色含噪波形,右侧蓝色波形代表恢复后的输出。虚线框标出降噪系统边界,DroFiT 位于麦克风之后。这种画法把研究范围限定为单通道后处理,不包含波束形成或多麦克风定位。

全带路径 × 子带路径: 全带路径负责保留整体频谱上下文,用较大的频率压缩比和全局卷积看清谐波与宽带噪声的全局结构;子带路径负责低频细节,将 513 个频点按 32-32-64-128-257 做梅尔式分组并分别压缩,保留语音能量集中的低频线索。二者搭配的理由是单一压缩比难以兼顾全局抑制与细节保留,组合意义在于把两种不同压缩比得到的令牌拼接到同一个频率注意力空间,让网络在 1 次自注意力中同时做分支内依赖与跨分支互补。

解码侧用可学习的跳跃连接融合编码器表示与隐层模块,区别于固定相加。子带解码对每组用全连接层恢复原始特征尺寸。全带解码重建全局结构,子带解码恢复低频细节,二者在掩码生成前拼接而非直接相加,再经 2 维卷积降到实虚 2 通道。

编码器与频率注意力如何分工?

全带编码器由卷积归一化激活块构成,频率维从 513 经 256 到 128 再到 64,通道数从 2 到 4 到 16 再到 32。操作沿时间轴独立,沿频率轴压缩,最后加全局卷积。子带编码器把 513 个频点按 32、32、64、128、257 切分,遵循类似梅尔的低频密高频疏分配,每组用轻量 1 维卷积压缩,抽取倍数分别为 8、8、6、5、5。

频率维 Transformer 只沿频率轴做多头自注意力,因此对输入时长保持线性复杂度。它加入可学习的频率位置编码,对拼接后的全带与子带令牌做 1 次自注意力,同时捕捉分支内依赖与跨分支交互。为减少分支间干扰,全带与子带在前馈网络部分结构分离,各自用由点卷积与深度卷积组成的卷积前馈网络独立处理。DroFiT-Lite 进一步把注意力换成线性注意力,以更少的计算换取接近的性能。

看图路径: 1. 先沿顶部(a) 总览从左侧 STFT 经全带编码器与子带编码器到中间 Pre-T 与 Freq Transformer 的走向;2. 再看(b) 行中 Pre-TCN、频率 Transformer、Post-TCN 与 Mask Gen 四个子块的输入输出标注;3. 确认(c) 子带路径中每组共享的卷积压缩与全连接恢复结构;4. 观察跳跃连接与 Post-TCN 蓝色回路汇入 Mask Gen 的位置

原论文 Figure 2:DroFiT architecture: (a) overview, (b) Pre-TCN, Transformer block, Post-TCN and Mask Gen, (c)…

论文图 2。原论文 Figure 2:“DroFiT architecture: (a) overview, (b) Pre-TCN, Transformer block, Post-TCN and Mask Gen, (c) sub-band block.”。

该架构图上半为总览,下半从左到右依次为预置时间模块、频率 Transformer、后置时间模块、掩码生成与子带路径细节。可见全带跳跃连接用多层 1 维卷积实现,子带跳跃用点卷积加激活实现,中间粉色与紫色块为时间与频率建模核心,右侧绿色块将输入谱与后置时间输出汇合生成掩码。子带小图显示每组共享压缩与恢复结构,共 5 组并行。

预置时间卷积网络 × 频率维 Transformer: 预置时间卷积网络即 Pre-TCN 负责在时间轴上稳定无人机准平稳谐波干扰,因为螺旋桨转速变化慢于语音 articulator 动态,先把缓慢漂移的噪声成分对齐;频率维 Transformer 即 Freq-Wise Transformer 负责只沿频率轴做多头自注意力,聚焦非平稳语音线索。二者搭配的原因是若直接对原始含噪谱做频率注意力,强谐波会干扰语音结构判断,组合意义在于先做时间域的噪声结构化,再做频率域的语音恢复,分工后注意力更有效。

预置时间模块在全带用时间卷积网络精修时间特征,在子带用通道线性投影保持效率,最后用频率线性层做带间整合。原文的动机是让后续频率注意力更专注于非平稳语音线索。后置时间模块则在频率建模完成后,用平均池化压缩全带能量再送入时间卷积,侧重时间尺度建模而非重复刻画噪声,起到轻量精修作用。

掩码生成与损失如何对应到重建目标?

掩码生成块不直接相加全带与子带输出,而是将二者拼接后经 2 维卷积把通道降到 2,对应实部与虚部,再经双曲正切激活并与后置时间输出相乘,得到最终复数掩码。设含噪谱为 X,掩码为 M,增强谱为 S_hat,则按复数乘法有 S_hat 等于 M 与 X 的逐点复数乘积,再经逆短时傅里叶变换得到波形。

损失由三项加权组成:幅度项惩罚对数幅度谱差异,复数项惩罚复数谱均方误差,时域项为负尺度不变信噪比。公式权重为贝塔平衡频域两项,阿尔法加权时域项,论文取学习率 0.0001,阿尔法 0.2,贝塔 0.8。幅度项用对数域 L1,复数项用 L2,时域项通过投影分解目标与噪声分量计算。

复数掩码 × 逆短时傅里叶变换: 复数掩码负责同时给出实部和虚部的增益,保留幅度和相位信息以重建波形;逆短时傅里叶变换负责把增强后的复数谱变回时域波形。二者搭配的原因是无人机噪声具有周期谐波特性,只做幅度掩码会丢失相位导致的重建失真,组合意义在于用复数乘法将掩码作用于含噪输入谱,再经逆变换得到可听语音。

对初学者,记住监督来源都是配对的干净语音:频域项看谱图像不像,时域项看波形信噪比高不高。双精度训练是论文为稳定训练采用的格式,推理时仍用单精度报告结果,避免把训练精度误认为部署精度。

数据如何构造,模型如何训练与推理?

训练数据用 DJI Flip 无人机悬停实录噪声,在声学仿真工具中与 VoiceBank-DEMAND 干净语音混合。所有语音固定 5 秒、16 kHz 采样,1024 点傅里叶变换、512 点跳长。训练与验证各 7200 与 800 条,混合信噪比为负 5 至负 25 分贝,测试 810 条并额外加入负 30 分贝只用于测试。真实录制测试用悬停无人机加远处扬声器播放语音,男女声各约 650 秒,按 1 秒步长切分得到 1300 条真实样本。

优化用 Adam,验证集决定训练轮数与超参数以防过拟合。为公平稳定,所有模型含基线都用双精度重训练,再统一用单精度推理评估。基线包括 DCU-net、SMoLnet-T、DTLN 与增强版深复数卷积循环网络,均为可实际运行的增量或无人机相关结构,不用 oracle 或事后最优代替可部署收益。

逐帧流式推理 × 线性注意力: 逐帧流式推理即 incremental 推理负责每次只处理 1 帧并复用历史状态,避免存储大块特征图;线性注意力负责把标准自注意力的平方复杂度降为线性,降低计算量。二者搭配的原因都是为了适配无人机片上存储和功耗约束,组合意义在于 DroFiT-Lite 在保持流式结构的同时进一步压缩乘加操作数,使 168k 参数量级的模型更接近嵌入式部署。

推理支持增量逐帧流式,时间卷积可复用存储,频率注意力只沿频率计算因此不随时间平方增长。量化版本为仅权重量化为 8 位整型、偏置保持浮点的 DroFiT-Quant,目标是减少存储而几乎不掉性能。复现时应先确认分帧、窗长跳长与信噪比混合方式与原文一致,否则指标不可比。

用什么指标与成本量纲来评判?

仿真集用尺度不变信噪比衡量波形重建准确度,用扩展短时客观可懂度衡量可懂度,用窄带与宽带感知语音质量评估衡量感知质量。数值越大越好。真实录制无干净参考,用 DNSMOS 的 P.835 版本给出信号、背景与总体三项分数,同样越大越好。计算效率看参数量、每处理单元峰值内存与乘加数,三者越小越省。

模型配置区分基础版、轻量版与量化版,以及消融用的无预置时间、无子带、无卷积前馈、无后置时间变体。预置与后置时间模块的层数与感受野在论文表格中给出,基础版感受野 288 毫秒、前视 128 毫秒,预置 1 层、注意力 4 层、后置 2 层。消融通过改变感受野排除感受野差异的解释。

硬件预算讨论引用片上与片外访问能耗比,强调小参数能放进片上有重要节能意义。评估时需同时核对数据集、模型、阶段、指标、单位与聚合对象,不能只看数值大小就断定同一指标优劣。

极低信噪比下谁恢复得更好?

要回答的核心问题是:在负 30 至负 5 分贝的无人机噪声下,DroFiT 能否以更小的成本达到可比或更好的客观质量。比较条件是同一混合数据集上重训练的基线,指标方向均为越高越好。下表整理了仿真测试集上各信噪比的尺度不变信噪比、感知质量与可懂度,重点看负 20 分贝附近的趋势。

输入信噪比指标含噪输入DCCRN 增强版DCU-netSMoLnet-TDroFiT 基础版
负 30 分贝至负 5 分贝PESQ 窄带/宽带1.39/1.13 至 1.53/1.091.58/1.14 至 2.79/2.051.58/1.19 至 2.48/1.771.70/1.28 至 2.58/1.901.75/1.29 至 2.86/2.10
负 30 分贝至负 5 分贝ESTOI0.14 至 0.390.27 至 0.630.25 至 0.590.27 至 0.600.30 至 0.63

上表显示 DroFiT 基础版在各信噪比的 SI-SDR 与感知质量上总体占优,尤其在低于负 25 分贝的极端条件保持领先。代价是仍需看计算量:论文报告其计算量比 DCU-net 少 15 至 26 倍,比 SMoLnet-T 少 9 至 15 倍的区间表述,支持轻量判断。但 DTLN 在乘加数上更小,说明 DroFiT 不是所有成本维度最小,未胜出项需在下一表结合内存讨论。

下图对比负 20 分贝语谱图,直观验证上述数字:顶部强横条为无人机噪声,中间语音块为待恢复结构。读图前先确认五行的标签与横轴时间 0 至 5 秒、纵轴频率的范围。

看图路径: 1. 从上到下依次确认 Noisy、Clean、DTLN、SMoLNet-T、DroFiT 五条语谱图的标签;2. 对比横轴 0 至 5 秒内语音段与静音段的能量分布差异;3. 观察纵轴频率刻度下低频语音谐波在各方法中的保留程度;4. 重点看顶部强横条状无人机噪声在各输出行中是否被压暗

原论文 Figure 3:Spectrogram comparison at −20 dB between DroFiT and the two competitive baselines (DTLN and…

论文图 3。原论文 Figure 3:“Spectrogram comparison at −20 dB between DroFiT and the two competitive baselines (DTLN and SMoLNet-T).”。

从像素可见,含噪行几乎被橙色横条覆盖,干净行呈现清晰的音节块。DTLN 行残留较多竖向拖尾,SMoLNet-T 行整体偏暗、低频语音偏弱,DroFiT 行在低频保留更多连续谐波且背景更干净,与表格中可懂度与感知质量的领先方向一致。但单一样本不能推广到全测试集,仍需以表格聚合指标为准。

真实录音与模型成本如何权衡?

第二个问题是真实录音感知质量与部署成本如何取舍。真实集无参考信号,用 DNSMOS 三项分数评价;成本用参数量、峰值内存与乘加数评价,越小越好。下表整理论文报告的复杂度与真实集感知分数。

模型参数量 M峰值内存 MB乘加 GSIGBAKOVL
DTLN1.4165.5350.2231.732.971.48
DCCRN 增强版6.03223.62527.6261.671.981.39
DCU-net2.80814.27232.2341.843.351.60
SMoLnet-T0.1871.24518.6431.783.051.50
DroFiT 基础版0.1680.6882.142.002.961.64
DroFiT 轻量版0.1680.6881.211.883.091.58

上表表明 DCU-net 在背景抑制 BAK 上最强,但 DroFiT 在语音 SIG 与总体 OVL 上更高,且参数与内存显著更小。DroFiT 轻量版用线性注意力把乘加从 2.14 降到 1.21,性能下降很小;量化版进一步把存储从 0.688 降到 0.259 MB 而分数几乎不变。未胜出项是 DTLN 的乘加最小,DroFiT 乘加大于它,但论文用片上存储论证小参数可避免高能耗片外访问,这是总体趋势而非每步延迟的保证。未评测边界包括实际芯片延迟与功耗实测,原文未报告,不能承诺延迟改善。

拿掉哪个模块掉得最多?

消融每次只移除一个部件,其余结构与训练协议不变,另设两种不同感受野的无预置时间变体以排除感受野解释。测试仍覆盖负 30 至负 5 分贝。

论文报告移除子带路径带来最大下降,移除预置时间模块带来第二大下降,表明双路径设计与无人机时间对齐先验是关键贡献。卷积前馈网络带来适度但一致的提升,同时减少参数与乘加,体现质量效率权衡。后置时间模块作为轻量精修进一步提升分数。无预置时间的两种感受野变体分数接近,支持下降来自模块本身而非感受野大小。

具体数字上,无子带、无预置时间、无卷积前馈、无后置时间的 SI-SDR 与 PESQ 均低于基础版,而轻量与量化版接近基础版。例如基础版负 20 分贝 SI-SDR 为 9.59,无子带降至 9.32,无预置时间降至 9.44 附近。反证意义在于若只保留全带单路径,低频细节损失最大;若跳过时间稳定直接做频率注意力,谐波干扰会削弱恢复。这支持先时间后频率的顺序,而非并行堆叠。

哪些结论还不能下,缺了什么验证?

论文直接报告的是特定机型 DJI Flip 悬停噪声、特定混合信噪比与特定分帧下的结果,支持在该条件下的性能效率权衡。有限解释是预置时间模块使谐波更清晰的可视化,论文用表示图展示噪声谐波带更分明,但这属于表示更易辨识的支持性证据,不是因果证明注意力因此变好。

未验证的推测包括推广到更多机型、飞行动作、风噪与混响,以及下游语音识别与关键词唤醒的提升。原文未来工作提到扩展场景与集成下游任务,表明当前未覆盖。缺失的证据不是技术错误,但复述时要用可能与待验证表达,不能把相关性说成因果。

另一限制是成本只报告参数、峰值内存与乘加,未测量误判率、每帧延迟与整机功耗。总体乘加小不等于每帧都快,量化后也未报告实际硬件吞吐。因此部署收益应表述为存储与理论计算量的降低,实际延迟需补测。

要复现应先固定什么,再跑什么?

先固定数据构造:16 kHz、5 秒定长、1024 点变换、512 点跳长,训练验证信噪比负 5 至负 25 分贝,测试加入负 30 分贝。用同一录制噪声与 VoiceBank-DEMAND 按相同方式混合,划分 7200、800、810 条。真实集按男女声各约 650 秒、1 秒步长切分 1300 条。任何改动窗长或混合方式都会使 SI-SDR 与 PESQ 不可比。

再固定训练评估:学习率 0.0001,损失权重阿尔法 0.2、贝塔 0.8,Adam 优化,验证集选轮数,所有基线同数据双精度重训练、统一单精度推理。全带频率维 513 到 256 到 128 到 64,通道 2 到 4 到 16 到 32,子带分组 32、32、64、128、257,抽取 8、8、6、5、5,基础版预置 1 层、注意力 4 层、后置 2 层。

先跑基础版复现主表,再跑无子带与无预置时间消融确认下降排序,最后跑轻量线性注意力与仅权重 8 位量化确认成本下降。论文未说明代码与权重是否公开,复现前应以官方渠道为准,不假设可下载。演示页当前可用,可先听示例建立对极低信噪比的直觉,再跑客观指标。

何时值得尝试 DroFiT,何时不必?

当任务是单麦克风、无额外硬件、需流式运行且存储预算只有几百 KB 时,值得尝试双带压缩加频率注意力的思路:全带看全局谐波,子带保低频语音,时间模块先稳定噪声再做频率恢复。极低信噪比是其报告的优势区间,轻量与量化版本适合进一步压成本。

当已有阵列麦克风可用,或场景以非平稳环境噪声为主,或必须保证实测延迟与功耗时,不必直接套用结论,应补测多机型、多动作与下游任务。记住论文的强证据是同一数据重训练下的聚合指标领先与理论成本降低,弱证据是可视化与单样本语谱图。复述方法时沿输入谱、双带编码、预置时间、频率注意力、后置时间、复数掩码、逆变换的顺序讲清,术语首次出现用白话加英文对照,后文简称固定,即可完整重讲该方法。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总