英文题目:RT-Tango: Real-Time Distributed Binaural Speech Enhancement for Low-Power Hearing Aid Devices

会议身份:conference:interspeech:2026:conference-paper-id:benslimane26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#助听器 #RNN #高效推理 #语音增强

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Zahra Benslimane:机构信息未能从会议 PDF 纯文本可靠映射
  • Pierre Chouteau:机构信息未能从会议 PDF 纯文本可靠映射
  • Martyna Poreba:机构信息未能从会议 PDF 纯文本可靠映射
  • Fabrice Auzanneau:机构信息未能从会议 PDF 纯文本可靠映射
  • Michal Szczepanski:机构信息未能从会议 PDF 纯文本可靠映射
  • Fabian Chersi:机构信息未能从会议 PDF 纯文本可靠映射
  • Romain Serizel:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

双耳语音增强需在左右耳各2麦、耳间带宽受限下输出双路干净语音,难点是超低延迟、极低算力和分布式处理三者互斥。本文方法沿用Tango的两阶段分布式链路:单节点网络仅用本耳双通道估计时频掩膜,经语音失真加权多通道维纳滤波(Speech Distortion Weighted Multichannel Wiener Filter,SDW-MWF)生成可传输压缩信号;多节点网络联合本地信号与对侧压缩信号二次估计掩膜,再做SDW-MWF得到双耳输出。与集中式多通道直接重建波形不同,该机制用神经掩膜引导空间滤波,并以非对称分析合成窗解耦频率分辨率与算法延迟。前端用等效矩形带宽(Equivalent Rectangular Bandwidth,ERB)压缩频维并经逆变换恢复线性频分辨率,循环主体用分组循环网络(Grouped Recurrent Network,GRNN),推理侧用固定速率跳过(Fixed-Rate Skipping,FRS)复用掩膜。在BinauRec房间脉冲响应混合语料评测设置下,RT-Tango左耳的SI-SDR为4.4 dB,低于同帧率GTCRN的SI-SDR 6.0 dB,同条件下系统总计算量为33.41 MMACs/s,严格因果在线变体RT-Tango-OS的延迟为8 ms。适用边界限于前方目标、右侧45度和90度噪声、干声-5 dB、0 dB和5 dB混合的受控仿真,移动声源、强混响变化与真实硬件功耗均未验证。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

助听器降噪为什么同时缺算力、缺带宽还缺时间?

输入是助听器双耳共 4 个麦克风拾取的含噪语音,每耳前后各一个麦克风,目标是在助听器本机上实时输出左右两路增强语音。必须保留的信息有 3 类:一是延迟上限,论文把在线版本做到 8 ms 算法延迟;二是计算预算,以每秒乘加运算次数 MMACs/s 衡量;三是通信约束,两耳设备分离,只能交换少量压缩信息,不能把全部麦克风波形持续传给对侧。

本文输出是 1 篇可复述方法的解读:先讲任务与路线,再走完一个样本的全链路,然后讲训练、实验条件、主结果、消融与边界,最后给出复现清单。双耳分布式是本文的关键词。白话说,分布式指左右助听器各自算自己的,只传提炼过的中间量;双耳指最终要输出左右两路,保持空间听感平衡。英文为 distributed binaural speech enhancement。

后续简称分布式双耳增强。另一个关键词是实时流式。白话说,来 1 帧处理 1 帧,不能等整句话说完再算;英文为 real-time streaming,后续简称流式。助听器场景把三者绑在一起:模型必须小,帧必须短,通信必须少。

论文的判断起点是,已有轻量化工作多做单通道,而多通道轻量化工作又多假设集中式能看到全部麦克风,这与助听器实际不符。因此 RT-Tango 的任务不是刷最高分,而是在显式延迟和计算约束下做分布式双耳增强。

同输入同目标的已有路线走到哪一步?

同输入指助听器或麦克风阵列的多麦克风含噪语音,同目标指实时输出增强语音,同运行阶段指在线流式。第一条路线是模型压缩。做法包括结构化剪枝与量化、混合精度推理、蒸馏训练。论文指出语音增强对激进量化敏感,因为回归目标会放大噪声,这限制了纯靠量化压到整数部署的效果。第二条路线是结构轻量化。

做法包括分组处理、子采样降维、用等效矩形带宽滤波器组压缩频率表示,例如 GTCRN。分组的思想是把特征图切成小块并行处理,块间定期交换信息。第三条路线是高效多通道。做法包括解耦空间与频谱处理、用轻量注意力建模空间相关。但论文指出这些方法计算量仍高于超轻量单通道模型,且多假设集中式处理。

第四条路线是分布式无融合中心处理。做法如分布式多通道维纳滤波,在性能与带宽间权衡。Tango 属于这一支:2 阶段分布式架构,在空间无约束阵列上已验证有效。RT-Tango 与它们的区别是同时施加实时延迟与计算约束,并显式处理低延迟流式。需要区分的是,GTCRN 在本文被改造为每节点一个实例、处理本地四麦克风信号并作用于本地参考通道,以保留分布式逐节点结构,这不是原文 GTCRN 的集中式用法,比较时要记住这个改造条件。

论文把约束具体化成哪些可测问题?

论文把助听器约束拆成 4 个可操作问题。第一,神经掩码估计的计算量。基线 Tango 没有延迟与复杂度约束,直接部署太重。第二,频率分辨率与算法延迟耦合。常规短时傅里叶变换缩短窗会同时损失频率分辨率,拉长窗又增加延迟。

第三,逐帧神经推理的冗余。语音相邻帧变化小,每帧都跑全网络浪费算力。第四,空间统计量的因果估计。加权多通道维纳滤波需要的空间协方差矩阵若用整句估计则非因果,在线时必须递推更新。评价上论文用 3 组尺度不变客观指标加两组感知指标。

白话说,尺度不变信干比 SI-SIR 看压住噪声的能力,尺度不变信失真比 SI-SDR 看总体失真,尺度不变伪影比 SI-SAR 看处理引入的伪影;短时客观可懂度 STOI 看可懂度,语音质量感知评价 PESQ 看主观质量感。指标方向都是越高越好。计算成本按单节点统计,包含掩码网络、等效矩形带宽正逆变换与滤波处理,但不含快速傅里叶变换与逆变换。数据集划分与构造在实验节交代,这里先记住比较必须对齐跳长、帧率与在线离线条件,否则 MMACs/s 与指标不可比。

RT-Tango 让一个样本走完两阶段需要经过什么?

先沿一个样本走全程。右耳前后麦克风与左耳前后麦克风各自做短时傅里叶变换,进入第一阶段。每耳的单节点网络先把频谱经感知压缩变成等效矩形带宽特征,再用分组循环网络加全连接层估计语音与噪声掩码,经逆变换回到线性频率。掩码用于计算本耳的失真加权多通道维纳滤波,得到耳特定的压缩信号并传给对侧。

第二阶段每耳的多节点网络融合本地信号与对侧传来的表示,精修掩码,再做 1 次维纳滤波,经逆短时傅里叶变换输出左右两路增强波形。白话解释失真加权多通道维纳滤波:它是用估计的语音与噪声空间统计量求一组滤波系数,在压噪声与保语音之间按权重折中;英文为 Speech Distortion Weighted Multichannel Wiener Filter,缩写 SDW-MWF,后续简称加权维纳滤波。单节点网络英文为 Single-Node DNN,缩写 SN-DNN;多节点网络英文为 Multi-Node DNN,缩写 MN-DNN。

单节点网络 × 多节点网络: 单节点网络负责每只耳朵只用本地双麦克风估计初版掩码并做 1 次加权多通道维纳滤波,得到可传输的压缩信号;多节点网络负责融合本地信号与对侧传来的压缩表示,精修掩码并做第二次滤波得到双耳输出;二者搭配的原因是助听器两耳物理分离、不能持续传原始多通道信号,分 2 阶段才能在有限通信下利用双耳空间线索。

下面这张框图是理解 2 阶段与新增模块位置的关键,读图时先看主路径再看新增的效率与低延迟模块。框图保留了 Tango 的 2 阶段处理,效率模块用黄色高亮、低延迟流式模块用斜体表示,这是按图注确认的完整对象。

看图路径: 1. 先从顶部 Rear R、Front R 与 Rear L、Front L 四个麦克风入口沿箭头向下走,确认左右两路对称结构;2. 再看蓝色 SN-DNN 与绿色 MN-DNN 框内 ERB Features、GRNN+FC、Inv ERB 三层堆叠顺序;3. 接着确认 Stage 1 的 SDW-MWF 输出如何交叉送入 Stage 2 的 MN-DNN;4. 最后看底部 Stage 2 的 SDW-MWF 经 iSTFT 得到 Out R 与 Out L 的出口

原论文 Figure 1:Block diagram of RT-Tango.

论文图 1。原论文 Figure 1:“Block diagram of RT-Tango. It preserves Tango’s two- stage processing scheme while introducing additional or mod- ified modules focused on efficiency (highlighted in yellow) and…”。

从像素可见,图顶是人头示意与左右各两个麦克风,Stage 1 在上、Stage 2 在下并用紫色大框标出。第二阶段明显跨左右两路,有交叉连线表示对侧压缩信号的传入。每个 SN-DNN 与 MN-DNN 框内都是 3 层:ERB Features、GRNN+FC、Inv ERB。Stage 1 与 Stage 2 各有一个 SDW-MWF,底部经 iSTFT 输出 Out R 与 Out L。读图时不要把交叉线的方向看反:第一阶段输出向下进入第二阶段,第二阶段还回用了原始短时傅里叶变换分支参与最终滤波,这对应正文说的本地信号加交换表示共同精修。

压缩、分组与跳帧各自省了哪部分算力?

先讲感知压缩。白话说,等效矩形带宽滤波器组是按人耳对高频粗、低频细的敏感度重排频带;英文为 Equivalent Rectangular Bandwidth filterbank,缩写 ERB,后续简称 ERB。输入是线性频谱,输出是更低维的 ERB 特征,网络在其上估计掩码,再经逆 ERB 映射回线性频率以满足滤波分辨率。这样省的是掩码网络输入层及后续层的参数与运算,同时保留语音能量集中的低频线索。

等效矩形带宽滤波器组 × 掩码估计: 等效矩形带宽滤波器组负责把线性频谱按人耳感知尺度压缩,高频变粗、低频保留细节,从而降低掩码估计网络的输入维度和后续运算量;掩码估计负责输出语音和噪声在每个时频点的占比,供多通道维纳滤波使用;二者搭配的原因是直接在全分辨率频谱上估计掩码计算量大,而感知压缩保留了语音能量集中的关键线索,组合后网络在更小的特征上学习映射,再经逆变换恢复滤波所需的全分辨率。

再讲分组循环建模。白话说,分组循环神经网络是把特征切成 G 组、每组用更小的隐状态做循环建模;英文为 Grouped Recurrent Neural Network,缩写 GRNN,后续简称分组循环。原文给出复杂度关系:全带循环约 O(H2),分成 G 组后为 G 乘 O((H/G)2),即 O(H2/G)。由于语音谱相关多在邻近频带,局部建模合理。

又因分组后独立处理会丢跨带关系,论文用表征重排机制实现跨带信息交换与全局建模。最终选择是 SN-DNN 用 8 组、MN-DNN 用 2 组,这个不对称选择来自消融,不是事先假设 2 阶段同等敏感。

分组循环神经网络 × 跨带信息交换: 分组循环神经网络负责把特征切成多个频带小组,每个小组用更小的隐状态独立做时序建模,把循环层复杂度从 O(H2) 降到 O(H2/G);跨带信息交换负责通过表征重排让各小组之间仍能看到全局频谱结构;二者搭配的原因是语音的强相关多在邻近频带,完全全带建模冗余,而完全独立分组又会丢失全局结构,组合后兼得局部建模效率和全局一致性。

再讲时间稀疏。白话说,固定跳帧复用是按固定间隔跑 1 次网络、中间帧复用旧掩码;英文为 Fixed-Rate Skipping,缩写 FRS,后续简称固定跳帧。学习门控跳过是每帧学一个门决定是否更新循环状态,例如 SkipRNN 与 TinyLSTM。固定跳帧省的是整帧推理,门控方法每帧仍要算门本身。RT-Tango 采用 SN-DNN 每 4 帧更新 1 次、MN-DNN 每 2 帧更新 1 次,对应原文的 1/4 与 1/2 更新率。

固定跳帧复用 × 学习门控跳过: 固定跳帧复用负责按固定间隔执行 1 次掩码网络、中间帧直接复用上 1 次掩码,计算节省可预测;学习门控跳过负责让网络每帧判断输入变化是否值得更新状态,理论上更灵活;二者搭配比较的原因是语音有时变化快有时平稳,需要在平均计算量和最坏延迟之间权衡,论文对比后发现固定策略在多节点网络上更稳定,因此最终采用固定跳帧。

最后讲低延迟流式。白话说,非对称短时傅里叶变换是用长分析窗保频率分辨率、用短合成窗降重构延迟;英文为 asymmetric STFT,后续简称非对称变换。在线空间协方差用指数滑动平均递推更新,英文为 exponential moving average,缩写 EMA。在同时满足因果循环推理与在线统计时系统称为 RT-Tango-OS,即严格在线版本。

非对称短时傅里叶变换 × 在线空间协方差估计: 非对称短时傅里叶变换负责用长分析窗保留频率分辨率、用短合成窗降低重构等待,从而把频谱分辨率与算法延迟解耦;在线空间协方差估计负责用指数滑动平均逐帧更新滤波器所需的语音与噪声空间统计量,保证严格因果流式运行;二者搭配的原因是只缩短合成窗仍需滤波统计量跟得上帧率,组合后才构成 8 ms 延迟的完整在线链路。

网络用什么监督训练,哪些参数在线更新?

训练部分有明确监督,不是无训练论文。模型用 PyTorch 实现,优化器为 Adam,学习率为 10 的负 3 次方,损失是估计时频掩码与目标理想比掩码之间的均方误差。白话说,理想比掩码是每个时频点语音能量占比的参考值;英文为 ideal ratio mask。训练音频的短时傅里叶变换配置按实验分组:分组消融、固定跳帧与 RT-Tango 用 32 ms 分析窗、16 ms 跳长。

学习跳过与 GTCRN 的 4 ms 条件把跳长降到 4 ms 以对齐 RT-Tango 的帧率。需要冻结还是更新的边界是:掩码网络权重训练后固定,在线运行时不再学习;在线更新的是加权维纳滤波所需的空间协方差矩阵,用遗忘因子为 0.995 的递推平均每 8 帧更新 1 次,在 4 ms 输入速率下等效更新间隔为 32 ms。梯度路径只在掩码回归损失处,未报告对滤波器或门控的端到端梯度,不从名称推定。

重置时机方面,在线估计需要适应期,论文用重复播放同一混合句达到稳态后再在最后 1 次重复上计算指标,这不是常规单遍流式测法,复现时必须照做否则会低估在线性能。

数据、基线与统计口径如何对齐?

训练用按 Monir 等人协议仿真的双耳数据:助听器四麦克风配置,每耳两个麦克风;干净语音来自 LibriSpeech,与言语形噪声及真实环境噪声混合。评价用 BinauRec 双耳子集,共 1200 个混合句,用便携听觉实验室在假头佩戴耳背式助听器实测的房间冲激响应生成。目标在正前方,噪声在目标右侧 45 度与 90 度,因此右耳输入信干比低于左耳。干声按负 5、0、5 dB 输入信噪比混合后再与房间冲激响应卷积。

基线包括原始卷积神经网络版 Tango、因果版 Tango-RNN,以及改造为分布式逐节点的轻量 GTCRN。Tango-RNN 的 SN-DNN 与 MN-DNN 都是两层堆叠有状态循环层加全连接层,隐单元 128。指标聚合按左右耳分别报告,不做双耳平均;计算成本按单节点报告。资源状态方面,本次收到的证据中没有发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,复现只能按论文文字与超参数重写。

硬件预算原文未给出具体芯片与功耗测量,MMACs/s 不能直接等同于实际延迟与功耗,这是缺项而非错误。

主结果在同帧率下谁更省、谁更稳?

比较问题是:在可比的分布式结构与帧率下,RT-Tango 是否以更低的每秒运算量保持增强质量与双耳平衡。公平条件是看清跳长:16 ms 跳长对应每秒约 62 帧,4 ms 跳长对应每秒约 250 帧,帧率越高同样每帧成本会被放大为更高的每秒成本。指标方向均为越高越好,成本越低越好。下表整理主结果的计算成本对照,重点看总成本与其中神经网络部分的下降,表中数值与单位保留原文写法。

条件指标Tango-RNNRT-TangoGTCRN 同帧率对照
16 ms 跳长与 4 ms 跳长总复杂度 MMACs/s67.2 MMAC/s33.4 MMAC/s197.5 MMAC/s
4 ms 跳长稀疏前后 DNN 成本 MMACs/s67.5 MMACs/s28.08 MMACs/s197.5 MMAC/s
4 ms 在线流式含在线滤波总成本 MMACs/s124 MMACs/s35.14 MMACs/s197.5 MMAC/s

表后解释主要收益与代价。论文报告 Tango-RNN 把复杂度降到 67.2 MMACs/s,而 RT-Tango 在更高帧率下做到 33.4 MMACs/s;在相同条件下比 GTCRN 的 197.5 MMACs/s 省近 6 倍。质量上 Tango 与 Tango-RNN 在 PESQ、STOI、SI-SIR 上一致高于 GTCRN,GTCRN 只在受噪声影响较小的左节点上 SI-SDR 与 SI-SAR 略好,而 Tango 系方法左右耳更均衡,这对助听器的空间感知与听感舒适更重要。在线版本 RT-Tango-OS 的 SI-SIR 与离线版可比,但 SI-SDR 与 SI-SAR 有预期下降,STOI 与 PESQ 仍接近同帧率 GTCRN。未胜出项是右耳与低延迟在线的重建指标:噪声在右侧导致右耳更难,非对称窗与在线统计主要损失在这里,不能只看左耳数字就推广为整体无损。

分组放在哪一阶段、跳帧放在哪一阶段才不伤质量?

比较问题有两个:一是分组数放在单节点还是多节点更敏感,二是固定跳帧与学习门控在两个阶段的表现是否一致。公平条件是消融用 32 ms 分析窗与 16 ms 跳长训练,成本按每帧 DNN 计算。指标仍是越高越好。下表整理分组与稀疏的关键数字,单位保留原文。

条件指标未分组总量SN 分组 8 组MN 分组 8 组负例
DNN 2 阶段合计每帧成本 MMAC/frame1.060.59 MMAC/frame0.8-1 dB 下降
4 ms 跳长稀疏DNN 成本 MMACs/s67.5 MMACs/s28.08 MMACs/s124 MMACs/s 未稀疏在线
在线更新有效间隔与帧率32 ms≈31 updates/s≈250 frames/s

表后解释机制与反证。单节点分组 8 组把总量从 1.06 降到 0.59 MMAC/frame,而 SI-SDR 维持在 4.7 与 4.9 dB 量级,PESQ 与 STOI 保留;多节点分组 2 组可保留性能,但 8 组使 SI-SDR 与 SI-SAR 掉约 0.8-1 dB,因此最终用 SN 为 8、MN 为 2 的组合。时间稀疏上,单节点用 1/2 与 1/4 固定跳帧都与基线差 0.2 dB 以内,非更新帧计算为零;多节点固定 1/2 也只差 0.2 dB 以内,而学习门控在多节点左通道把 SI-SDR 从 4.5 dB 拉到 3.8 dB 与 3.3 dB,说明多节点对门控更敏感。

延迟折中上,固定 32 ms 分析窗时,标准平方根汉恩窗在短合成窗下快速退化,非对称汉恩窗在 8 ms 合成窗取得延迟与质量的较好折中,压到 4 ms 则退化,因此在线版选 8 ms 非对称合成窗。未评测边界是门控的有效跳过率虽达 80%,但门本身每帧仍有额外乘加,论文表格中非更新帧仍有 0.01 与 0.02 量级成本,不能当成零。

在线版本的损失从哪两步来?

论文明确在线损失是两步叠加。第一步来自非对称变换本身,用离线整句协方差隔离测试时已引入差距;第二步来自在线协方差估计的因果与适应要求,进一步放大 SI-SDR 与 SI-SAR 的下降。证据显示在线版 SI-SIR 仍可比,但重建类指标下降,这支持论文的判断:语音可懂度与感知质量保持竞争力的同时,波形重建精度受影响。限制还包括评价协议的特殊性:在线结果是在重复播放至稳态后的最后 1 次重复上计算的,这利于收敛但不代表冷启动第一遍的体验。

噪声只在右侧两角度,目标只在正前方,未覆盖移动声源与更密集混响;成本统计不含快速傅里叶变换,实际部署的总负载会更高;未测量误判率以外的功耗、内存峰值与芯片实测延迟,因此不能把 MMACs/s 的下降直接承诺为续航提升。这些是缺项而非技术错误,复现与选型时要补测。

要重跑这套结果先固定什么?

复现先固定数据链:训练按四麦克风助听器仿真,干净语音用 LibriSpeech,加言语形噪声与真实环境噪声;评价用 BinauRec 子集 1200 句,实测房间冲激响应经便携听觉实验室采集,目标正前方、噪声在右侧 45 度与 90 度,干声按负 5、0、5 dB 混合后再卷积。左右耳分别报告,不要平均。再固定模型链:先跑 Tango 与 Tango-RNN 对齐实现,Tango-RNN 为两层 128 隐单元有状态循环加全连接;再把循环换成分组循环,SN 用 8 组、MN 用 2 组并加表征重排。

前端加 ERB 与逆 ERB;稀疏用固定跳帧,SN 每 4 帧 1 次、MN 每 2 帧 1 次。流式链固定为 32 ms 分析窗、8 ms 非对称汉恩合成窗,跳长 4 ms,遗忘因子 0.995 每 8 帧更新协方差,等效 32 ms 间隔。训练固定 Adam、学习率 10 的负 3 次方、掩码均方误差对照理想比掩码。在线评测必须重复播放至稳态再取最后 1 次。

何时值得尝试:当设备是双耳分离、带宽只够传压缩表示、延迟要求个位数毫秒且能接受重建指标小幅下降时;若追求单通道极限分数或有集中式算力,则不必用分布式 2 个阶段。

这篇工作留下什么可带走的结论?

带走三句话。第一,分布式双耳增强的省算力重点不在换一个大模型,而在把频率、分组与时间三处冗余分别处理:ERB 压输入维,分组压循环量,固定跳帧压更新率,三者叠加才把 4 ms 高帧率的成本压住。第二,2 阶段不对称:单节点可激进分组与跳帧,多节点对分组与学习门控更敏感,这是复现时最易踩错的地方。第三,低延迟的代价可定位:8 ms 非对称合成窗与在线统计是 SI-SDR 下降的主因,但 SI-SIR 与可懂度保持较好,说明方向是保感知、舍波形精度。

未验证的推测用可能表达:更短合成窗可能在其他混响下退化更大,待在更多角度与移动声源上验证;门控方法可能经更细的阈值与训练约束改善多节点稳定性,但本文证据不支持直接替换固定跳帧。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总