英文题目:Latency-Configurable Streaming Speech Enhancement via Asymmetric Temporal Padding

会议身份:conference:interspeech:2026:conference-paper-id:kim26g_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#CNN #单通道 #流式处理 #语音 #语音增强

评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yunsik Kim:机构信息未能从会议 PDF 纯文本可靠映射
  • Yoonyoung Chung:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

流式语音增强的输入是含噪短时频谱,输出是增强幅度掩码与增强相位,要求在算法时延内兼顾质量与实时响应,难点在于固定架构难以连续权衡过去与未来上下文。该工作先用非对称时间填充将总填充量按比例分配给过去与未来,在不改变感受野与参数量的前提下设定时延档位。接着编码器侧用输入前视缓冲提供真实未来帧,解码器侧用特征缓冲延迟发射以满足未来上下文需求。最后通过选择性状态更新仅缓存当前块帧,阻止前视帧污染后续卷积状态,从而保证全序列与分块推理一致。与全局输入移位或纯因果卷积相比,该机制把未来上下文分散到各层并解决状态损坏问题。在VoiceBank+DEMAND评测设置下,LaCo-SENet全因果档的PESQ指标为3.35±.02,高于aTENNuate基线的PESQ指标3.27。结论仅在单通道 16 kHz 阅读语音加噪场景验证,未覆盖混响、多说话人与真实设备时延。训练推理成本仅报告 ONNX 单线程实时因子,未披露训练硬件与功耗内存。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要输出什么,延迟为什么必须留下?

输入是单通道带噪波形,记为随时间变化的采样序列。目标是输出增强后的波形或其时频表示,使得语音更清晰、残留噪声更少。论文把输入先做短时傅里叶变换,得到复数时频谱,再做幂律幅度压缩,把压缩后的幅度和相位拼成 2 通道特征图。模型要预测幅度掩蔽和增强相位,再用掩蔽加相位替换重建增强谱,最后逆变换加交叠相加回到波形。

必须保留的信息是采样率 16 千赫、窗长 400 点、跳长 100 点、傅里叶点数 400 点,以及评估用的宽带语音质量感知评估、短时客观可懂度与 3 个复合指标。输出不只是分数,而是一族延迟可配的流式模型。延迟必须留下,是因为卷积若要看未来帧,就必须等待未来输入到达,等待时间就是算法延迟。电话会议助听器等实时应用工作在 10 到 80 毫秒区间,多一点前视通常更好,但每个已有模型只锁定一个延迟点。

初学者容易误以为把模型做成非因果就能直接流式,实际上分块到达时未来帧根本不存在,只能用缓冲等待或补零代替,这正是后文双缓冲要解决的。

同任务同运行阶段的路线各卡在哪里?

流式语音增强有多条路线。混合数字信号处理与深度网络、复数卷积循环网络、感知深滤波、时域卷积自编码器、基于状态空间的模型、基于扩展长短时记忆的模型,都在做流式增强。论文指出它们各自锁定一个延迟点,不能在同一结构和同一参数预算内系统地用延迟换质量。过去上下文方面,快速波形生成与可缓存卷积用缓存过去激活替代左侧补零,波形域去噪器也有类似机制。

未来上下文方面,面向流式识别的高效记忆变换器与有状态卷积注意力模型通过分段掩蔽或记忆策略引入右侧上下文,但它们分别处理过去或未来,没有考虑逐层非对称填充下两者的相互作用。卷积填充方面,深滤波网络通过全局输入移位提供前视但保持每层卷积纯因果,可缓存卷积把对称填充转为等效固定输出延迟,两者都刻意避开逐层非对称填充,避免了状态污染但也放弃了延迟灵活性。

本文的对照策略是只与延迟可验证的因果基线比延迟名次,对编码器用非因果对称填充因而延迟不可算的模型明确排除在延迟排名之外,避免把类别差异当成同条件胜负。

二选一的因果观为什么不够用?

传统做法把延迟当成因果与非因果的二选一。要么每层只看过去,延迟最小但质量受限;要么对称地看左右,质量高但延迟由核大小固定。论文要研究的是中间连续档:总填充量不变,只改变分给过去和未来的比例,能否得到一系列延迟质量折中。举例说明,假设某层总填充为 4 帧,对称时左右各 2 帧,非对称时可以左 3 右 1 或左 4 右 0,感受野宽度都是 5 帧,但等待未来的帧数不同。

问题在于训练时这样分配很直接,流式推理时却会污染状态。分块处理时,每块要在卷积窗内引用块外帧,左侧靠状态缓存解决,右侧靠多等几帧解决。若把含前视的扩展输入全部写入状态,前视帧在下一块会出现 2 次,1 次来自状态重放,1 次作为新到达输入,误差逐块放大。论文把这称为状态污染,并用消融证明关掉修复后质量会跌到噪声基线以下。因此问题不只是选比例,还要保证训练整句卷积与推理分块卷积看到相同的上下文。

一个样本如何走完输入到输出?

沿一个带噪 utterance 走一遍。波形先进入输入缓冲,按块切分,每块若干时频帧。当前块与需要的未来帧一起做短时傅里叶变换,得到压缩幅度和相位。特征进入主干网络,先由编码器的密集扩张深度块提取多尺度谱特征并在频率维下采样,通道数投影到 64。接着经过时间频率序列块,时间阶段用因果卷积处理时间顺序,频率阶段用非因果处理频率结构。

然后特征在解码器前视缓冲中等待,直到攒够当前块加前视帧才调用两个并行解码器,分别输出幅度掩蔽与增强相位。掩蔽乘到带噪幅度上,相位直接替换,再逆变换与交叠相加得到波形块并推进输出缓冲。训练时用整句输入加非对称填充模拟不同延迟,推理时用分块加双缓冲复现相同上下文。下面的总览图把这条路径与两种缓冲画在了一起。

为理解双缓冲如何分工,可先看总览图建立输入缓冲、前视与状态的位置关系,再回到文字核对每个缓冲的读写时机。

看图路径: 1. 先从左到右沿输入缓冲到输出缓冲追踪主信号路径;2. 再看编码器时间阶段解码器下方黄色状态缓冲的更新箭头;3. 对比训练子图与流式推理子图中填充零与状态缓存的画法;4. 注意特征缓冲标注的等待解码器前视字样与输出延迟关系

原论文 Figure 1:Overview of LaCo-SENet. (a) Dual-buffer streaming architecture: the STFT context buffer provides…

论文图 1。原论文 Figure 1:“Overview of LaCo-SENet. (a) Dual-buffer streaming architecture: the STFT context buffer provides encoder lookahead at the input level; the feature buffer provides decoder…”。

上图分为三部分。上部显示从左到右的音频分块、短时傅里叶上下文缓冲、密集编码器、时间阶段与频率阶段、特征缓冲、掩蔽与相位双解码器、逆变换交叠相加与输出缓冲,下方黄色状态缓冲分别挂在编码器、时间阶段和解码器之下并标出状态更新。左下训练子图以左右填充 3 和 1 为例画出填充零与卷积输出的对应关系,右下流式子图以块大小为 1 逐步演示状态只记录当前帧而前视帧只参与计算不写入状态。读图时不要把黄色状态箭头当成前向信号,它们是跨块的缓存读写;红色特征缓冲是等待未来特征的延迟机制。

填充比例、双缓冲与状态更新如何分工?

先讲非对称时间填充。记标准对称卷积单侧填充为 P,总填充为 2 倍 P。定义填充比例为左右两部分之和为 1 的二元组,总填充乘以左侧比例并取整得到左侧填充,剩余归右侧。同一工作点下该比例是所有非对称卷积层共享的训练时超参数,不随信噪比、输入内容或运行时条件自适应。频率轴保持对称,只有时间轴做非对称切分。总填充固定意味着感受野大小不变,只有过去未来访问比例变化,从而实现量化延迟配置。

非对称时间填充 × 算法延迟: 非对称时间填充负责把每层固定的总填充量按比例切给左侧过去和右侧未来,只改变过去未来访问比例而不改变感受野大小;算法延迟负责把所有编码器与解码器层累积的右侧填充折算成毫秒数。两者搭配的原因是右侧填充总量直接决定需要等待多少未来帧,组合意义是训练时改一个填充比例就能得到离散的不同延迟档,而不用改结构或参数量。

再讲双缓冲。设分块大小为 C 帧,层索引为 l,编码器累积右侧填充记为编码器前视,解码器 2 分支取最大累积右侧填充记为解码器前视。算法延迟由两者之和乘以跳长换算成毫秒,再加窗长一半对应的短时傅里叶中心延迟。编码器输入扩展为当前块加编码器前视帧,使编码器侧卷积看到真实未来。解码器侧把编码器输出特征攒在缓冲中,攒够当前块加解码器前视才调用 1 次,只输出当前块对应部分,多余帧只作未来上下文。因为输出区域与右侧补零边界之间至少隔着前视帧数,输出都是用真实未来算出而非零算出。

状态缓冲 × 前视缓冲: 状态缓冲负责在分块边界处保存过去激活,用来替代卷积左填充的零,保证与整句推理看到的历史一致;前视缓冲负责在输入级和特征级多缓存未来帧并延迟输出,让右侧填充看到真实未来而非零。两者搭配的原因是过去靠复用状态、未来靠等待输入,组合意义是双缓冲同时提供过去上下文和未来上下文,支撑编码器输入扩展与解码器等待调用。

最后讲状态更新。设某层左侧填充需要缓存过去若干帧,上一块的缓存拼在当前输入左侧,右侧补零。状态更新只取扩展输入中前 C 个当前块帧的最后若干帧写入状态,前视部分不写入。用选择算子只保留当前块帧可以表述这一限制。

选择性状态更新 × 未来帧泄漏: 未来帧泄漏指前视帧若被写入状态,会在下一块既从状态重放又作为新输入出现,造成渐进失真;选择性状态更新负责把状态写入范围限制为只取当前块帧,参与前向计算的前视帧不写入状态。两者搭配的原因是前向需要未来、状态不能记未来,组合意义是保证分块流式输出与整句输出数值一致,解决逐层非对称填充带来的状态污染。

主干的时间频率块把同一特征先变形成时间优先再变形成频率优先,分别用通道注意力块与分组素数核前馈网络处理。

时间分支 × 频率分支: 时间分支负责沿时间轴建模先后依赖,采用因果卷积以免偷看未来;频率分支负责沿频率轴建模频带结构,采用非因果方式因为频率轴没有时间先后。两者搭配的原因是时频谱同时有时间顺序和频率结构,组合意义是在时间频率序列块中先做时间处理再做频率处理,兼顾流式因果约束与频域建模能力。

为兼容分块流式,原文做了三处改动。实例归一化换成批归一化,因为前者统计量依赖整句长度,分块大小一变就不一致,后者用固定滑动统计与块大小无关。全局平均池化的通道注意力换成因果深度卷积,避免汇聚未来帧破坏因果。主干配置为密集通道 64、密集块深度 4、4 个时频块中两时间两频率、时间核 3、5、7、11、频率核 3、11、23、31、注意力核 11。

每个延迟档如何训练,选点与监督是什么?

每个延迟档独立训练,不是训练一个模型推理时切换延迟。编码器与解码器共享同一填充比例,使编码器前视与解码器前视相等。从全因果到对称共扫 9 个配置,覆盖 12.5 到 200.0 毫秒,其中 6 个为每侧前视 0 到 5 帧,另有两个中间点 100.0 与 150.0 毫秒,以及对称参考作为结构上限。训练数据为 VoiceBank 加需求噪声库,16 千赫,11572 条训练与 824 条测试,10 种噪声在 4 种信噪比下混合。优化器用权重解耦的自适应矩估计,学习率 5 乘 10 的负 4 次方,1 阶 2 阶矩系数 0.8 和 0.99,指数衰减,批量 8,共 400,000 步。

损失沿用主干工作,加权组合幅度、相位、复数、一致性与度量生成对抗网络度量项,权重分别为 0.9、0.3、0.1、0.05、0.05。每个配置用 3 个随机种子独立训练,按验证集语音质量感知评估选最优检查点并报告均值与标准差。需要指出的缺项是原文未报告学习率衰减步长、验证划分细节与对抗项的具体停止梯度写法,复现时只能按所给权重与优化器设置先跑通,再补验证。

数据指标与基线条件是否可比?

评估在全长测试句上用整句推理打分,流式等价性另行验证分块输出与整句输出数值相同。指标为宽带语音质量感知评估、短时客观可懂度与复合的信号失真、背景噪声、总体质量三项,分数越高越好。比较基线包括 4 个延迟可验证的因果模型,延迟 10 到 46.5 毫秒,以及非因果主干作为质量上限。延迟值来自原论文或按窗减跳除以采样率估算。两个标称单向但编码器用非因果对称填充的模型因延迟不可算而排除在延迟排名之外,只列分数不参与因果最优加粗。

主结果表报告 4 个代表性因果点与对称参考,另有曲线展示全部九点。吞吐测试用开放神经网络交换运行时在至强银牌单线程上测端到端稳态实时率,包含正逆变换。消融在块大小为 1 时开关选择性状态更新,并裁掉尾部 30 帧以排除末尾交叠相加边界伪影。统计上主结果与消融都报告 3 种子均值与标准差,避免单种子偶然。

固定参数下延迟换质量的数字是什么?

要回答的核心问题是同一 1.37M 参数结构能否用填充比例换出一族延迟质量点,以及最小延迟点是否达到已有因果最优。公平条件是同数据集同整句评分,指标方向均为越高越好,延迟排名只含延迟可验证模型。下表整理 4 个流式档与关键基线的延迟参数与质量,延迟与分数的对应关系以原文连续句为准。

比较前先明确,表中延迟越小越难,因为能看的未来越少;质量分数越高越好,但跨延迟比较必须同时看参数量是否相同。

条件延迟参数量感知质量对照对象
全因果本方法12.5 ms1.37M parametersPESQ 3.35最优因果基线 PESQ 3.27 at 46.5 ms
更高延迟本方法75.0 ms1.37M parametersPESQ 3.43对称上限前一档

上表显示固定预算下质量随延迟单调上升,从 12.5 毫秒时 3.35 升到 75.0 毫秒时 3.43,对称参考在 200.0 毫秒时 3.47,非因果主干上限为 3.61。关键收益是 12.5 毫秒全因果已超过 46.5 毫秒时 3.27 的已有因果最优,且参数量相近。代价是增益集中在 25 到 75 毫秒,之后 125 毫秒只再涨 0.04,保留非因果上限的 93 到 95%。未胜出项是与非因果主干相比仍有约 0.14 到 0.26 差距,说明延迟配置不能完全替代非因果结构。

吞吐与延迟的另一面是分块大小的影响,下图给出稳态实时率随块大小的变化。

实时率随块大小增大而下降是符合预期的,因为固定每步开销被摊薄;读图时先看纵轴是对数刻度,不能把起点的高低直接当成线性倍数。

看图路径: 1. 先确认横轴是分块大小帧数纵轴是对数刻度的实时率;2. 再对比三条不同总前视曲线的起点高低与下降速度;3. 找到实时率等于 1.0 的水平虚线与各曲线交点对应的块大小

原论文 Figure 3:Steady-state streaming RTF vs.

论文图 2。原论文 Figure 3:“Steady-state streaming RTF vs. chunk size C (frames) for three total lookahead values Lenc+Ldec ∈0, 10, 30.”。

上图横轴为分块大小帧数,纵轴为实时率,3 条曲线分别对应总前视 0、10、30,即延迟 12.5 毫秒、75.0 毫秒与 200.0 毫秒,并标出实时率为 1.0 的水平线。可见块为 1 时实时率高达 4.59 附近,块到 64 时降到 0.30 附近,大前视在小块时惩罚约 2.10 倍,到 64 块时收敛到约 1.0 倍。原文报告无前视时从块 1 的 4.59 降到块 64 的 0.30,实时需要块大于等于 7 到 12,在块 8 时因果总延迟为 62.5 毫秒、实时率 0.77。这说明算法延迟小不等于系统总延迟小,块缓冲也会加延迟,部署时要在块大小与总延迟之间再做 1 次选择。

关掉选择性更新会发生什么?

要验证的是状态污染是否真实存在,以及选择性更新是否为必要修复。实验固定块大小为 1,分别打开与关闭选择性状态更新,比较感知质量。公平条件是同延迟档同种子,尾部裁帧一致,指标越高越好。下表整理不同总前视下的开关对比,差值方向以原文报告为准。

比较前先明确,若关闭后分数跌到噪声基线以下且随前视增大而恶化,就支持污染随前视累积的解释;若对称档跌得较少,则与状态缓冲大小减半的解释一致。

配置总前视延迟开启选择更新关闭选择更新
全因果Ltot=2 前视 012.5 msPESQ 3.39PESQ 3.39
非对称大前视Ltot=1075.0 msPESQ 3.48PESQ 1.39

上表显示全因果无前视时开关无差,差值为 0.00;一旦引入前视,关闭后全部跌到噪声基线 1.97 以下,从总前视 2 时的负 1.56 扩大到总前视 10 时的负 2.09。对称参考总前视 30 反而只跌负 1.48,原文解释为左右填充相等使状态缓冲减半从而污染较小。该消融支持选择性更新在非对称引入前视时必不可少。同时原文报告所有配置下分块流式输出与整句输出数值相同,支持训练推理一致。限制是该等价性只在所测分块与裁尾条件下验证,未报告长时连续流与端点检测切换时的累积误差。

哪些边界没有测,不能承诺什么?

首先是离散性与训练成本。延迟档是离散的,由每层右侧填充的整数帧决定,不能任意指定毫秒数,且每个档独立训练 9 次,3 种子共更多次,调参成本随档数线性增长。推理时也不能动态切换延迟,换延迟必须换权重。其次是评估边界。主结果只在 VoiceBank 加需求噪声库的英文朗读与有限噪声信噪比下报告,没有多语言、混响、突发噪声或低信噪比压力测试,也没有人评与误字率等下游指标,不能把感知质量分数直接当成可懂度或用户体验改善。

吞吐只在特定服务器中央处理器单线程与开放神经网络交换运行时测得,移动端与助听器芯片的算力与内存未测,不能承诺同等实时率。总体趋势是质量随延迟上升,但不等于每条 utterance 或每帧都单调,原文只报告平均与标准差。缺失证据不是技术错误,但未测量延迟抖动、功耗与长时漂移时,不应承诺这些量得到改善。

复现先做什么,需要哪些信息条件?

先准备数据与特征。按 16 千赫重采样,短时傅里叶窗 400 跳 100 点数 400,幂律压缩系数 0.3,拼幅度相位 2 通道。划分沿用原库的训练测试,验证选点按验证感知质量,需自己固定验证切分并记录种子。再搭主干。密集扩张深度块按扩张 1、2、4、8 堆 4 层深度可分离卷积加稠密连接,时频块按两时间两频率堆叠,时间核与频率核按所给清单设置,注意力核 11,通道 64。

关键是把所有时间卷积换成可配左右填充的非对称 2 维卷积,频率轴保持对称,同一档内所有层共享同一比例。归一化用批归一化,注意力池化换成因果深度卷积。训练按批量 8、400,000 步、所给损失权重起跑,每个延迟档独立训练并存 3 种子。推理实现双缓冲。编码器输入扩展当前块加编码器前视,特征缓冲攒够当前块加解码器前视才调解码器,状态只取当前块帧更新。

先用块 1 对比整句输出是否逐采样一致,再扫块大小测实时率。资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码模型或数据已公开,复现应按论文文字重写,链接当前不可用时以本次未能确认可达为准。

何时值得尝试这条路线?

当产品需要在同一卷积主干下提供多档延迟,例如助听器要 12.5 毫秒而会议要 75 毫秒,且参数预算卡死在 1.3M 量级时,这条路线值得尝试。它的价值在于不改感受野与参数量,只改训练时填充比例就能系统探索延迟质量折中,并用双缓冲加选择性更新保证流式与整句一致。复现时先做全因果档,若在 12.5 毫秒附近达到 3.3 以上再向大前视扩展,避免一开始就调大延迟掩盖状态 bug。还需补的验证是跨数据集泛化、连续长流稳定性与目标硬件实测,以及感知分数之外的可懂度与人评。若只能负担 1 次训练,应选目标场景延迟最大的可接受档,因为增益主要在 25 到 75 毫秒,超过后收益迅速变平。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总