英文题目:Schrödinger Bridge Mamba for One-Step Speech Enhancement

会议身份:conference:interspeech:2026:conference-paper-id:yang26e_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#扩散模型 #状态空间模型 #去混响 #语音增强

评分:7.0/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Jing Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Sirui Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Chao Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Lei Guo:机构信息未能从会议 PDF 纯文本可靠映射
  • Fan Fan:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理联合去噪与去混响下的语音增强,输入为含加性噪声与混响的退化短时傅里叶变换 Short-Time Fourier Transform(STFT)谱,输出为干净语音谱,难点在于真实混响加噪声下细节重建与单步低时延推理难以兼得。方法链分3步推进:首先按方差爆炸 Variance Exploding(VE)调度由干净与退化配对样本显式构造薛定谔桥最优传输 Optimal Transport(OT)中间态 \(x_t\) 作为训练锚点。随后含高斯傅里叶时间嵌入的条件化 oSpatialNet-Mamba 主干以 \(x_t\) 为输入学习数据预测映射。最后推理时固定 \(t=1\) 由退化端单次前向直接重建干净目标。与盲映射或掩蔽学习仅见起点终点不同,该范式在训练期显式暴露连续传输动力学,并以 Mamba 循环状态演化内化最优控制策略。在DNS Real Recordings测试集下,SBM的OVRL指标为3.198,高于SB-NCSN++(10)的OVRL指标3.024。该结论适用边界受限于16 kHz去噪去混响语音增强任务与DNS合成及真实录音验证范围,尚未验证超分辨率与语义级修复等外推场景。原文未披露训练硬件与时长细节,仅给出 GPU 实测 RTF 与 40 ms 内算法时延设计。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决什么矛盾?

本文输入是真实环境中的退化语音,目标读者是刚进入语音增强的研究生,输出是 1 篇能复述方法与实验条件的中文解读。必须保留的信息包括任务定义、桥公式的数据生成方式、主干结构、一步推理设置、训练与测试数据来源、基线对照与实时率。论文研究的任务是联合去噪与去混响,也就是一段语音同时被加性噪声污染并叠加房间混响,需要恢复出干净语音。举例来说,会议室录音既有空调噪声又有墙面反射,例子仅用于理解任务,不代表论文测试了该房间。

中心矛盾是生成式薛定谔桥方法音质好但通常需要 10 步以上迭代,而判别式映射方法单步快却容易把中高频谐波抹平。论文提出薛定谔桥 Mamba,简称 SBM,希望训练时沿最优传输路径学习演化规律,推理时只做 1 次前向就重建。资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开,演示页链接本次也未能确认可达。

同输入同目标的已有路线如何划分?

按同输入、同目标、同运行阶段划分,已有工作可分为 3 类。第一类是经典薛定谔桥语音增强,以 SB-NCSN++ 为代表,把退化分布直接作为扩散起点,避免高斯先验带来的均值先验失配,推理时解逆向随机微分方程,通常要 10 步或 50 步。第二类是加速到一步的桥变体,包括一致性轨迹模型 SBCTM 与对抗桥 SB-UFOGen,前者用一致性建模约束轨迹上各点输出一致,后者引入对抗训练压缩步数,但主干仍多为较大的 NCSN++。

第 3 类是判别式与流匹配对照,包括 ZipEnhancer 这类双路径降采样增强器,以及同主干的映射基线 Mamba-base 与流匹配基线 FM-Mamba。论文的对照是有源的,SBCTM 用公开检查点,ZipEnhancer 在含噪集用公开检查点与公开增强结果,其余桥基线用相同数据重训。类别差异不能直接当同条件胜负,例如多目标训练的判别模型在对齐敏感指标上有天然优势,比较时要分开看感知指标与对齐指标。

为什么慢推理与抹平细节难以兼得?

慢推理的根源是桥方法把增强写成连续时间随机过程,训练学的是整条路径,推理要逐步求解逆过程,每步都要过 1 次大主干。一步截断若无额外约束,起点附近的估计误差会被放大。抹平细节的根源是纯映射回归在不确定频带倾向输出统计平均,中高频弱谐波最先被牺牲。论文的核心论点是训练范式要与主干归纳偏置对齐。白话说,桥过程是状态随时间演化,Mamba 也是隐状态随帧递推演化,两者在结构上都是上一步状态加当前输入决定下一步。

若主干是注意力这类无显式递推的结构,学习连续演化就需要更多容量。论文因此选择用桥轨迹做监督,用 Mamba 做载体,训练时看过路径上多个时刻的含噪状态,推理时从退化端一步跳到干净端。

一个样本如何走完从退化到干净的全程?

先沿一个 3 秒片段走全程。输入是退化波形与其短时傅里叶变换谱,记退化谱为 y,干净谱为 x。训练时随机采样时刻 t,按桥公式由 x、y 与高斯噪声 z 构造中间状态 xt,xt 既含插值均值又含随机扰动。xt 与时刻嵌入一起送入 Mamba 主干,模型输出估计的干净谱,再与真实干净谱算损失。推理时不再采样中间时刻,直接把时刻固定在逆过程起点,也就是对应退化先验的一端,把退化谱 y 1 次送入主干得到干净谱,最后逆变换回波形。图前导读如下,左半是训练与推理两条路径的对照,右半是主干内部从频率压缩到时间压缩再到全频带层的堆叠,箭头标明时刻嵌入的注入位置与残差拼接位置。

看图路径: 1. 先沿左侧训练分支看噪声 z、退化 y、干净 x 如何进入噪声调度生成中间状态 xt;2. 再看中间 Mamba 主干如何同时接收状态 xt 与时刻嵌入并输出到损失;3. 对照下方推理分支只用退化 y 与固定时刻 t 单步得到干净 x 的简化路径;4. 最后看右侧主干内部的频率压缩、时间压缩、残差拼接与全频带 Mamba 层位置

原论文 Figure 1:Overview of the SBM training-inference framework and the Mamba-based model architecture.

论文图 1。原论文 Figure 1:“Overview of the SBM training-inference framework and the Mamba-based model architecture.”。

该图显示训练分支用噪声调度把三者合成为 xt,时刻嵌入相加到条件分支,推理分支只有退化输入与固定时刻。主干中部可见多次重复的空间 Mamba 块夹着时间压缩与解压缩,底部经线性投影与全频带 Mamba 层再做频率解压缩。时刻嵌入在条件块中与跨频带特征相加,这是桥时刻信息进入状态递推的关键入口。小前瞻设计使算法延迟控制在 40 毫秒以内,为流式留出可能,但论文未报告真实流式系统的端到端延迟。

主干各模块分工是什么,为何这样堆叠?

主干表示统一用短时傅里叶变换谱,这是相关工作的通用做法,便于同时约束幅度与相位。白话解释,短时傅里叶变换是把波形切帧加窗后做频谱,得到时间与频率 2 维表示。英文为 Short-Time Fourier Transform,缩写 STFT,后文用 STFT。频率压缩先降低频维冗余,时间压缩降低帧率以扩大感受野,堆叠的 oSpatialNet-Mamba 块负责跨频带与帧间建模,线性投影做维度对齐,全频带 Mamba 层补充全局谱动态。条件块 oSpatialNet-Mamba-Cond 与普通块的区别是多一路时刻嵌入相加,时刻嵌入由高斯傅里叶模块从标量 t 编码而来。论文还提到选择性机制允许网络按当前状态自适应调整传输路径,这对应 Mamba 中输入依赖的矩阵参数。

薛定谔桥 × 最优传输轨迹: 薛定谔桥负责给出从退化语音分布到干净语音分布的随机演化规律,最优传输轨迹是这条规律的具体路径,论文用配对干净与退化样本按时刻 t 显式采样中间状态 xt,把起点终点之间的连续变化变成可训练的输入,组合意义是让模型不只看两端而是沿路径学习分布演化。

Mamba × 选择性状态空间: Mamba 负责按帧递推维护隐状态并输出增强谱,选择性状态空间是其参数随当前输入自适应变化的机制,分工是前者承担长程建模的骨架,后者决定何时记忆混响尾音、何时遗忘突发噪声,搭配理由是状态递推形式与桥过程的状态演化结构相似,组合后能把传输路径的动力学内化到递推参数中。

薛定谔桥 × Mamba: 薛定谔桥分工是训练时生成带时刻标签的中间状态 xt 作为锚点,Mamba 分工是在这些锚点上学习从含噪状态到干净目标的映射,搭配原因是桥需要一个能表达连续时间演化的主干,而 Mamba 的受控递推天然对应最优控制视角下的传输策略,组合意义是训练阶段蒸馏整条轨迹,推理阶段只走一步即可重建。

整体可理解为桥提供课程,Mamba 负责把课程内化为递推动力学,训练结束即把多步变换蒸馏到单步前向中。

训练输入如何构造,损失如何计算,推理为何是一步?

训练构造严格按桥公式执行。对每个批次,先取配对的干净 x 与退化 y,采样随机时刻 t 与标准复高斯噪声 z,按均值加方差形式合成 xt,其中均值是 x 与 y 的加权插值,权重与方差由方差爆炸噪声调度决定。原文未给出权重与方差的显式函数,只说明源自该调度实现,因此复现时需回到原文代码或对应桥文献核对具体调度表。监督来源是干净目标谱,模型做数据预测,即直接预测干净 STFT。

损失是四项之和,分别约束复数谱均方误差、幅度谱均方误差、多分辨率复数谱均方误差与多分辨率幅度谱均方误差,系数依次为 1000、1000、500、500。优化器用 AdamW,余弦学习率调度,初始学习率为 0.001。推理时固定时刻为 1,对应退化先验端,单次前向输出干净谱,不解随机微分方程,不迭代去噪。

数据预测损失 × 多分辨率约束: 数据预测损失负责让模型直接输出干净语谱图而非噪声或分数,多分辨率约束负责在不同窗长与频带下同时要求幅度和复数谱接近目标,分工是前者定方向,后者防过平滑与相位失真,搭配原因是单分辨率容易只保包络,组合后在幅度域和复数域、单尺度和多尺度上共同锚定细节。

需要指出的缺项是梯度是否在调度参数或时刻嵌入之外截断、时刻采样分布是否均匀、双讲场景占比之外的混合比例,原文未报告这些细节,不能从模型名推定。

数据、基线、指标与成本如何设置?

实验问题是复杂声学环境下的联合去噪去混响,以及纯去噪下的保持能力。训练数据用约 800 小时的干净语音,来源包括深度噪声抑制挑战干净集、中文普通话合成集与公开朗读集,噪声来自声音事件集、挑战噪声与自采环境噪声,混响来自实测脉冲响应库与房间声学仿真,信噪比覆盖零下 10 到 20 分贝,采样率统一为 16 千赫,训练时随机截为 3 秒。测试集有 4 个,分别是挑战真实录音、合成带混响、合成无混响与另一公开噪声集。

指标分两类,对齐无关的感知与内容指标包括信号质量、背景质量、总体质量、主观平均意见估计、非侵入质量、语义相似度与说话人相似度,数值越大越好;对齐敏感的传统指标包括可懂度与感知质量分数,数值越大越好,但生成式重建的细微错位会被重罚。基线覆盖可运行策略,包括多步与单步桥、一步一致性与对抗桥、同主干映射与流匹配变体、判别式增强器。成本用参数量与图形处理器上的实时率衡量,实时率越小越快。

下表整理训练与表示的关键配置,数字来自原文连续句,条件一致才能复现。

配置项取值说明
STFT 点数与窗长步长512 点,窗长 480,步长 160汉宁窗表示
训练切分与采样率3 秒切分,16 千赫在线切分
算法前瞻2 到 4 帧,延迟 40 毫秒内流式可行性设计

表前已提出比较问题是配置是否足以重放训练输入,公平条件是同一 STFT 与同一优化起点,指标方向不适用此表。表后解释是这些配置决定了输入维度与监督尺度,复现时先对齐 STFT 与损失系数,再调数据混合比例;代价是调度函数与采样分布缺细节,若直接照抄系数而忽略调度,中间状态分布会对不上。未评测边界包括多采样率与长时连续流的拼接策略。

主结果在什么条件下胜出,代价是什么?

比较问题是在相同测试集上,单步 SBM 是否在感知质量与效率上同时占优,公平条件是除公开检查点外其余桥基线用相同数据重训并取最优损失,指标方向是感知与对齐指标越大越好、实时率越小越好。下表取合成带混响集的代表行,列数满足宽表要求,数值保留原文精度。

测试条件模型参数量实时率总体质量感知质量分数
合成带混响单步桥 Mamba3.93,0.0048,3.367,1.9713.930.00483.367
合成带混响映射 Mamba3.61,0.0048,2.895,1.8953.610.00482.895
合成带混响10 步桥25.16,0.156,3.126,1.59725.160.1563.126
合成带混响判别增强器2.04,0.105,2.264,1.2272.040.1052.264

表后解释是单步桥 Mamba 在该混响集上总体质量与感知分数领先同主干映射与多步桥,同时实时率最低;代价是参数略大于映射基线,因时刻嵌入带来额外量。论文报告在真实录音上该方法包揽所有指标第一,在带混响合成集上领先信号、背景、总体、主观估计、语义、说话人、可懂度与感知分数。

限制是纯噪集上判别增强器在部分指标反超,例如感知质量分数与可懂度出现 3.419 对 2.825 量级的差距,论文解释为训练加入双讲保留策略导致单说话人测试出现策略失配,这属于设计选择而非单纯能力不足。另一个细节是单步桥直接截断通常退化明显,而本文单步仍保持质量,支持轨迹监督有效,但不能推广为每步都单调提升。

真实录音无干净参考,只能用非侵入指标,比较问题与公平条件同上,下表同为 5 列以上的整理。

测试条件模型信号质量背景质量总体质量非侵入质量
真实录音单步桥 Mamba3.4594.1063.1983.937
真实录音映射 Mamba3.2843.9742.9933.644
真实录音50 步桥3.3693.9393.0523.604
真实录音判别增强器3.3233.9183.0023.264

该表显示真实录音上单步桥 Mamba 全面高于映射、多步桥与判别基线,未胜出项需到纯噪集与另一公开集去找,例如语义分与可懂度被判别模型领先。图前导读如下,该频谱图用于验证结构先验是否被学到,左为输入,中为判别输出,右为本文输出,蓝色框标出需重点看的中高频区。

看图路径: 1. 先确认三块面板分别为输入、判别基线输出与本文方法输出;2. 再比较中高频区蓝色框内谐波横纹的连续性与清晰度;3. 观察低频共振峰在去噪后是否保留而不被抹平

原论文 Figure 2:Spectrogram comparison in a challenging real-world case.

论文图 2。原论文 Figure 2:“Spectrogram comparison in a challenging real-world case. SBM successfully reconstructs frequency harmonics, re- flecting learned structural priors.”。

该图可见输入被噪声淹没呈弥散红色,判别输出在框内偏平滑,高频横纹模糊,本文输出在对应框内重建出更连续的谐波条纹,低频共振峰也更清晰。论文据此称学到结构先验而非统计平均,这属于有限解释,支持感知指标的提升,但单样本图不能代表全集分布,需结合上表的大样本均值一起读。

换主干与换范式时增益来自哪里?

消融问题是固定一侧、只换另一侧时性能如何变化,公平条件是各主干按结构对应关系配置容量,训练范式分为映射与桥两种,测试条件为真实录音。比较问题包括桥是否在 3 种主干上都优于映射,以及 Mamba 是否在桥下优于注意力与长短时记忆网络。下表为 5 列以上整理,数值保留原文精度。

主干与范式参数量信号质量背景质量总体质量非侵入质量
注意力映射8.37M2.9753.8092.6762.358
注意力桥8.41M3.2213.9412.9273.24
长短时记忆映射17.38M3.0833.9042.7992.585
长短时记忆桥17.42M3.2893.9653.003.819
Mamba 映射3.61M3.2843.9742.9933.644
Mamba 桥3.93M3.4594.1063.1983.937

表后解释是桥在 3 种主干上一致优于映射,支持轨迹监督的有效性;Mamba 在桥下取得最高分且参数最小,支持其更适合内化演化动力学。代价与反例是注意力与长短时记忆参数更大却未胜出,说明容量不是决定因素;未评测边界是轨迹贡献的细粒度分解,论文明确留待未来工作,不能断言增益全部来自选择性机制。

映射训练 × 轨迹训练: 映射训练只用退化与干净两端做静态点对点回归,轨迹训练则用桥路径上的连续中间状态 xt 做监督,分工差异在于前者学一个直接去噪函数,后者学整条退化到干净的演化过程,搭配比较的意义是固定主干只换监督来源,从而验证性能增益来自训练范式而非单纯增大模型。

另一组对照是同主干下桥对比流匹配,论文报告桥在混响与真实场景优于流匹配变体,这支持桥目标在该数据配比下的优势,但可能与调度选择有关,待验证。

哪些结论尚未被验证,不能承诺什么?

论文直接报告的是 4 个测试集上的均值指标与图形处理器实时率,有限解释是谐波重建源于结构先验,未验证推测是选择性机制自适应参数化传输路径的因果链条,原文用控制视角类比,未做参数层面的因果干预,因此只能说可能与待验证。缺失证据不是技术错误,但不能承诺误判率、词错误率、端到端流式延迟与边缘端功耗得到改善,因为未测量这些量。

训练资源只给了优化器与调度,未报告卡数、时长与显存,推理开销只给了实时率与算法延迟,输出帧率与实际延迟需分开讨论。总体趋势不等于每组每步成立,纯噪集与另一公开集上判别模型在部分对齐敏感指标领先,就是明确的反例。相关性不等于因果,桥下 Mamba 最好不能直接推出 Mamba 在所有生成范式下最好。

复现先做什么,需要哪些信息条件?

复现先做数据与表示对齐。再做主干与时刻注入,最后做一步推理。第一步按原文准备干净、噪声与脉冲响应 3 类数据,信噪比覆盖零下 10 到 20 分贝,统一 16 千赫,STFT 用 512 点、汉宁窗长 480、步长 160,训练在线截 3 秒。第二步实现频率压缩、时间压缩、条件与普通空间 Mamba 块、线性投影与全频带 Mamba 层,时刻用高斯傅里叶编码后加到条件块,前瞻限制在 2 到 4 帧。第三步按桥调度由配对样本合成中间状态,用四项数据预测损失训练,系数为 1000、1000、500、500,优化用 AdamW 加余弦调度。

推理固定时刻到退化端,单次前向输出。还需补的验证包括调度函数的精确形式、时刻采样分布、双讲混合比例、统计显著性与真实流式延迟。开源状态上,本次未发现完成验证的资源,不得写当前可用或已公开,只能按缺项处理。

何时值得尝试这种组合?

当任务是强混响加噪声的真实录音增强,且推理预算只允许单步时,值得尝试桥轨迹训练加 Mamba 主干的组合,因为真实录音与带混响集上的感知指标与实时率同时占优。当任务是纯噪且评价看重对齐敏感分数,或测试要求单说话人分离而训练保留双讲时,应先调整数据策略或加入相位与感知目标,再比较判别方案。教学上记住两句话,桥把起点终点之间补成可学习的路,Mamba 把这条路记成递推的习惯,一步推理只是把习惯用 1 次。未来可向超分与语义级修复扩展,但需先补调度消融、显著性检验与流式实测,才能把效率优势落到可部署收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总