英文题目:Speech Enhancement Based on Drifting Models
会议身份:
conference:interspeech:2026:conference-paper-id:xu26d_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#生成模型 #高效推理 #语音 #语音增强
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Liang Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Diego Caviedes-Nozal:机构信息未能从会议 PDF 纯文本可靠映射
- W. Bastiaan Kleijn:机构信息未能从会议 PDF 纯文本可靠映射
- Longfei Felix Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Rasmus Kongsgaard Olsson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
语音增强需从带噪复数谱恢复干净语音与波形,难点在于单步判别映射易过平滑丢失细节而扩散类逆过程需数十步积分导致延迟瓶颈。漂移语音增强先由生成器将带噪谱或高斯先验映射为增强谱并经逆短时傅里叶变换得到波形,其输出直接作为语义表征的输入。冻结语义编码器将生成与干净音频投射为多层帧特征并划分为干净正集与生成负集,再以核加权均值偏移构造同时吸引向正集与排斥离负集的漂移场。生成器回归该漂移目标推动前向分布持续演化直至漂移为零的分布均衡,单步推理时直接映射取确定性去噪而条件生成采样新噪声以保留多样性,且该分布对齐原生支持非配对学习。相比扩散与流匹配约束轨迹积分的做法,该机制直接优化分布对齐因而无需迭代采样与刚性帧对帧回归,在单步条件下兼顾保真度与感知自然度。在DNS Challenge 2020盲测任务设置下,DriftSE的WV-MOS为2.65,高于ROSE-CD的WV-MOS 2.37。该结论适用边界受限于英语VoiceBank与DEMAND合成噪声训练及小规模真实录音泛化观察,跨数据集非配对PESQ回落至2.00且跨性别非配对省略参考指标等失败条件尚未验证跨语言与大规模噪声外推,训练硬件为A6000 GPU且单步推理开销为一次函数评估。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,为什么单步很重要?
这篇论文研究的输入是带噪语音,输出是增强后的干净语音。初学者可以这样理解任务:输入端同时有语音和噪声,目标端希望只保留语音。论文把输入记为带噪复数谱图,记为有频率维和时间帧的矩阵,把目标记为同样形状的干净谱图,最终要产生估计的干净谱图,再变回波形。
语音增强的老路线包括维纳滤波等统计信号处理,以及循环网络、长短时记忆网络和复数谱映射等判别式深度学习。论文指出判别式回归容易带来谱过度平滑和机械感,生成对抗网络能改善感知质量但训练不稳定,基于分数的扩散模型通过建模干净分布的对数密度梯度达到很好的效果。关键矛盾是扩散模型的逆过程需要数值积分高度弯曲的逆时轨迹,往往需要数十步离散化,函数求值次数很高,对实时应用构成延迟瓶颈。
因此论文要回答的问题不是能否去噪,而是能否不依赖迭代采样、1 次前向就完成高保真增强。它的选择是把去噪写成平衡问题:学习一个直接投影,让映射函数的前推分布与干净语音分布重合。理解后文的关键是记住 3 个必须保留的信息:源分布可以是带噪观测加扰动,也可以是高斯先验加条件;修正信号在冻结语义潜空间里计算;推理只做 1 次前向。
同类方法走了哪两条路,本文为什么不跟?
在扩散加速这个同目标下,论文把已有工作分成轨迹压缩和轨迹线性化两类。轨迹压缩是减少步数,例如用预测模型加少量扩散精修的混合做法、用对抗训练减少步数的扩散与生成对抗网络混合做法,以及把多步采样蒸馏成单步映射的一致性模型做法。轨迹线性化是把生成轨迹拉直,例如流匹配、精馏流和平均流做法,学习更直的传输路径或平均速度场。
论文的判断是这两类仍然基于轨迹。也就是说,它们在概念上依赖连续传输动力学,推理时必须离散化,用很少的步数准确近似这些路径仍然困难。教学上可以举一个例子帮助理解,但这只是例子:好比要求沿着一条弯曲山路开车,压缩是减少中途停车次数,拉直是修一条更直的路,但仍然要沿着路走;本文想做的是直接学会从起点跳到终点所在区域,不预设中间路线。
本文继承的是漂移模型这条新范式。按论文引述,漂移模型把生成看成训练时前推分布的演化,用核化漂移场让生成样本同时被真实数据吸引、被演化中的模型分布排斥,最小化漂移就让生成器的前推分布与目标数据对齐,在图像生成上已有较强结果。本文把它第 1 次系统地用于语音增强,并为语音选择了自监督语义空间和多层聚合。
要解决的矛盾是什么,成功标准如何定?
中心矛盾是质量与步数的矛盾:扩散模型质量好但需要多步,单步回归速度快但感知自然度不足。论文把成功标准定成 3 层。第一层是域内保真与感知,用配对指标看波形和可懂度是否接近参考,用非侵入式指标看没有参考时听感是否自然。第二层是泛化,用真实录音的盲测集检验分布投影是否过拟合到训练噪声。第 3 层是灵活性,能否在完全非配对的跨数据集和跨性别条件下仍然做分布匹配。
需要提醒初学者的是,不同指标回答不同问题。配对指标要求输出与特定参考对齐,非侵入式指标只要求输出落在干净语音的高密度区。一个模型可以在听感自然的同时波形不完全对齐,也可以在波形误差小的同时听感偏机械。后文的直接映射与条件生成之争,正是围绕这个差别展开的。
论文还明确了一个容易误解的点:它在常规实验中仍然使用配对音频以最大化重建保真,但方法本质是基于分布的。内部漂移只依赖当前批量内所有帧之间的潜相似度,而不是强制帧对帧回归。这为后文的非配对实验埋下依据。
漂移增强的全景:一个样本走完全程
先沿着直接映射走完一个样本。输入是带噪语音的短时傅里叶谱图,训练时再叠加受控的高斯噪声作为分布平滑器。映射函数 1 次前向产生去噪谱图,经过逆短时傅里叶变换得到增强波形。增强波形和干净参考波形分别送入冻结的自监督编码器,得到帧级潜特征。当前批的生成帧构成负集合,干净帧构成正集合。
对每个生成帧计算漂移场,训练目标是让生成器输出向漂移目标回归,从而让漂移幅度逐渐变小。推理时直接映射取确定性设置,不再注入噪声,1 次前向完成去噪。
下图是直接映射公式化的总体示意,值得按主路径和语义分支分开阅读。它把声学前向、潜空间构造和吸引排斥修正放在一张图里,初学者应先确认输入到输出的主箭头,再确认语义分支在哪里提供训练信号。
看图路径: 1. 先从左向右找到带噪谱图进入映射函数再经逆短时傅里叶变换到波形的主路径;2. 再看增强波形与干净参考分别进入冻结编码器形成生成帧集合与干净帧集合的位置;3. 对照中间标注的吸引与排斥箭头,确认修正方向如何作用在当前生成帧上;4. 最后看底部生成分布与干净分布的图例,确认训练目标是让两者重合而非记住轨迹
论文图 1。原论文 Figure 1:“Overview of the DriftSE framework (illustrating the Direct Mapping formulation).”。
从像素可见的内容看,该图左侧出现语义漂移处理模块,中间用虚线箭头标出帧级前推方向,右侧同时画出生成潜分布与干净潜分布。中间放大的帧示意里有一个当前生成帧,周围有多个生成邻居帧,并画出总漂移向量以及指向不同方向的吸引分量和排斥分量。底部图例把生成分布与干净分布分开标注,说明训练是让前者向后者移动。图中还按训练轮次展示分布从分离到重合的趋势,这与后文固定测试句的演化图形成呼应。
前推分布 × 分布平衡: 前推分布负责描述生成器当前能产生什么样本,它把简单输入经过映射函数推出来的全体输出看成一个分布;分布平衡负责判断训练是否可以停止,它要求漂移修正量处处为零。两者搭配的原因是生成器不去拟合单条去噪轨迹,只让前推分布整体向干净分布移动,组合后训练目标变成让修正量消失,推理自然是单步映射。
全景的要点是推理与训练解耦。推理只有 1 次映射,没有迭代精修;训练的全部复杂性都放在如何构造可靠的漂移场上。下一节再拆开漂移场的两个力和两种映射方式。
漂移场由哪两个力组成,两种映射如何分工?
漂移场的白话解释是每个生成样本处的修正向量,指向能减小生成分布与干净分布差异的方向。论文把它分解成两个相反的力。吸引项用核加权平均拉向干净数据,排斥项用核加权平均推离当前模型分布的高密度区。核是带温度参数的指数相似核,温度控制相互作用带宽。正负期望在实际中用小批量平均近似,正样本来自干净数据,负样本来自当前模型分布。论文强调把归一化项合并成联合期望后,自指的负样本项会相消,得到统一的表达式。
吸引力 × 排斥力: 吸引力负责把生成帧拉向干净参考帧的高密度区,它用核加权比较生成样本与干净正样本的相似度;排斥力负责把生成帧推离当前生成分布自己的高密度区,它用同样的核比较生成样本与负样本。两者搭配的原因是只吸引会塌缩到少数模板,只排斥会发散,组合成总漂移场后才能在训练中形成此消彼长的修正方向。
映射函数的两种形式分工不同。直接映射写成带噪观测加噪声扰动后的函数,扰动强度由参数控制;训练时取零就是严格确定性映射,取正值则平滑声学分布,有助于估计漂移场。条件生成写成以带噪语音为条件、从标准高斯噪声出发的函数,网络在每个分辨率层都接收带噪谱图作为条件嵌入,推理时每次抽新的噪声可以产生多样的增强输出。
直接映射 × 条件生成: 直接映射负责把带噪观测本身作为起点进行投影,它在训练时可加可不加高斯扰动,推理时取确定性输出;条件生成负责从高斯先验出发、以带噪语音为条件生成干净语音,它保留随机性以表达干净语音的不确定性。两者搭配的原因是同一套漂移机制可以接不同源分布,组合后论文能对照确定性保真与随机性感知的取舍。
初学者容易把注入噪声当成扩散的前向加噪,这是不准确的。这里的噪声不是为了定义一条必须反演的轨迹,而是为了让源分布更连续、让批量内的相似度估计更稳定。是否注入、注入多大,只影响训练时的分布形状,不改变推理单步的性质。
为什么不在谱图上算距离,要用什么编码器?
论文明确指出在时频域直接算漂移是次优的。原因是谱图欧氏距离会被高幅度谐波主导,而对语音可懂度很重要的低能量瞬态会被忽略。解决办法是把音频投影到语义潜空间再算漂移,并做多层潜监督,提供更丰富稳定的训练信号。
编码器选择自监督语音模型,论文实际用了大模型版本的语音表示模型和蒸馏小模型。选择理由是这些模型有明确的层级结构:浅层保留低层声学结构,深层编码音素和语义内容。实现上冻结编码器,把长度为采样点数的波形映射成帧级特征,帧移约 20 毫秒,感受野约 25 毫秒。对大模型聚合较深的 3 层,对蒸馏小模型聚合较浅的 3 层,各层等权重,并使用多个温度的指数核。
语义潜空间 × 多层监督: 语义潜空间负责提供感知上有意义的距离,它用冻结的自监督编码器把波形变成帧级特征,避免时频幅度主导距离;多层监督负责同时利用浅层声学结构和深层音素语义,它在选定层集合上分别计算漂移并加权聚合。两者搭配的原因是单层太抽象会丢细节、太底层又缺语义,组合后漂移场更稳定。
帧级漂移的具体做法是:对每个生成帧,在语音潜空间里实例化统一漂移公式,用多温度核综合吸引与排斥。基础漂移损失按原文思想是让编码后的输出向停止梯度的目标回归,目标是当前输出加漂移场;回归到固定目标会最小化漂移幅度,逐步把前推分布推向目标分布。再把该损失在选定层上聚合,就得到层次化语音结构的训练信号。
训练如何组织,哪些参数更新、哪些冻结?
训练要更新的是映射函数本身,论文用去掉时间嵌入的增强型生成网络结构,处理 16 kHz 音频,先做短时傅里叶变换再做谱压缩。直接映射的噪声水平从截断对数正态分布中采样,条件生成则把带噪谱图作为各级条件嵌入。需要冻结的是语义编码器,它只提供特征,不参与更新。论文明确报告优化器用权重衰减的自适应优化器,训练 100 轮,批量 16,学习率与权重衰减分别取给定值,硬件为单卡。未报告的内容也要指出:论文没有给出学习率调度、梯度裁剪、早停阈值和随机种子等细节,复现时需要自己固定并记录。
监督来源需要分清两部分。漂移损失的正集合来自干净帧,负集合来自当前批生成帧,属于分布对齐信号;论文在常规设置中还利用配对音频提高保真,属于实践选择而非方法必需。梯度路径按原文描述是回归到停止梯度的漂移目标,编码器分支不回传。重置时机方面,论文采用动态混合,每次把干净语音与多种噪声按随机信噪比即时混合,而不是使用固定混合好的训练集,这有助于防止过拟合到特定声学条件。
配对训练 × 非配对学习: 配对训练负责用同句子的干净参考提高重建保真,它让正样本集合与输入在内容上对齐;非配对学习负责只匹配分布而不要求帧对帧对应,它在当前批量内用潜相似度构造正负集合。两者搭配的原因是漂移目标本质是分布对齐,不依赖刚性回归,组合后模型既能在常规配对下训练,也能在跨数据集或跨性别的独立采样下训练。
非配对训练的组织方式是独立采样带噪与干净语音。论文做了跨数据集和跨性别两种设置:前者把带噪库语音映射到另一个挑战赛的干净目标,后者把混合性别带噪语音映射到受限的女性目标。跨性别任务本质上要求改变男性说话人特征,是更难的生成任务,因此论文在该设置下省略了需要男性参考的配对指标,只报告感知指标,这是合理的边界处理。
数据、划分、基线和指标如何保证可比?
数据方面,训练用语音库的干净语音和环境噪声库的噪声录音,训练时一万多条干净语句与十多种噪声类型动态混合,信噪比从 0 到 15 分贝的几个档位随机采样。评估用标准预混合测试集的八百多条语句,保证与前人可比;泛化评估用噪声抑制挑战赛盲测集的 300 条真实带噪录音,该集合没有干净参考,只能用非侵入式指标。
基线覆盖迭代与单步两类。迭代代表是多步扩散增强,单步或少步代表包括度量生成对抗网络改进版、通用分数增强、一致性蒸馏、薛定谔桥一致性轨迹和平均流增强等。论文特别说明蒸馏类基线用了辅助损失,因此在公平对照之外又加了一个同样使用辅助感知与波形损失的版本,避免把辅助损失的增益误算成漂移机制的增益。
指标按方向记住即可。配对指标包括语音质量感知评估、可懂度扩展指标和尺度不变信噪比,数值越高越好;非侵入式指标包括对比回归质量评估、噪声抑制平均意见分和基于自监督的平均意见分,同样越高越好。论文还报告函数求值次数,直接映射与条件生成都是 1 次,扩散基线需要数十次。实现细节中窗长、帧移、谱压缩、层选择和核温度都已给出,是复现时必须照抄的部分。
域内与真实录音的结果支持什么判断?
域内比较要回答的问题是:单步漂移能否在配对保真上接近多步扩散,同时保持自然度。公平条件是同一标准测试集,指标方向都是越高越好。论文报告直接映射达到较高的配对质量,条件生成在非侵入式感知指标上更强。下表把论文明确写出的关键数字整理成可核对的形式,重点不是逐行复述原大表,而是固定可运行策略之间的对照。
表前说明:下表比较直接映射与条件生成在同一测试集上的取舍,基线含义是论文中实际可运行的单步策略,指标方向均为越高越好,数值与单位保留原文写法。
| 条件 | 指标 | 直接映射 | 条件生成 | 比较对象 |
|---|---|---|---|---|
| 标准配对测试 | 语音质量感知评估 | 3.15 | 2.99 | 直接映射保真更高 |
| 标准配对测试 | 对比回归质量评估 | 4.08 | 4.33 | 条件生成感知更自然 |
| 噪声平滑训练 | 对比回归质量评估区间 | 4.08 | 4.15 | 注入噪声改善自然度 |
表后解释:上表的主要收益是单步也能同时给出可用的保真和感知,代价是两者最优点不在同一配置。直接映射在确定性训练下波形更准,条件生成用随机先验更好地表达干净分布的方差,因而感知更自然。需要就近指出未胜出项:论文承认蒸馏类方法在语音质量感知评估上报告了更高值,但那些方法用了辅助损失;当本文也加入同样的辅助损失后才能站在同一条件下比较,这说明单纯比较最高数字会误判机制贡献。
真实录音比较要回答泛化问题。下图先给出定性证据,再用数字表收束。它跟踪固定测试句在语义空间的帧分布演化,初学者应把它当作机制示意,而不是全集性能证明。
为理解分布对齐,先看固定测试句从早期轮次到后期轮次的密度等高线如何从带噪侧移向干净侧,再回到正文核对盲测集的定量结果。
看图路径: 1. 先按图例区分蓝色干净、红色带噪、绿色生成三组等高线与星形质心;2. 再从左到右按训练轮次观察绿色分布相对红色分布和蓝色分布的位置变化;3. 重点看最后一轮绿色质心与蓝色质心是否靠近,并注意绿色拖尾是否完全消失;4. 把该固定测试句的演化当作分布对齐的定性示意,不把它当作全测试集的定量证明
论文图 2。原论文 Figure 2:“Evolution of frame-level distributions in the DistilHuBERT semantic space for a fixed test utterance.”。
从像素可见的内容看,该图有 4 个按轮次排列的面板,分别对应训练早期、中期和后期。每个面板都有 3 组等高线和 3 个星形质心,图例把干净、带噪和生成分开。早期面板中绿色生成分布与红色带噪分布大面积重叠,并向下拖出额外分支;随着轮次增加,绿色分布逐渐收缩并移向蓝色干净分布,到最后一轮两者的质心非常接近,等高线高度重叠,但绿色下方仍留有小拖尾。这支持论文的说法:优化漂移场让模型抓住了干净分布的结构特征,但也提醒单句可视化不能推广到每条语句都同样收敛。
编码器、噪声注入和非配对各改变了什么?
第一个消融是潜编码器与层选择。论文报告只用最深语义层会变差,理由是高度抽象特征丢失了精细声学细节。多层漂移下,蒸馏小模型与大模型在感知质量上接近,但蒸馏模型在尺度不变信噪比上最好,因此被选为默认编码器。这支持多层监督的必要性,也说明参数更大不一定在该任务上全胜。
第二个对照是噪声注入。省略噪声先验的确定性映射保真更高,注入高斯噪声则平滑声学分布、改善非侵入式感知质量。论文把这描述为用边际波形精度换更自然生成的分布平滑,初学者应理解为适用条件的选择:如果目标分布窄或发生偏移,适当平滑可能更重要;如果要求波形严格对齐,则应保持确定性。
第 3 个分析是非配对学习。跨数据集映射到另一挑战赛干净目标时,非侵入式质量仍然较强,但无配对时的配对保真指标明显下降;跨性别映射到女性目标时感知分数进一步下降,且无法计算需要男性参考的配对指标。表前说明:下表整理泛化与非配对的代表数字,条件不同不能直接排名,指标方向仍是越高越好。
| 条件 | 指标 | 本方法 | 非配对跨数据集 | 非配对跨性别 |
|---|---|---|---|---|
| 真实盲测 | 对比回归质量评估 | 2.97 | 3.92 | 3.72 |
| 真实盲测 | 自监督平均意见分 | 2.65 | 3.61 | 3.40 |
| 跨数据集无配对 | 语音质量感知评估 | 3.15 | 2.00 | 未评测 |
| 训练成本 | 训练轮次与批量 | 100 epochs | 16 | 学习率 5 × 10−4 |
表后解释:上表支持的判断是分布匹配在非配对下依然成立,但代价清晰。跨数据集的非侵入式分数表明生成语音落在了干净区,配对分数下降表明它没有落在原句的准确位置;跨性别任务更难,因为模型被迫改变说话人属性。未评测边界也要写明:跨性别下没有女性参考可用于男性输入,因此省略配对指标不是遗漏,而是条件不成立。训练成本行说明该结果是在有限单卡预算下得到的,但论文未报告 wall-clock 时间和推理延迟,部署代价待验证。
哪些结论还不能下,缺了哪项验证?
首先是因果表述的边界。论文显示了漂移训练与分布靠近同时发生,支持分布对齐的解释,但单句可视化属于有限解释,不能证明每条语句、每种噪声都同样收敛。相关性不等于对所有条件的因果保证,推广到强混响、带宽缺失或多说话人时仍是待验证。
其次是成本与延迟的缺项。论文报告了 1 次函数求值的优势,也报告了训练轮次、批量、优化器和单卡型号,但没有测量实际延迟、实时率、内存占用和误判率。1 次前向不等于端到端延迟一定满足实时要求,因为短时傅里叶变换、编码器特征和谱压缩等开销仍需实测。训练资源与推理开销、输出帧率与实际延迟应分开讨论。
最后是指标的边界。自动指标不能当成人评,非侵入式高分不能保证特定说话人身份不变,非配对跨性别实验恰好说明身份可能被改变。论文在跨性别下主动省略配对指标是诚实的处理,读者不应把不同指标的差值放在同一列下比较,也不应把末轮单句结果推广为全程最优。
要复现应先固定什么,再跑哪组对照?
复现先做信息条件清单。数据用语音库干净语音加环境噪声库动态混合,信噪比档位固定;评估用标准预混合测试集和盲测真实录音,前者看配对指标,后者只看非侵入式指标。音频统一到 16 kHz,短时傅里叶变换与谱压缩按原文实现,编码器用冻结的预训练权重,层集合、等权重聚合和多温度核照抄。映射网络去掉时间嵌入,直接映射的噪声采样区间与对数正态参数固定,条件生成的条件嵌入位置固定。
第一组必跑的是确定性直接映射,作为保真基线;第二组是带噪声平滑的直接映射,检验感知是否提升而波形是否轻微下降;第 3 组是条件生成,检验随机先验是否带来更自然的输出。每组都要记录随机种子、混合序列和函数求值次数,否则单步优势无法归因。
关于可用性需要按证据写清:本次收到的证据中没有来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。如果后续要补验证,优先补 3 项:真实设备上的端到端延迟与内存、人工听感评估、以及窄分布或偏移目标下的噪声注入敏感性。区分代码开源、权重下载和系统可运行 3 件事,不要用论文提到预训练编码器就推定整个系统可一键运行。
何时值得尝试这种方法,如何一句话记住它?
当应用要求单步低延迟、同时希望保留生成模型的自然度,并且能接受波形不逐点对齐时,这种方法值得尝试。它特别适合已有较强自监督语音表示、想把感知距离写进训练目标的团队;也适合数据配对困难、只能独立收集带噪与干净语音的场景,因为它的目标本来就是分布对齐。
当任务要求严格保真、说话人身份不能变、或必须在极低算力下跑端到端实时时,则要谨慎。此时应先实测延迟与身份保持,再决定用确定性直接映射还是条件生成,必要时加入与基线相同的辅助损失后重比,避免把辅助损失的增益误判为机制增益。
一句话记忆是:用冻结语义空间里的吸引与排斥算出修正方向,让单步映射的前推分布整体搬到干净分布上,推理只走 1 次,训练的功夫全花在漂移场上。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

