英文题目:DiffVQE: Hybrid Diffusion Voice Quality Enhancement Under Acoustic Echo and Noise

会议身份:conference:interspeech:2026:conference-paper-id:lugo26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#扩散模型 #语音 #回声消除 #语音增强

评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Haljan Lugo:机构信息未能从会议 PDF 纯文本可靠映射
  • Ernst Seidel:机构信息未能从会议 PDF 纯文本可靠映射
  • Pejman Mowlaee:机构信息未能从会议 PDF 纯文本可靠映射
  • Ziyue Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Tim Fingscheidt:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本文处理免提通话中麦克风混合信号y(n)与远端参考x(n)到近端干净语音的联合声学回声控制与降噪,需在双讲下同时压制扬声器非线性回声与背景噪声并保留近端音质。先由条件网络输入麦克风谱Y与远端谱X并早期拼接,负责判别式抑制回声与噪声以输出粗净谱与语音条件C,再以前向扩散输入干净谱S按方差爆炸SDE加噪,负责构造扩散训练目标并将前一步条件C作为后续条件输入。最后分数网络以上一步粗估计为起点、以C为条件输入,负责执行单步噪声一致朗之万逆扩散以输出最终增强谱,相对DeepVQE等纯判别式方案以生成式精修恢复被过度抑制的频谱细节并避免多步采样。在合成验证集Dval双讲条件下,DiffVQE的PESQ为2.63,高于DeepVQE的PESQ 2.30。在合成验证集 Dval 双讲条件下 DiffVQE 取得 PESQ 2.63,超过同等重训 DeepVQE 的 2.30,DT Other 4.10 超过 3.83,但 DT Echo 4.65 略低于 DeepVQE 的 4.66,单讲远端 ST Echo 4.60 低于 4.72。结论仅适用于非因果离线增强与合成回声加 ICASSP 2023 混响盲测集,未验证因果流式、真实器件回声和大时延失配下的外推能力。复杂度方面 DiffVQE 约 5.13 M 参数、5.37 G FLOPS、单线程 RTF 0.185,明显低于 DeepVQE 的 5.29 M 参数、42.24 G FLOPS、RTF 0.317。为说明计算量与推理开销,原文以单线程硬件测得上述结果,延迟以RTF表征。

🔗 开源与复现资源

🧭 深度解读

免提麦克风里到底混了哪几路声音?

这篇解读的输入是论文正文与本次收到的 4 张官方原图像素,目标是让刚进入语音音频领域的研究生能复述方法、条件与代价。必须保留的信息包括任务定义、数据来源、训练配置、评价条件与可运行基线对照,输出是按学习依赖展开的技术解读。

免提系统的麦克风信号不是一路干净语音。白话说,远端传来的声音经本地扬声器放出,再经房间反射进入麦克风形成回声。本地说话人的语音经房间混响进入麦克风,再叠加环境噪声。论文把麦克风信号写成三项相加,即混响后近端语音加回声加噪声。

回声本身又来自远端信号先经过扬声器非线性,再与房间冲激响应卷积。理解这个三项叠加是后续一切方法的前提,因为系统必须同时利用麦克风信号和远端参考信号,才能区分哪部分该保留、哪部分该去掉。

声回声控制 × 语音增强: 声回声控制分工是压制经扬声器非线性和房间混响漏入麦克风的远端信号,语音增强分工是在保留近端说话人的同时抑制背景噪声与混响,搭配理由是免提麦克风信号同时包含近端混响语音、回声与噪声三项,组合意义是把有参考的回声对消与无参考的降噪统一为一个近端干净语音估计问题。

初学者容易把回声对消理解为把远端信号直接减掉。实际扬声器会引入非线性失真,房间会引入长混响与延迟。远端与麦克风之间还可能存在因果或非因果时延。传统做法先做线性对消,再加小网络做残余抑制。

纯判别式深度网络直接回归干净频谱或掩蔽,在高度非平稳噪声下容易产生失真,即语音细节被抹平或引入异常。生成式方法换了思路,即学习干净语音分布,再从带噪带回声观测出发重建频谱细节。论文要解决的矛盾正是双讲时激进压回声与保护近端之间的冲突。

判别式与生成式路线各自解决了什么?

同输入同目标的直接前作是微软的 DeepVQE。它是一个判别式语音质量增强模型,同时做回声对消、降噪与去混响。论文把它选为主要对照,不是用公开权重,而是用相同训练数据重训。

这一点对复述很关键。后文所有超过 DeepVQE 的说法,都建立在同数据同轮数重训的条件下。最终检查点按验证集全部指标的平均排名选择,这保证了比较的公平性。

同监督不同机制的参照是 SGMSE、StoRM、Universe++ 与 EffDiffSE。前者把分数匹配扩散引入语音增强,后者关注高效采样。论文明确说明这些工作大多针对降噪与去混响,很少用于回声对消。

有一项尝试把 StoRM 混合框架搬到回声任务,但论文指出其未讲清参考信号如何融合,且单步改造的数学表述不可复现。加之网络结构与私有数据限制了复现,因此 DiffVQE 定位为可复现的混合扩散回声模型。

相关工作必须按运行阶段区分。因果系统只能用过去与当前帧,非因果系统可以用未来帧。DiffVQE 允许非因果,所以不能直接与因果低延迟系统比延迟。论文的新颖点正是单步化与拓扑改造后,在性能、复杂度与尺寸上超过 DeepVQE。

论文把任务形式化成什么输入输出?

形式化输入是两路时域信号,即远端信号与麦克风信号。输出是增强后的近端时域语音。中间表示是短时傅里叶变换后的复频谱。

论文用 K 点短时傅里叶变换把两路信号变为频谱序列,帧索引与频点索引明确定义。条件网络同时吃这两路频谱,输出条件估计与供给分数网络的语音条件。分数网络再输出最终近端干净频谱,经逆变换回到时域。

举例说明如下。比如 1 次双讲片段同时有远端回声与本地说话,系统先看远端频谱知道回声大概形态。这只是一个教学例子,不代表论文报告了该片段的数值。

评价按 3 种条件组织,即双讲、单讲远端、单讲近端。双讲考核回声与近端保护的平衡,单讲远端主要考核回声是否压干净。单讲近端主要考核是否损伤近端,这种划分是理解后文表格的前提。

一个样本如何走完从麦克风到增强语音?

先沿一个样本走完全流程。远端信号一路送往扬声器播放形成回声路径,另一路经短时傅里叶变换得到远端频谱。麦克风拾取的叠加信号经短时傅里叶变换得到麦克风频谱。

条件网络接收这两路频谱,判别式地估计出近端干净频谱的初版。接着把该初版加上一定强度的高斯噪声作为扩散起点,同时把语音条件送入分数网络。分数网络估计分数方向,做 1 次修正得到最终频谱。

整个过程只做 1 次加噪与 1 次去噪,这就是单步的含义。下图是端到端免提系统总览,右侧是声学场景,左侧下方是信号处理链。中间两个大模块分别是判别与生成网络,箭头方向即数据流向。

看图路径: 1. 先沿顶部远端信号线看一路去扬声器一路经短时傅里叶变换去条件网络;2. 再看右侧绿色近端反射虚线与红色回声虚线及下方小车噪声如何汇入麦克风;3. 最后看粉色条件网络输出经加噪圈进入蓝色分数网络再经逆变换输出

原论文 Figure 1:Overview of our end-to-end hands-free system using a hybrid diffusion approach.

论文图 1。原论文 Figure 1:“Overview of our end-to-end hands-free system using a hybrid diffusion approach. Cond and Score networks are the discriminative and generative networks as utilized in [5].”。

从像素看,右上火柴人代表近端目标说话人,绿色虚线是近端语音经墙面反射后进入麦克风。红色虚线是扬声器输出经反射形成的回声,下方小车图标代表噪声源。中间粉色模块标为条件网络,同时接收远端与麦克风频谱。蓝色模块标为分数网络,接收条件估计加噪后的起点与语音条件,最左侧逆变换输出增强语音。理解这张图后,后续公式都是在描述条件估计如何得到、加了多大噪声、分数修正如何计算。

条件网络 × 分数网络: 条件网络是判别式估计器,分工是利用麦克风与远端频谱直接回归近端语音并输出语音条件,分数网络是生成式精修器,分工是学习干净语音分布的分数方向并补回频谱细节,搭配理由是可靠的初估计可把多步扩散压缩为单步,组合后新增作用是 1 次加噪加 1 次修正即完成增强。

条件网络与分数网络的骨干是什么?

两个网络共享类似的 U 形骨干,但输入输出配置不同。白话说,U 形网络先下采样压缩时频分辨率以扩大感受野。再经循环层建模长时依赖,然后上采样恢复分辨率并输出复频谱。英文名是 U-Net backbone with DSBlock and USBlock。

论文以 EffDiffSE 结构为起点,做了三处关键改动。第一,不在首末层用步长转置卷积,而是增设 1 对下采样块与上采样块。第二,把转置卷积换成子像素卷积以减轻混叠。第三,用远端与麦克风早期拼接,让条件网络承担稳健回声抑制。

早期融合 × 语音条件: 早期融合指在条件网络输入端把远端频谱与麦克风频谱拼接,分工是让网络尽早看到回声来源,语音条件指条件网络提供给分数网络的辅助特征,分工是在生成阶段提示近端内容,搭配理由是回声信息越早介入压制越彻底,组合意义是判别阶段的回声知识被显式传递给生成阶段。

下图是两个网络共用的拓扑,左侧黄色为下采样分支,右侧橙色为上采样分支。底部为重排加双向门控循环单元再重排的结构,顶部有拼接与卷积输出。该图是理解参数量与计算量差异的基础。

看图路径: 1. 先看顶部拼接框与输出卷积之间的红色跳连乘加圈;2. 再看左侧黄色下采样块与右侧橙色上采样块各重复五次的对称关系;3. 最后看底部重排加双向门控循环单元再重排的时间建模通路

原论文 Figure 2:Cond and Score DNN topology, details see Fig. 3.

论文图 2。原论文 Figure 2:“Cond and Score DNN topology, details see Fig. 3.”。

从像素看,顶部标有拼接字样的红框接收两路输入,经核尺寸 5 乘 3 的卷积进入重复 5 次的下采样块。底部经重排进入标有 9 倍通道数的双向门控循环单元,再经重排进入上采样分支。最右侧经输出 2 通道的卷积与顶部跳连的乘加圈汇合,蓝色虚线箭头代表噪声条件或语音条件的注入位置。初学者复述时要能指出,下采样块负责压缩频率维,上采样块负责恢复,循环层负责时间建模。

下采样块与卷积块内部如何传递条件?

进一步拆开每个块。条件网络与分数网络的差异主要体现在条件注入方式与输入输出通道上,而主体卷积结构一致。下采样块内部先过 1 个卷积块,再与输入残差相加。最后经步长卷积降采样,上采样块内部先经子像素卷积升采样。

上采样块随后与下采样来的特征相加,再过卷积块并与输入残差相加。卷积块内部是 2 次 3 乘 3 卷积,中间插入特征线性调制模块。白话说,特征线性调制就是根据条件对特征做缩放与偏置。

下图给出 3 个块的内部连接,加号圈均为相加,实线为特征主路,虚线为条件支路。该图说明条件不是只在输入给 1 次,而是在多尺度上反复注入。

看图路径: 1. 先看左上黄色下采样块内卷积块加残差再接步长卷积的顺序;2. 再看右上橙色上采样块内子像素卷积加两次相加的位置;3. 最后看下方粉色卷积块中两次卷积之间特征调制模块与加噪注入点

原论文 Figure 3:Building blocks of our approach in Fig. 2.

论文图 3。原论文 Figure 3:“Building blocks of our approach in Fig. 2.”。

从像素看,左上黄色框标注输出通道等于当前层通道数,内部卷积块左侧有噪声条件虚线注入。右上橙色框标注输出通道等于前一层通道数,内部卷积块右侧有语音条件虚线注入。下方粉色长框展示卷积块内部 2 次 3 乘 3 卷积之间夹着调制模块与加法圈,顶部还有红色与蓝色虚线分别回传。论文未报告拿掉某一路条件后的定量变化,因此不能推断哪一路更重要,只能说原文设计是多层注入。

单步扩散的目标损失与优化步骤是什么?

扩散部分采用方差爆炸随机微分方程。白话说,前向过程就是给干净频谱加越来越大的高斯噪声。反向过程就是学习一个指向干净分布的分数方向并逐步去噪。

论文把漂移项设为零,噪声方差随扩散时间指数增长,由最小与最大噪声水平控制。训练分数网络时,向干净频谱加已知方差的高斯噪声,再让网络预测该噪声对应的分数。推理时采用噪声一致朗之万动力学,用等距离散时间步迭代求解。

判别损失 × 分数匹配损失: 判别损失监督条件估计与最终估计相对干净目标的压缩复数均方误差,分工是保证幅度与相位接近真值,分数匹配损失监督分数网络输出相对注入高斯噪声的回归,分工是保证学到正确的分数方向,搭配原因是只用前者易丢失细节而只用后者训练不稳定,组合后以小权重系数联合优化两者。

总损失是三项相加,即条件估计误差、最终估计误差与小权重分数匹配损失。论文还引入预条件处理,让分数网络输入与目标具有单位方差并加入跳连。原文明确给出的超参数包括扩散时刻取 0.3,最小噪声 0.01,最大噪声 5。

优化过程用 8 秒随机裁剪、批量 16、500,000 步,学习率先暖机到 0.0008。保持到 250,000 步后再余弦退火到很小值,短时傅里叶变换用 512 点帧长、128 跳长。网络核尺寸为 3 乘 5,时间步长 1、频率步长 2,基础版通道为 11 到 50。

训练数据构造同样关键。为保证生成模型学到高质量目标,论文排除低质量语料,只用挑战官方训练划分。回声数据按已发表框架合成,但远端与近端用同房间配置的不同冲激响应分别卷积。训练时部分样本去掉近端或远端以显式学习单讲,部分样本用干声代替混响近端。论文未报告梯度截断细节,复现时应先按默认实现。

在什么数据基线与指标下比较才算公平?

验证集是类似合成但说话人与噪声库独立的集合,采用独立语音、噪声库与房间冲激响应。远端与近端用同房间的冲激响应卷积,测试集是公开含混响盲测集。

远端与麦克风之间存在因果与非因果延迟,论文先用广义互相关相位变换做非因果延迟补偿。基线是按相同训练数据与相同轮数重训的 DeepVQE,最终检查点按平均排名选择。硬件预算在单线程 CPU 上测实时率,同时报告参数量与浮点运算量。

双讲 × 单讲: 双讲指近端与远端同时有语音,最考验压回声时不损伤近端,单讲分为只有回声加噪声的单讲远端和只有近端加噪声的单讲近端,分工是分别考核回声抑制、噪声抑制与语音保持,搭配评价的原因是只看一种条件会掩盖双讲损伤,组合起来才能判断系统是否偏向某一端。

指标分 3 类。第一类是回声专用评估,估计双讲与单讲下的回声残留和近端质量。第二类是非侵入式总体评估,报告总体、信号与背景三项。第 3 类是侵入式指标,需要干净参考,包括语音质量、可懂度与音素相似度。

其中音素相似度越接近 1 越好,用于发现生成模型可能的幻觉内容。平均排名是对 3 个被比方法在所有条件指标上的名次平均,数值越小越好。资源状态方面,论文给出的演示链接本次可达,因此可以写当前已公开有可听示例。

受控验证集上收益与代价各是什么?

比较问题是,在相同数据与相同训练轮数下,单步混合扩散是否在保持回声抑制的同时提升质量与可懂度。公平条件是三者都在重训后的验证集上按双讲、单讲远端、单讲近端分别评价。指标方向均为越高越好,平均排名越低越好,复杂度越低越好。

下表整理验证集全部条件的关键数字,参数量、计算量与实时率一并列出以说明代价。该表达到五列宽度要求,条件列与指标列分开以避免混放不同条件。

条件指标DeepVQE 基线DiffVQE-S 小版DiffVQE 完整版
复杂度参数量5.29 M3.43 M5.13 M
复杂度计算量42.24 G4.32 G5.37 G
复杂度实时率0.3170.1720.185
双讲DT Echo4.664.634.65
双讲DT Other3.834.054.10
双讲PESQ2.302.502.63
双讲LPS0.690.730.75
双讲ESTOI0.600.650.68
单讲远端ST Echo4.724.624.60
单讲远端ST Other3.703.953.97
综合平均排名越低越好2.52.01.3

论文报告显示,DeepVQE 在双讲回声与单讲远端回声两项上领先,但三者都接近满分且差距很小。DiffVQE 完整版在其余多数质量与可懂度指标上领先,平均排名 1.3,小版 2.0,基线 2.5。代价方面的事实是小版仅需约一成计算量且实时率更低,完整版参数略小于基线。表后必须强调的反例是回声单项并未胜出,因此不能宣称全面超越,只能说多数语音质量与可懂度指标占优而回声项略低。

下图按信回比展开双讲性能,横轴为信回比,纵轴分别为 6 个指标,图例区分两种 DiffVQE、DeepVQE 与未处理。该图用于判断优势是否只在某个信回比点成立。

看图路径: 1. 先对照底部图例确认深蓝圆圈浅蓝方块红色星号黑色加号各代表谁;2. 再沿横轴信回比从负到正看六个子图纵轴指标的变化方向;3. 最后比较右上双讲回声子图与其他五个子图的曲线间距差异

原论文 Figure 4:Dval performance dependency on SER in DT.

论文图 4。原论文 Figure 4:“Dval performance dependency on SER in DT.”。

从像素看,除右上双讲回声子图 3 条模型曲线几乎重合在高位外,其余 5 个子图深蓝圆圈与浅蓝方块构成的曲线在整个范围内都位于红色星号之上。黑色加号的未处理在多数指标最低,但在双讲其他子图的低信回比端反而较高,原因是未处理完全没有损伤目标。完整版相对小版的优势在语音质量子图最明显,在可懂度与总体子图也有小幅领先。这支持论文的判断,即优势不是只在某个点成立,但总体趋势不等于每一步都成立。

盲测集与小版对照能否排除过拟合?

第二个比较问题是,验证集上的优势能否泛化到未见过的真实盲测集,以及缩小模型后收益是否还在。公平条件是三者都不接触盲测集参考,只用非侵入式回声与语音质量指标评价。指标方向越高越好,平均排名越低越好,训练成本单独列出。

下表整理盲测集结果与训练成本信息,该表同样达到五列宽度,条件列与指标列分开以保证比较口径清晰。训练批量与裁剪长度作为成本对照列入最后一行。

条件指标DeepVQE 基线DiffVQE-S 小版DiffVQE 完整版
双讲DT Echo4.644.614.62
双讲DT Other3.844.074.10
单讲远端ST Echo4.374.414.43
单讲近端ST Other3.934.254.26
单讲近端SIG3.313.423.43
单讲近端BAK4.034.054.07
综合平均排名越低越好2.672.171.17
训练批量 16 与 8 秒裁剪批量 16 与 8 秒裁剪批量 16 与 8 秒裁剪批量 16 与 8 秒裁剪

论文显示,盲测集上 DeepVQE 仍在双讲回声单项最高,但差距很小。DiffVQE 完整版在其余各项领先,平均排名 1.17,小版 2.17,基线 2.67。这支持泛化性判断,但限制是盲测集只能用非侵入式指标。

小版对照显示,即使参数与计算大幅压缩,多数指标仍超过基线,说明收益不完全依赖模型尺寸。论文未提供去掉分数网络或去掉远端融合的消融,因此不能说哪一部分贡献最大。这是明确的缺项,不是技术错误,复现时不应自行补因果解释。

哪些边界没有被测不能承诺什么?

首先,系统仍是非因果的。论文明确允许使用未来帧,这与许多扩散增强研究一致。但这意味着不能直接承诺低延迟实时通话可用,换硬件后实时率也会变化。

训练资源、推理开销、输出帧率与实际延迟是分开的量,不能把计算量下降直接等同于端到端延迟下降。其次,回声单项在验证集上并未胜出,盲测集双讲回声也仍是基线最高。论文的表述是接近干净参考的高位差距,这是一个未胜出项。

第三,侵入式可懂度与幻觉指标只在合成验证集上有干净参考,盲测集没有对应验证。因此不能承诺盲测集上也没有幻觉,自动指标也不能当成人评。第四,延迟补偿依赖广义互相关相位变换的预处理。

若实际部署中延迟估计失败,性能可能下降,但论文未测量该失败条件。最后,相关性不是因果,平均排名领先支持混合扩散值得尝试。但不能证明单步扩散必然在所有房间、所有非线性与所有噪声下都更好。

要复现应先准备什么按什么顺序检查?

复现先做数据管线。按论文说法,基础合成流程来自已发表代码框架,再引入扩散改造与更多样高质量语音。具体动作是获取官方训练划分的语音与噪声,排除低质量语料并做质量过滤。

用镜像源法生成房间冲激响应,对远端与近端分别卷积。加入扬声器非线性、信回比与信噪比配置,混入挑战赛合成训练集。训练时按比例构造单讲与干声样本,验证集用独立语音噪声与房间库合成。

接着核对模型与训练。短时傅里叶变换、噪声水平、损失权重、通道数、批量与学习率都已列出。应逐项冻结为相同值再跑,基线也要在同一数据上重训相同轮数。

检查顺序建议先跑通条件网络的判别估计并观察回声是否下降,再加入单步加噪与分数修正。最后测参数量、浮点运算与单线程实时率,演示页当前可用可先听示例。论文声明生成式 AI 仅用于部分段落文字润色,不影响方法复现。

何时值得尝试这种混合单步扩散?

当任务同时包含可参考的回声与不可参考的噪声,且允许非因果处理时,这种先判别后生成的单步结构值得尝试。它的分工清晰,条件网络利用远端参考做稳健抑制。分数网络补回判别方法容易抹掉的细节,单步设计把多步采样成本压到 1 次修正。

论文在受控与盲测两类数据上都显示多数质量与可懂度指标领先,且计算量与实时率低于重训基线。这是最强证据,但前提是同数据同轮数重训的公平比较,换数据后结论待验证。

当系统必须因果低延迟运行,或回声单项必须做到最高,或需严格保证无幻觉时,则不应直接采用本文配置。此时更稳妥的是先用判别基线保证回声上限,再在小版混合结构上补因果约束。

初学者复述全文可用一句话收束。用两路频谱做条件初估计,加噪 1 次后用分数网络修正 1 次,再逆变换输出。数据要高质量过滤与双房间卷积合成,评价要分双讲与单讲。结论是多数项领先但回声项略低且仍非因果,还需补因果版本与主观听感验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总