英文题目:Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

会议身份:conference:interspeech:2026:conference-paper-id:mboungou26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #扩散模型 #鲁棒性 #音视频 #语音增强

评分:6.4/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Colombe Mboungou:机构信息未能从会议 PDF 纯文本可靠映射
  • Mostafa Sadeghi:机构信息未能从会议 PDF 纯文本可靠映射
  • Jean-Eudes Ayilo:机构信息未能从会议 PDF 纯文本可靠映射
  • Romain Serizel:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音视频语音增强需从含噪短时傅里叶变换混合信号中恢复目标语音,低信噪比与非平稳噪声下纯音频先验易失效,而唇动等视觉线索虽具噪声鲁棒性,却在现有交叉注意力融合中缺乏显式对齐约束而被弱化。方法先以前向随机微分方程扰动干净语音并以加权去噪分数匹配损失训练条件分数网络逼近条件分数,再用特威迪公式从扩散状态估计干净语音。接着以可训练音频编码器与冻结视觉编码器抽取归一化嵌入并计算双向InfoNCE损失,最后以时变权重将对齐项与生成损失联合优化而推理保持原后验采样不变。与仅做局部条件重构的AV-DiffUSEEN基线相比,该机制显式约束全局音视频实例判别,促使去噪估计与视觉内容兼容。在TCD语音加DEMAND噪声匹配条件评测下,本模型的SI-SIR指标为29.5,高于AV-DiffUSEEN基线的SI-SIR指标24.30。该结论受限于批量为8的小批量对比、无真实多说话人与强混响验证,且遮挡视觉时性能塌缩更大表明其对视觉依赖更强。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么低信噪比最难?

这篇解读的输入是论文正文提供的文字、表格与两张官方原图像素,目标是让刚进入语音与音频方向的研究生能复述方法与实验条件。必须保留的信息包括任务定义、基线名称、训练与测试数据构成、损失组合方式、关键超参数、评价指标方向和主要数字,输出是 1 篇可核对的技术解读,不做超出证据的效果承诺。

语音增强要解决的问题很具体。麦克风收到的带噪语谱图可以写成干净语音加干扰噪声再加一个很小的高斯项,任务是在短时傅里叶变换域恢复干净语音。白话说,输入是一段被环境噪声淹没的语音加一段同步的唇动视频,输出是听起来更干净、干扰更少的语音波形。英文名是 audio-visual speech enhancement,缩写 AVSE。

低信噪比之所以难,有两个原因。第一,声学观测本身信息不足,非平稳噪声与语音在时频上高度重叠,仅靠音频很难区分。第二,生成式方法虽然能补出合理的语音,但如果视觉条件没有真正起作用,模型会退化为只依赖音频先验,在噪声很大时产生幻觉或残留干扰。论文正是围绕视觉条件是否被充分使用展开。

为此需要先建立学习依赖。先理解无监督扩散增强的推理框架,再理解视觉融合的局限,再看对比损失如何接入训练,最后看实验如何证明视觉确实被更多使用了。后续各节按这个顺序展开,教学用的举例会明确标为例子,不引入无来源的数值。

已有路线如何分工,本文站在哪一条线上?

按同输入、同目标、同监督方式划分,已有工作大致有 3 条线。第一条是判别式增强,直接学习带噪到干净的映射,代表是卷积循环类方法,在匹配条件下很强,但对未见噪声泛化需要大量成对数据。第二条是纯音频扩散生成增强,例如 SGMSE+,先学干净语音分布,再以后验采样方式约束生成,优点是对噪声的假设更灵活。第 3 条是音视频增强,把唇动作为噪声鲁棒的补充信息,监督式代表是 FlowAVSE,无监督代表是 AV-UDiffSE+ 与本文基线 AV-DiffUSEEN。

本文站在第 3 条线中的无监督分支上。它的运行阶段与监督方法不同。监督方法在训练时就见过带噪与干净配对,增强时 1 次前向即可。无监督扩散方法训练时只见干净语音加视频,测试时才见到带噪语音,通过迭代后验采样与噪声模型更新完成增强。因此不能把 FlowAVSE 这类监督模型与无监督模型在失配数据上的数字直接理解为同条件胜负,训练时见过的数据与目标不同。

与对比学习的关系也需要准确定位。CLIP 与 CLAP 说明跨模态对齐目标能学到可迁移表示,但它们通常是独立预训练阶段。本文的不同在于不另起预训练阶段,而是把对比目标直接放进分数模型的优化过程,推理时的后验采样算法保持不变。这是一个训练期改动、推理期不变的设计。

基线融合缺了什么,为什么重建好不等于对齐好?

基线 AV-UDiffSE+ 与 AV-DiffUSEEN 的融合方式是交叉注意力。白话说,交叉注意力就是让音频分支的每一层去查询视觉特征,按相关性加权后融入重建。英文是 cross-attention fusion。这种机制允许模型选择性利用视觉线索,但优化目标是每一步的局部重建误差,没有显式要求音频估计与视觉在全局嵌入空间中一致。

论文指出一个具体风险。当音频信号本身已能给出较强先验时,模型可能欠利用视觉信息,因为只靠音频也能把训练损失降下去。举例来说,这就像做题时只用自己擅长的公式也能得分,就懒得再看题干给的另一条提示。例子仅为帮助理解,不是论文的实验结论。

因此本文要验证的问题是,在扩散预训练中显式鼓励音视频对齐,能否加强跨模态融合,且不改变推理算法。判断标准不是参数更多,而是遮挡视觉后性能是否下降更多、低信噪比与跨数据集条件下干扰抑制是否更好。

方法全景:一个样本走完输入到两个损失

先沿一个样本走完全程。输入是一段扩散中间时刻的加噪语音谱 st、扩散时间 t,以及说话人唇动视频序列 V。V 先经过冻结的 AV-HuBERT 视频编码器,再经过可学习的线性投影层得到与条件空间匹配的序列 v。分数网络以 st、t 和 v 为输入,输出分数估计,用于去噪分数匹配损失。同时,用特威迪公式从当前分数一步估计干净语音,再分别编码为音频嵌入与视觉嵌入,计算对称 InfoNCE 对比损失。最终训练损失是生成损失加时间门控与轮次权重的对比损失。

下图是理解该流程的关键,读者应先看主路径再看对比支路如何汇合。

看图路径: 1. 先沿左上加噪语谱图进入分数模型的箭头,确认主路径输出为分数估计并连向生成损失;2. 再看下方视频帧经视频编码器、线性层和平均池化得到视觉嵌入的支路;3. 比较中间干净语音估计经音频编码器得到音频嵌入后与视觉嵌入在对比损失处汇合的位置;4. 注意火焰与雪花标记区分训练时更新与冻结的模块

原论文 Figure 1:Audio-visual score model with contrastive alignment.

论文图 1。原论文 Figure 1:“Audio-visual score model with contrastive alignment.”。

上图显示分数模型在上、对比分支在下。上方蓝色块是类 U-Net 的 NCSN++M 主干,黄色 Fusion Block 表示注入视觉条件的交叉注意力位置,输入的加噪语谱图经过编码融合后输出分数估计并连向生成损失。下方左侧是干净语音估计进入可训练音频编码器得到音频嵌入,左下是视频帧进入冻结视频编码器、再经可训练线性层与平均池化得到视觉嵌入,两路在紫色对比损失节点汇合,再与生成损失汇成总损失。火焰标记表示训练时更新,雪花标记表示冻结,这种分工保证语义表示稳定而适配层与音频分支可以学习对齐。推理时只保留上方分数先验与后验采样,对比分支不再使用,因此推理算法不变。

组件如何分工:编码器、投影与池化各做什么?

音频侧的动作很明确。对特威迪估计得到的干净语音估计,用一个可训练的 ResNet-18 音频编码器编码为向量 ha。这个编码器只在训练时使用,推理增强时不调用。它的作用是把估计语音的声学内容映射到可对比的嵌入空间,梯度来自对比损失并与 U-Net 联合优化。

视觉侧的动作分 3 步。第一步用冻结的预训练 AV-HuBERT 编码器编码视频序列,参数不更新,目的是保留已学好的视觉语音表示。第二步用可学习的线性投影层加偏置把视觉特征映射到条件空间,该序列既送入分数网络的交叉注意力,也在时间维平均池化后得到最终视觉嵌入 hv。第 3 步的平均池化把变长视频序列压缩为单个向量,以便与音频向量做点积相似度。

音视频语音增强 × 无监督扩散后验采样: 音视频语音增强的分工是利用唇动等不受噪声污染的视觉线索补充声学信息,无监督扩散后验采样的分工是先在干净语音上学一个生成先验、推理时再结合带噪观测做贝叶斯后验采样,二者搭配的原因是前者提供条件信息、后者提供不需要成对带噪训练数据的推理框架,组合意义是把视觉条件直接写进先验分数函数,使增强时既能生成合理语音又能受观测约束。

交叉注意力融合 × 对比对齐损失: 交叉注意力融合的分工是在分数网络每一层让声学特征查询视觉特征、实现局部逐帧条件重建,对比对齐损失的分工是在批次内拉近配对音频估计与视觉嵌入、推远非配对组合、施加全局一致性约束,二者搭配的原因是只优化重建误差不能保证跨模态表示真正对齐,组合意义是用全局判别目标迫使模型在去噪估计中保留与唇动兼容的信息。

分数网络 × 特威迪公式估计: 分数网络的分工是近似加噪语音在各扩散时刻的条件对数密度梯度,特威迪公式估计的分工是利用当前分数一步反推出干净语音的后验均值近似,二者搭配的原因是对比损失需要一个可编码的干净语音对象而不能直接对噪声很大的中间状态算语义相似度,组合意义是把生成路径上的中间量转化为可供音频编码器和 InfoNCE 使用的估计量。

相似度计算前对两个嵌入做单位范数归一化,再除以温度系数。温度在实验中取 0.1,批量大小取 8。对称 InfoNCE 在批次内把配对样本的相似度推高、非配对推低。论文从互信息角度解释为提高两种表示的统计依赖,但明确写的是促进跨模态一致性并常被解释为互信息下界的替代目标,不是直接测量了互信息值。

训练如何加权:何时引入对比项,何时关掉它?

总损失写成生成损失加时变权重与轮次权重的乘积再乘对比损失。轮次权重随训练轮数从 0 逐渐增加到设定值,论文最终选择对比权重为 3000,预热期为 100 轮,即前 100 轮只训练生成目标,之后再引入对比损失。时间权重按扩散时刻门控,只在 t 不大于 0.3 的早期去噪步施加对齐,大于 0.3 时置零。理由是只有在噪声较小、特威迪估计比较可靠时,对比信号才有意义,越接近收敛越让生成目标主导。

这种设计的实际含义是动态平衡。对比权重太小几乎不起作用,太大则让判别目标主导优化,损害声学保真。论文在第 3.3 节明确讨论了两种失败模式。一种是对比项过加权,模型优先跨模态一致而弱化分数学习,导致语音质量下降。另一种是把视觉嵌入换成随机向量,此时对比信号无信息,可能被忽略或导致退化对齐,减少有意义的音频变化。后续消融用权重扫描与随机视觉的思想验证了这种权衡。

非负矩阵分解噪声模型 × 期望最大化推理: 非负矩阵分解噪声模型的分工是用低秩非负矩阵乘积描述干扰噪声在时频域的方差结构,期望最大化推理的分工是交替执行干净语音后验采样和噪声参数乘性更新,二者搭配的原因是扩散先验只管语音长什么样、观测似然需要一个显式的噪声解释,组合意义是在推理时不重新训练先验也能适应未知噪声。

互信息下界 × 生成与判别权衡: 互信息下界的分工是从理论上解释 InfoNCE 是在提高音频与视觉表示的统计依赖,生成与判别权衡的分工是指出权重过大或视觉信号无意义时会损害声学保真或导致退化解,二者搭配的原因是不能把对比损失当成无条件有益的正则项,组合意义是要求用预热和时间门控把对齐作用限制在可靠区间。

需要指出的缺项是,原文没有报告优化器类型、学习率、总轮数与硬件耗时,也没有给出分数网络与音频编码器之间梯度的完整截断说明。复现时只能确定视频编码器冻结、线性层与音频编码器及 U-Net 联合从零训练,不能从模型名称推定其他实现细节。

实验条件:数据、基线、指标与超参数如何对齐?

训练数据是 TCD-TIMIT,在受控录音室采集的正面人脸与高质量音视频干净语音。测试分两种条件。匹配条件是 TCD-DEMAND,用 TCD-TIMIT 语音混合 DEMAND 环境噪声,特点是说话人与视觉环境基本匹配、噪声类型未见过。失配条件是 LRS3-NTCD,用 TED 与 TEDx 视频中的 LRS3 语音混合 NTCD 噪声,特点是说话人、视觉与声学环境都未见过,录制条件不受控。两种测试的输入信噪比均为负 5 分贝与 5 分贝。FlowAVSE 在 TCD-DEMAND 上以负 10、0、10 分贝训练,因此对它而言噪声数据集是匹配的,比较时需注意训练信噪比网格并不完全相同。

基线包括 3 类。音频无视觉的 AO-DiffUSEEN,视觉条件的 AV-DiffUSEEN,以及监督生成的 FlowAVSE。评价指标分 3 组方向都是越高越好。SI-SDR 衡量整体重建质量,SI-SIR 衡量干扰抑制,SI-SAR 衡量增强引入伪影的程度。PESQ 估计感知语音质量,取值范围为负 0.5 到 4.5,STOI 与可懂度相关,取值 0 到 1。论文用验证集 SI-SIR 做网格搜索选择对比权重与预热时长,最终取权重 3000、预热 100 轮、温度 0.1、批量 8,并沿用 AV-UDiffSE+ 的数据预处理以保证可比性。

关于代码与资源,论文正文写有 GitHub 链接,但本次解读未完成对该链接的超文本传输安全状态验证,因此不能声称代码当前可用或已公开,只能记录论文给出了链接这一事实。复现前需自行确认可达性与版本。

主结果:干扰抑制与重建提升来自哪里?

比较问题是,在相同测试语音与噪声混合下,加入对比对齐的模型是否在干扰抑制与整体重建上超过视觉基线,且感知质量不下降。公平条件是同为无监督扩散后验采样推理,指标方向均为越高越好。下表按输入信噪比拆分匹配条件,先看低信噪比是否获益更大。

条件指标AV-DiffUSEEN本方法方向
负 5 分贝输入SI-SDR10.113.3越高越好
负 5 分贝输入SI-SIR21.227.8越高越好
负 5 分贝输入SI-SAR12.1213.7越高越好
5 分贝输入SI-SDR17.018.7越高越好
5 分贝输入SI-SIR27.431.2越高越好

上表显示主要收益在干扰抑制与低信噪比重建。在负 5 分贝下,本方法比基线高出约 6 分贝的 SI-SIR 与约 3 分贝的 SI-SDR,PESQ 从 2.94 提高到 3.0,可懂度也有小幅提高。在 5 分贝下 SI-SIR 仍高约 3.8 分贝,但其余指标差距缩小,说明输入相对干净时,贡献主要在干扰抑制而非感知细化。代价是这种提升依赖视觉,遮挡视觉后下降更大,见消融节。

跨数据集的平均结果进一步支持泛化判断,但需注意不同指标行为不一致。下表同时列出匹配与失配平均值,并保留音频基线以确认视觉本身的作用。

测试条件指标AO-DiffUSEENAV-DiffUSEEN本方法
TCD 加 DEMAND 平均SI-SDR10.7013.6016.0
TCD 加 DEMAND 平均SI-SIR17.0024.3029.5
TCD 加 DEMAND 平均PESQ3.173.283.28
LRS3 加 NTCD 平均SI-SDR5.837.408.10
LRS3 加 NTCD 平均SI-SIR8.9515.018.60

上表报告的趋势是,本方法在匹配条件提升约 5 分贝 SI-SIR 与 2.4 分贝 SI-SDR,感知指标与基线持平。在完全失配的 LRS3 加 NTCD 上仍提升约 3.6 分贝 SI-SIR 与 0.7 分贝 SI-SDR。未胜出项是失配条件下的 SI-SAR,本方法为 9.50,略低于音频基线的 10.00 与视觉基线的 9.68,说明干扰抑制的收益伴随一定的伪影代价。监督的 FlowAVSE 在匹配时 SI-SDR 达 17.80,但在失配时跌至 3.12,论文用此支持无监督扩散在分布变化下更稳健的判断,该判断限于这 2 个数据集,不能推广为所有噪声都成立。

权重与视觉遮挡:多大的对齐才合适?

本节回答两个反证问题。第一,对比权重是否越大越好。第二,模型是否真的更依赖视觉。下图扫描权重从 0 到 10000 的影响,是判断权衡的关键证据。

看图路径: 1. 先确认横轴为对比损失权重,纵轴为以分贝为单位的增强性能;2. 再区分三条曲线分别对应干扰抑制、伪影抑制和整体失真指标;3. 观察权重从零增大到中等值时三条曲线先上升、过大后下降的倒 U 形趋势

原论文 Figure 2:Effect of the contrastive loss weight β0.

论文图 2。原论文 Figure 2:“Effect of the contrastive loss weight β0.”。

上图横轴为对比损失权重,纵轴为以分贝计的性能。3 条曲线分别为整体失真、伪影抑制与干扰抑制,其中干扰抑制曲线位置最高、对权重最敏感。可见从 0 增加到 3000 左右时三者同步上升,超过 5000 后开始回落,到 10000 时明显低于起点。这支持论文的解释,即权重过小影响有限、过大则对比目标主导优化并损害重建,最佳折中在 3000 附近。该结论来自验证集 SI-SIR 选型,不能理解为每一步扩散或每个样本都单调成立。

视觉遮挡实验在推理时去掉视觉输入。报告显示,在 TCD-DEMAND 上基线 SI-SDR 下降约 21 分贝,本方法下降约 43 分贝。PESQ 的绝对下降为基线 0.85 对本方法 1.56,可懂度为 0.28 对 0.61。论文将此解读为对比训练鼓励了更强的跨模态耦合,使去噪更有效地利用视觉。这是一种有限解释,因为更大的下降既可能表示更好地利用了视觉,也可能表示对缺失条件的鲁棒性变差,未测量误判率与延迟时不应承诺实际部署收益。

线性投影层的消融显示,该层在匹配条件下影响不大,但在失配条件下每项指标都有差异,例如 SI-SDR、SI-SIR 与 SI-SAR 均提高约 1 分贝,PESQ 提高约 0.03。这支持保留该适配层的选择,但论文只报告了 LRS3-NTCD 上的数字,未报告匹配条件的完整对照表,因此不能量化其在匹配时的确切作用。

边界与未验证之处:哪些结论不能直接推广?

首先是评价边界。论文只报告了客观指标,没有人类听音评价,不能把 PESQ 与 STOI 的持平或小幅提高直接等同于人耳感知的同等提升。SI-SDR 数值相同也不代表不同数据集下的听感相同,因为聚合对象与噪声分布不同。百分点与相对百分比含义不同,解读时应只用分贝差描述 SI 类指标的变化。

其次是成本缺项。原文未报告训练时长、显存占用、推理步数与实时率。对比分支增加了训练时的音频编码器与相似度计算,但推理时不使用,因此训练开销与推理开销应分开讨论。在没有延迟与计算量测量的情况下,不能声称该方法降低了部署成本。

最后是条件限制。对齐只在扩散早期施加,且依赖可靠的唇动视频与冻结 AV-HuBERT 表示。如果视频缺失、遮挡严重或为随机向量,对比信号可能无信息甚至有害。论文用讨论指出了这种失败模式,但没有给出随机视觉下的完整增强数字,因此该风险是待验证的推测,不是已测量的定量结论。

复现先做什么,需要哪些信息条件?

复现应先固定基线。按 AV-UDiffSE+ 的数据预处理流程准备 TCD-TIMIT 训练集,用相同短时傅里叶变换参数与 NCSN++M 主干训练 AV-DiffUSEEN,确认在 TCD-DEMAND 与 LRS3-NTCD 上的基线数字后再加入对比分支。不要跳过基线直接训练本方法,否则无法判断提升来自对齐还是实现差异。

关键超参数按原文保留。对比权重取 3000,预热 100 轮,温度 0.1,批量 8,时间门控阈值为 0.3。视频编码器保持冻结,只训练线性投影层、音频 ResNet-18 与分数 U-Net。验证阶段用 SI-SIR 选择权重,而不是用测试集直接调参。测试时保留 DiffUSEEN 的期望最大化后验采样与非负矩阵分解噪声更新,推理阶段不加载对比分支。

还需补的验证包括三项。第一,报告多次随机种子的均值与离散度,因为后验采样本身有随机性。第二,测量不同信噪比下的完整五指标,而不仅是平均值。第三,记录训练与推理耗时及步数,以便判断额外训练开销是否可接受。由于本次未能确认代码链接可达,复现前需自行核对论文给出的仓库地址与依赖版本。

何时值得尝试,一句话如何记住它?

当增强系统已有视觉输入但怀疑模型没有真正使用它,尤其在低信噪比与跨数据集条件下干扰残留明显时,值得尝试这种训练期对比对齐。它不改变推理算法,适合已部署无监督扩散后验采样的团队做增量改进。反之,如果视频经常缺失或质量不可控,或训练预算不允许额外的编码器与权重搜索,则应谨慎,因为该方法会放大对视觉的依赖。

记住它的方式是,交叉注意力负责局部借用视觉,对比损失负责全局对上号,时间门控与预热负责只在估计可靠时对号。论文直接报告的是干扰抑制与重建的提升,有限解释是视觉利用更强,待验证的是随机或缺失视觉下的行为与真实听感收益。后续工作可补充人类评价、缺失模态鲁棒性与开销测量,才能形成完整的部署判断。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总