英文题目:AV-FlowSep: Audio-Visual Target Speaker Separation via Flow Matching

会议身份:conference:interspeech:2026:conference-paper-id:tipaksorn26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #Transformer #高效推理 #音视频 #音视频语音分离

评分:7.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Pattara Tipaksorn:机构信息未能从会议 PDF 纯文本可靠映射
  • Wayupuk Sommuang:机构信息未能从会议 PDF 纯文本可靠映射
  • Kwanchiva Thangthai:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音视频目标说话人分离需从含竞争说话人与环境噪声的混合波形中借助目标人脸视频恢复干净语音,难点在于声学歧义大且跨域泛化难。先由视觉时序编码器以人脸视频帧为输入抽取目标唇动与外观特征,输出视觉条件Fv,再将该Fv与混合梅尔谱My及插值梅尔谱一同输入基于DiT的向量场估计器,负责回归混合指向干净的直线位移并输出预测向量场,最后将该向量场经欧拉法求解常微分方程得到估计干净梅尔谱,并将其送入Vocos声码器重建为目标波形。与需多轮去噪的扩散式生成方法不同,该方法以最优传输条件流匹配直接回归混合指向干净的位移,理论上支持极少步采样并降低采样开销。在VoxCeleb2-AudioSet语音噪声场景评测下,AV-FlowSep的MCD为4.400,低于AVDiffuSS的MCD 12.761。该结论适用边界受限于双人混合与加性噪声英文口语,尚未验证多说话人、强混响与实时因果约束,基于全脸条件的身份捷径在跨域时仍会引发目标混淆。训练在NVIDIA A100硬件上以1000轮与批量8完成,模型以53.6M计算量与单步推理开销实现分离,但原文未报告推理延迟与吞吐实测。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/CAI-NECTEC/AV-FlowSep — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么要看脸?

本文的输入是两部分同时给定的。第一部分是混合语音波形,记为长度为时间的原始信号,其中混有目标说话人、干扰说话人或环境噪声。第二部分是目标说话人的人脸视频,帧率为每秒 25 帧,裁剪为 112 乘 112 的灰度人脸序列。目标是从混合波形中只恢复目标说话人的干净波形,而不是把所有声源都分开。初学者容易把这个任务理解为只要把声音丢给模型做降噪或分离就行,但原文强调的难点在于鸡尾酒会效应:当两个人的频谱与音色接近,或信噪比在负 5 到正 5 分贝之间剧烈变化时,仅靠声学混合很难判断哪一句属于谁。

为此作者引入视觉线索。白话说,视觉线索就是目标说话人的嘴唇运动节律、面部外观及其与语音在时间上的对应关系。英文是 visual cues。它的作用不是直接提供声音,而是提供身份与内容约束:嘴张合的时刻对应浊音与爆破音的出现,面部外观帮助区分性别与身份,时间对应帮助模型在重叠段决定每 1 帧该保留还是抑制。原文把这条路线称为视听目标说话人分离,英文是 audio-visual target speaker separation。学习依赖上,必须先接受任务定义是按人定向提取,而不是盲分离出两路再选一路,否则后文的交叉注意力条件、混淆率定义都无法理解。

视听目标说话人分离 × 视觉线索: 视听目标说话人分离负责从混合波形中只取出目标说话人的干净语音,视觉线索负责告诉模型目标是谁以及嘴唇何时如何动,二者搭配的原因是纯音频在噪声或同性双人混合下身份与内容歧义大,视觉提供与音频互补的时间对应与身份信息,组合后模型能先锁定人再按唇动对应关系分离出对应声学细节。

本解读的输入是论文正文证据与两张官方原图像素,目标是让研究生能复述方法与实验条件,输出是 1 篇可核对的技术解读。必须保留的信息包括数据划分、混合信噪比范围、特征维度、模型配置、推理步数、评价指标方向与关键数字。本文只讲论文实际研究的单目标提取任务,教学例子会明确标为例子,不添加无来源的效果数值。

已有路线分几类,各自卡在哪里?

原文把近期视听分离方法分为确定性方法与生成式方法两大类。确定性方法英文是 deterministic approaches,代表是 VisualVoice 与 AV-MossFormer2,直接从混合估计干净语音或时频掩膜。它们的优点是可懂度强,在表 1 的语音-语音任务上 AV-MossFormer2 的宽带语音质量与整体感知分往往最高。但原文指出它们倾向于产生过平滑的频谱图,平均掉了自然语音的细粒度细节。白话说,就是为了最小化平均误差,模型输出了模糊的平均脸谱,听感发闷。

生成式方法英文是 generative approaches,代表是 AVDiffuSS 与 DiffSep,用扩散模型从隐空间生成干净语音,能产生多样且高质量的样本。但原文指出两点代价:一是容易产生不希望的伪影,二是需要多步迭代精修,典型是 30 步,限制了实际推理效率。纯音频基线如 SepFormer 则被用来对照视觉增益,原文报告它在噪声下退化明显。相关工作的对照逻辑是同输入同目标同运行阶段比较:都是以混合音频加目标视频为输入、以目标干净波形为输出、在相同测试混合上运行,而不是把类别差异直接当胜负。本文的定位是用条件流匹配保留生成式感知质量,同时把传输路径拉直以实现少步推理。

要解决的具体矛盾是什么?

中心矛盾是高质量与少步数难以兼得。判别法一步输出但谱过平滑,扩散法质量好但要 30 步迭代且参数与计算开销大。作者把问题重新表述为条件传输问题:不再从高斯噪声出发去噪到干净语音,而是把起点直接设为混合梅尔谱,把终点设为干净梅尔谱,学习一条从混合到干净的直线路径。举例说明,假设某帧混合谱是目标与干扰的叠加,传统扩散要从纯噪声经 30 次修正慢慢雕出该帧,而本文希望网络直接预测该帧应该朝哪个方向搬多远,一步就搬到位。

这个表述带来两个可验证的预期。第一,如果直线路径成立,1 步欧拉更新就应接近 5 步与 30 步扩散的质量。第二,如果视觉条件有效,在语音-噪声与跨数据集条件下应比纯音频与扩散基线更稳。原文贡献也围绕这三点组织:单步高质量、更小训练数据下的域内可比与噪声下更优、主导与弱势说话人之间更均衡的分离。这些都留待实验节用数字核对,不能仅凭动机采信。

沿一个样本走完全流程需要几步?

先沿一个样本走完输入到输出。输入是混合波形与目标人脸视频。音频侧经短时傅里叶变换与梅尔滤波得到 100 维对数梅尔谱,记为混合谱。视频侧经视觉前端得到时间视觉特征,记为特征矩阵。训练时还有配对的干净梅尔谱作为终点,推理时没有。

中间件是一个基于扩散变换器的向量场估计器,英文是 Diffusion Transformer,缩写为 DiT。它同时接收内插梅尔谱、混合谱、视觉特征与时间步,输出预测向量场。最后常微分方程求解器沿预测方向把谱从混合端推向干净端,得到估计干净梅尔谱,再经 Vocos 声码器合成 24 千赫兹波形,评测时重采样到 16 千赫兹计算指标。

条件流匹配 × 扩散模型: 条件流匹配负责学习从源分布到目标分布的时变向量场并沿常微分方程直接传输样本,扩散模型负责经由多步去噪从噪声逐步恢复数据,二者搭配的理由是扩散路径弯曲且需约 30 步迭代,而流匹配可构造混合到干净谱的直线最优传输路径,组合意义在于本文保留生成式的高感知质量,同时把推理压缩到 1 步或 5 步。

下图是全文总览,读图前先明确对象与方向:底部有两个谱输入与一路人脸视频,中部是堆叠的变换器模块与归一化线性层,顶部是谱估计与波形输出,箭头一律自下而上。

看图路径: 1. 先沿底部两种梅尔谱经拼接符号进入 DiT 模块的主路径向上看;2. 再看左侧目标说话人视频经视觉编码器以 Fv 进入 DiT 的侧路位置;3. 接着确认顶部预测向量场经 ODE 求解器得到估计干净谱再进声码器的输出链;4. 对比输入混合谱与输出估计谱在图中的上下对应关系

原论文 Figure 1:AV-FlowSep architecture.

论文图 1。原论文 Figure 1:“AV-FlowSep architecture.”。

该图显示底部混合梅尔谱与内插梅尔谱经拼接符号进入 DiT 模块,左侧时间步与视觉编码器特征作为条件侧向注入,中部经层归一化与线性层得到预测向量场,再经 ODE 求解器向上得到估计干净梅尔谱,右侧声码器把谱转为波形。这 1 像素细节支持上文的样本 walkthrough:音频主路负责搬运谱能量,视觉侧路负责指明搬运方向,声码器负责谱到波形的最后一步。需要注意推理起点是混合谱加小噪声,而不是纯噪声,这是与标准流匹配的关键区别。

视觉编码器与变换器块各自算什么?

视觉时间编码器英文是 visual temporal encoder,采用 TalkNet 主动说话人检测的视觉前端,包括 3 维卷积、残差网络 18 与视觉时间卷积网络。输入是 25 帧每秒的灰度人脸,输出是时间视觉特征,维度为视频帧数乘特征维。它捕捉的是唇动动力学与外观的时间演变,而不是单帧身份向量。音频表示是 100 维对数梅尔特征, hop 长度为 256,采样率为 24 千赫兹。DiT 的输入是把内插谱与混合谱沿通道维拼接,从单通道特征变为双通道,再线性投影到 384 维隐空间。堆叠 12 层、6 头注意力的 DiT 小型配置,总参数量为 53.6M,对照扩散基线的 60.2M。

扩散变换器 × 交叉注意力: 扩散变换器负责作为向量场估计器对拼接后的音频表征做自注意力建模与时步调制,交叉注意力负责以音频令牌为查询、以目标说话人视觉特征为键和值注入唇动与外观信息,二者搭配的原因是仅靠音频自注意力无法区分谁是目标,组合后每个音频帧都能按时间对应检索到相关视觉帧,从而实现按人定向的谱变换。

每个 DiT 块内部按自注意力、交叉注意力、前馈 3 段组织。时间步经正弦编码与多层感知机预测缩放与偏置参数,通过自适应层归一化注入,英文是 Adaptive Layer Normalization,缩写为 AdaLN。视觉信息经交叉注意力注入,音频令牌为查询,视觉特征为键和值。每个块包含 AdaLN 调制的自注意力、交叉注意力与带残差的前馈网络。

梅尔频谱图 × 声码器: 梅尔频谱图负责把 24 千赫兹波形经短时傅里叶变换与梅尔滤波压缩为 100 维对数特征作为传输起点与终点,声码器负责把估计出的干净梅尔谱再合成为波形,二者搭配的原因是在紧凑谱域学习比在复谱域学习复杂度更低、采样更快,组合后流匹配只管谱间直线搬运,波形相位与细节重建交给 Vocos 完成。

下图是单个 DiT 块的内部连接,读图前先确认底部有 3 个入口:音频特征、时间步、视觉特征,顶部是单一出口,中间 3 组残差加号构成主干。

看图路径: 1. 先从底部音频特征经 AdaLN 进入多头自注意力的主干向上追踪残差环;2. 再看底部时间步经 MLP 产生三组缩放与偏置分别调制三个 AdaLN 的位置;3. 接着确认中间多头交叉注意力右侧接入视觉特征分支的汇合点;4. 最后观察顶部前馈网络与两处残差相加后的输出方向

原论文 Figure 2:Diagram of the DiT Block

论文图 2。原论文 Figure 2:“Diagram of the DiT Block”。

该图可见底部时间步经多层感知机分出 3 组调制参数分别控制 3 个 AdaLN,底部视觉特征经另一多层感知机进入中间的多头交叉注意力,音频主干自下而上依次经过自注意力、交叉注意力与前馈,每段都有残差旁路。这种像素结构对应正文描述:时间步控制归一化的尺度与偏移以感知传输进度,视觉分支只在交叉注意力处汇合以保持时间对应,残差保证深层堆叠仍可训练。

训练时如何构造内插样本并计算损失?

训练目标是条件流匹配损失。先解释符号与输入:t 是从 0 到 1 均匀采样的标量时间,混合谱为起点,干净谱为终点,噪声为标准高斯,固定小常数为扰动幅度。内插样本构造为起点与终点的线性加权再加小噪声,即 t 时刻样本等于 1 减 t 乘混合谱加 t 乘干净谱加噪声项。对应的条件向量场是干净谱减混合谱,是与时间无关的常向量,几何意义是从混合点直线指向干净点的箭头。网络要拟合的正是这个箭头,输入包括内插谱、混合谱、视觉特征与时间步,输出是预测向量。

损失是预测向量与真实差值向量之间的平方误差对时间与数据分布取期望。原文未报告视觉编码器是否冻结、声码器是否参与梯度、以及各组件学习率是否分别设置,因此不能从模型名称推定冻结或端到端。监督来源是配对的混合与干净梅尔谱加目标视频,重置时机是每步重新采样 t 与噪声。优化器为 Adam,学习率为 1 乘 10 的负 4 次方,指数滑动平均衰减为 0.999,批量为 8,在英伟达 A100 上训练 1000 轮,按每轮抽 50 个验证文件计算的平均宽带语音质量选最优检查点。

训练集为 400,000 条混合,开发集为 30,000 条,混合信噪比在负 5 到正 5 分贝均匀采样。缺项是视觉前端的预训练权重是否更新、声码器训练数据与冻结状态,复现时需按开源仓库核对,不可假设。

数据、协议、指标与基线如何保证可比?

数据与协议按原文交代。训练与域内评测用 VoxCeleb2,零样本跨数据集评测用 LRS2,两者均源自网络视频,覆盖多说话人与多声学条件。LRS2 专用于不微调的零样本测试,以模拟未见说话人与录制环境。两种混合场景:语音-语音是两个不同说话人按已有划分协议混合,语音-噪声是干净语音与 AudioSet 非语音噪声混合。两种场景信噪比都在负 5 到正 5 分贝均匀采样。

评测集在 2 个数据集的每种场景各构造 6000 条混合。基线包括纯音频 SepFormer、判别式视听 VisualVoice 与 AV-MossFormer2、扩散式 AVDiffuSS,所有结果均用公开预训练权重得到。

指标分无参考与有参考两类。无参考用 DNSMOS,报告语音质量、背景噪声与整体质量三项,分数越高越好。有参考用宽带语音质量与梅尔倒谱失真,前者越高越好,后者越低越好。模型在 24 千赫兹下经 Vocos 输出,评测前重采样到 16 千赫兹。原文明确提醒声码器压缩与相位估计可能引入轻微失真,因此两类指标需同时报告,不能只看一侧。

实现上视觉为灰度人脸视频,音频为 100 维特征,变换器为 12 层小型配置,推理步数为 1 步与 5 步,欧拉法步长为总时长除以步数。硬件预算只报告了 A100 与训练轮数,未报告单步延迟与实时率,因此不能把步数少直接等同于延迟低。

主结果在什么条件下成立,代价是什么?

比较问题是:在相同混合信噪比与相同评测集下,1 步流匹配能否在感知质量与失真上匹敌多步扩散与判别式强基线。公平条件是各方法均用公开权重在 VoxCeleb2 域内与 LRS2 零样本的 4 组场景上评测,指标方向为 DNSMOS 三项与宽带语音质量越高越好、梅尔倒谱失真越低越好。下表整理域内与跨数据集的语音-语音与语音-噪声关键数字,保留原文精度与裸值写法,单位按表头与正文交代理解。

条件指标混合未处理AVDiffuSS 30 步AV-MossFormer2 判别式AV-FlowSep 1 步
VoxCeleb2 双人混合宽带语音质量1.8532.5033.3412.751
VoxCeleb2 双人混合梅尔倒谱失真11.69715.9504.0545.985
VoxCeleb2 加噪声宽带语音质量1.9202.4793.0812.952
VoxCeleb2 加噪声梅尔倒谱失真10.85312.7618.7464.400
LRS2 双人混合宽带语音质量1.7091.4752.2432.404
LRS2 双人混合梅尔倒谱失真12.00916.2548.7877.276
LRS2 加噪声宽带语音质量1.8421.1442.3102.824
LRS2 加噪声梅尔倒谱失真11.54612.5059.9904.190

表后解释需要同时讲收益与代价。在 VoxCeleb2 双人混合上,AV-MossFormer2 因更大训练数据在感知与语音质量上最高,AV-FlowSep 域内可比但未全面超越,支持数据效率的说法但不支持已最优。相对 AVDiffuSS,AV-FlowSep 以单步与 53.6M 参数取得更高宽带语音质量与更低失真,支持直线路径带来少步高效的判断。在语音-噪声与 LRS2 零样本上,AV-FlowSep 整体质量最高且失真最低,支持背景抑制与跨域稳定的结论。未胜出项是域内双人混合的绝对感知分仍落后于 AV-MossFormer2,负结果是扩散基线在跨数据集上失真显著升高而本文仅轻微退化。限制是总体趋势不等于每组每步都成立,1 步与 5 步差异小但仍需按场景核对。

主导与弱势说话人是否被均衡对待,混淆率说明什么?

本节回答两个特有细节:按能量主导划分的恢复均衡性,以及按面部条件划分的说话人混淆。测的是在 VoxCeleb2 双人混合中把混合内信噪比更高者记为主导说话人、更低者记为弱势说话人,分别计算宽带语音质量与梅尔倒谱失真及其差值,差值越小表示对强弱越均衡。同时在 LRS2 双人混合上计算混淆率,定义为输出与干扰参考的失真小于与目标参考的失真即判为混淆,混淆率越低越好。下表保留原文分组与精度。

分组与模型主导语音质量弱势语音质量差值主导失真弱势失真混淆率
同性女女 SepFormer2.872.240.637.2712.00未报告
同性女女 AV-MossFormer23.463.020.454.184.6533.90%
同性女女 AV-FlowSep2.762.460.306.146.2812.60%
跨性别 AV-FlowSep2.802.590.215.935.69未报告
唇部 VisualVoice2.271.600.678.5410.070.11%

表后解释要区分直接报告与有限解释。直接报告的是 AV-MossFormer2 绝对语音质量最高但主导与弱势差距明显,AV-FlowSep 绝对值略低但差距更小,跨性别混合整体高于同性别混合。支持的判断是本文对信噪比不均衡更不敏感,分离更均匀。反例是仅看绝对值会误以为本文全面领先,实际上是以小幅绝对损失换均衡。混淆率上,仅用唇部区域的 VisualVoice 低至 0.11%,用全脸的 AV-FlowSep 为 12.60%,AV-MossFormer2 高达 33.90%,支持面部条件更依赖训练期身份与外观线索而非鲁棒音视对应的解释,但这属于有限解释而非因果证明,仍是待验证的权衡。未评测边界包括 3 人以上混合与遮挡唇动,原文未给出数字。

哪些结论不能推广,缺了哪些验证?

首先是指标冲突需要标注。原文表头、图注或算术在个别处存在表述粘连,例如混淆率段落与参数段落的换行断裂,但数字本身在表格与正文可交叉核对,本文按表格裸值引用,不自行四舍五入或补单位。其次是声码器失真:原文明确说基于声码器可能引入压缩与相位估计失真,因此有参考指标可能低估真实分离能力,复现时应同时听感抽查与报告无参考指标,不能只报宽带语音质量。

未测量的量不能承诺改善。原文未报告误判率的人工听感、单步实际延迟、显存占用与输出帧率,因此不能把 1 步直接写成实时或低延迟,只能说步数少支持计算高效,还需补延迟实测。相关性不是因果:面部条件与高混淆率同时出现,但不能断定全脸必然导致混淆,还需控制唇动遮挡、光照与身份重叠的消融。分布外推广仅验证了 VoxCeleb2 到 LRS2 的单向零样本,未验证反向迁移、多语言、强混响与多人重叠。训练资源仅给出 A100、1000 轮与批量 8,未给出总时长与碳足迹,部署成本需另测。

要复现先做什么,需要哪些配置与检查点?

复现起点是确认资源状态。官方仓库链接当前可用,状态码为 200,地址为代码证据中的仓库,可按仓库说明下载代码与权重。第一步按原文重建数据:用 VoxCeleb2 构造 40 万训练与 3 万开发混合,语音-语音按已有划分协议,语音-噪声混 AudioSet 非语音噪声,信噪比负 5 到正 5 分贝均匀采样,评测在 2 数据集四场景各 6000 条上进行。第二步重建特征:视频取 25 帧每秒灰度人脸裁剪 112 乘 112,经 3 维卷积加残差网络 18 加视觉时间卷积得到视觉特征,音频取 24 千赫兹 100 维对数梅尔特征,hop 长度 256。

第三步重建模型:DiT 小型配置 12 层 6 头 384 维,输入为内插谱与混合谱拼接,时间步经 AdaLN 注入,视觉经交叉注意力注入,损失为预测向量与干净减混合差值的平方误差,优化器 Adam 学习率 1 乘 10 的负 4 次方,滑动平均 0.999,批量 8,训练 1000 轮并按 50 个验证文件的平均宽带语音质量选点。第四步重建推理:起点为混合谱加小噪声,用欧拉法按步长更新 1 步或 5 步,再经 Vocos 合成并重采样到 16 千赫兹评测。先跑 1 步与 5 步对照,再跑跨数据集零样本,最后复算主导与弱势差值与混淆率。若权重与代码版本不一致,以论文原表头与裸值为准,不自行换算百分比。

何时值得尝试这个方法?

当任务是单目标定向提取、且能稳定拿到目标人脸视频时值得尝试,尤其在语音-噪声与跨域部署中,本文显示出更低失真与更稳的整体质量。当只有纯音频、或人脸频繁遮挡缺失时,不应直接套用,因为视觉缺失下的回退策略原文未评测。教学上应记住三句话:起点是混合谱而非噪声,方向是干净减混合的直线,条件是唇动时间对应加外观身份。常见误解是把少步等同于无损,把跨数据集稳定等同于任意域都稳,把全脸条件等同于一定更好,原文用混淆率与域内落后的数字否定了这 3 种简化。

还需补的验证包括实际延迟与显存、人工听感的误判率、多人遮挡下的鲁棒性,以及视觉编码器冻结与否对混淆率的影响。总体判断是:AV-FlowSep 用条件流匹配把生成式质量与判别式效率折中到一个可部署的点上,代价是面部身份捷径与声码器失真仍需后续工作缓解。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总