英文题目:Multi-View Based Audio Visual Target Speaker Extraction

会议身份:conference:interspeech:2026:conference-paper-id:yang26m_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #鲁棒性 #音视频 #语音 #目标说话人提取

评分:7.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Peijun Yang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhan Jin:机构信息未能从会议 PDF 纯文本可靠映射
  • Juan Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Ming Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音视频目标说话人提取以混合语音与目标说话人唇部视频为输入,输出目标语音波形,难点是推理时常见非正面视角与头部转动导致视觉线索退化。本文提出多视角张量融合框架,先用短时傅里叶变换编码混合音频并用预训练唇读网络提取各视角唇动嵌入,再经插值对齐与共享长短时记忆网络建模时序,接着对视角对做增1外积与投影平均得到视角不变视觉上下文,最后与音频特征送入TF-GridNet分离并经逆变换重建。与正面矫正或简单相加注意力融合不同,该机制显式建模视角间乘性交互并允许训练用3视角而推理复制单视角补齐,从而在单相机场景下补偿连续姿态变化。在MEAD单视角测试集下,MVTF-GridNet的SI-SDR为15.718 dB,高于GridNet的SI-SDR 15.089 dB。该结论仅在MEAD中性情感与-10 dB至10 dB合成混合范围内验证,未检验真实连续转头、情绪与强混响外推。模型增加约0.326 M参数与约1.074 G FLOPs,原文未披露训练时长与部署延迟。

🔗 开源与复现资源

  • 代码相关资源:https://b23ca07a.github.io/MVTF-Gridnet/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

要解决的语音问题是什么?为什么只用正面人脸不够?

输入是包含目标说话人与干扰说话人的单通道混合语音,目标是从混合中恢复目标人的干净波形。论文研究的是视听目标说话人提取,也就是用与音频同步的唇部视频作为线索来指引分离,不需要预先登记目标人的声纹。这种路线的前提是视觉与语音在发音动作上同步,即使声学噪声很大,唇动的时间结构仍然可用。

必须保留的信息是目标身份的时间对齐线索。音频编码给出混合频谱,视觉编码给出唇动嵌入,二者按时间对齐后融合,再由分离器估计目标频谱并重建波形。输出是目标说话人的估计波形,评价看波形失真、感知质量与可懂度。

只用正面人脸的问题在于真实场景里人会转头,相机也可能在侧面。常用数据集多为正面采集且缺少姿态标注,用正面训练的模型在非正面测试时会退化。论文把姿态变化视为可利用的互补信息,而不是必须矫正掉的噪声。侧面仍然包含唇部开合的投影信息,不同角度的同步视频在发音上描述的是同一动作,因此跨视角关联可以直接增强每个单视角的表示。

目标说话人提取 × 视觉线索: 目标说话人提取负责从混合语音中分离出指定人的声音,视觉线索负责指明分离对象是谁以及其发音时间结构,二者搭配的原因是唇动与目标语音在时间上同步且不受声学噪声污染,组合意义是用视觉的时间对齐信息去约束声学掩码估计,避免仅靠声音特征在重叠语音中选错人。

对刚入门的读者,可以把任务理解为例子:2 人在同一麦克风前同时说话,音频完全重叠,系统同时看到其中 1 人的嘴部视频,任务是只输出该人的声音。这里的例子只是帮助理解任务形态,不代表论文的某个具体样本或效果数值。论文的实际做法是保持单麦克风输入,用视频选择目标,再用时频分离主干完成重建。

已有路线如何处理姿态变化?本文的对照点在哪里?

第一类路线是生成姿态不变信息或做人脸正面化,把侧脸先转成正面再提取视觉特征。这种做法的动作是矫正视角,风险是一旦正面化失败就会丢掉原始唇动细节,且对连续转头难以逐帧稳定处理。论文引用的姿态不变提取网络属于这一类,实验中作为跨视角稳定性的对照。

第二类路线是按姿态分别建模,例如为每种头部姿态训练或选择分支。这种做法的动作是把姿态离散化,限制是姿态种类有限,无法覆盖连续转动,且分支切换本身需要姿态判断。第三类路线是多相机联合增强,在训练和测试都要求固定的多相机配置,动作是直接拼接多路输入,限制是单相机场景无法部署。

本文的对照点是同输入、同目标、同运行阶段:在训练可以用多视角、测试允许单视角的条件下比较。具体做法是固定同样的分离主干与优化设置,只改变是否使用多视角张量融合模块,以及训练时是正面重复、单视角随机还是三视角随机。这种设计把数据多样性的增益与融合机制的增益分开,避免把类别差异当成同条件胜负。

模型的输入、约束与输出如何形式化?

设混合波形为批量、采样点与麦克风数组成的张量,默认单通道。模型先按标准差归一化,再做短时傅里叶变换得到复数频谱,实部与虚部拼接后作为音频特征图。视频输入为批量、视角数与视频帧数组成的多视角唇部感兴趣区域序列,每个视角独立经过预训练的唇部编码器得到高维嵌入。

约束有 3 条。第一,音频帧数与视频帧数不对齐,需要把视觉序列上采样到音频时间分辨率。第二,推理时可能缺失视角,需要用已有视角复制补齐到训练时的通道数。第三,融合应对输入顺序不敏感,测试相机位置不必与训练完全一致。输出是目标说话人的估计频谱,经逆短时傅里叶变换回到波形,训练以尺度不变信失真比为优化目标。

需要区分的是,论文报告的是在受控混合条件下的分离质量,不是误判率、延迟或实时性的承诺。视角复制只是通道补齐策略,不代表补出了真实缺失角度的几何信息,其作用是让融合模块在推理时仍能按固定形状计算。

多视角张量融合系统如何从混合语音走到目标语音?

沿一个样本走完全程有助于建立依赖关系。输入是一段双人混合音频与同一目标人的一个或多个同步唇视频。音频支路对混合波形做归一化与短时傅里叶变换,得到按时间与频率展开的复数频谱,再拆成实部虚部。视觉支路对每个视角的唇部序列做仿射对齐到平均人脸模板,再用预训练唇编码器抽取嵌入,上采样到音频帧率并经 1 维卷积投影到与音频共享的子空间。随后多视角张量融合模块把各视角的时序特征融合成逐帧的视觉上下文,与音频特征拼接后送入分离块估计目标频谱,最后逆变换为波形。

下图是理解该路径的唯一像素依据,左侧展示输入补齐,右侧展示整体数据流,阅读时应先分清左右两栏的分工,再追踪汇合点。

看图路径: 1. 先看左侧三组输入如何用复制补齐到三个通道;2. 再看右侧视觉支路从嵌入到卷积到循环再到融合的纵向箭头;3. 核对音频支路从混合语音到频谱实部虚部的分支走向;4. 确认视觉与音频在拼接处汇合后再进入分离与逆变换

原论文 Figure 1:Our proposed MVTF method that extracts the target speakers’ speech using Multi-View lip embeddings.

论文图 1。原论文 Figure 1:“Our proposed MVTF method that extracts the target speakers’ speech using Multi-View lip embeddings.”。

该图左栏为多视角嵌入的 3 种可见情形,分别对应 3 个不同视角、单个视角复制 3 次、以及一个视角加另一个视角复制的补齐方式,蓝色块表示基于预训练残差网络的唇编码器,绿色箭头表示从图像到嵌入的向上映射。右栏为整体结构,视觉嵌入先经 1 维卷积与循环网络,再进入包含展平、归一化、线性与平均的融合虚线框,音频混合语音先经短时傅里叶变换拆出实部虚部,两路在拼接模块汇合后进入重复堆叠的分离块与逆变换,最终输出目标语音。图中融合框的对称设计意味着视角顺序不影响结果,这与正文所述的旋转对称性一致,也是测试相机可自由匹配的依据。

视觉与音频分支各自做了什么计算?

音频处理主干采用时频网格网络。混合波形先除以其标准差做归一化以稳定训练,再经短时傅里叶变换投影为复数谱,时间帧数与频率 bins 分别记为音频时间分辨率与频带数。实部虚部拼接后形成后续网络的输入特征图。这种做法保留了相位相关的实虚结构,分离器可以直接做谱映射而非仅估计幅度掩码。

视觉特征抽取分 4 步。第一步对唇部感兴趣区域做仿射变换,对齐到平均人脸模板,减少尺度与位置抖动。第二步用预训练唇读网络对每个视角独立抽取时空特征,嵌入维度为 512。第三步用线性插值把视频帧率上采样到音频帧数,使每个音频帧都有对应的视觉向量。第 4 步用 1 维卷积把视觉特征投影到与音频共享的子空间。

TF-GridNet × 多视角张量融合: TF-GridNet 负责在时频域完成混合频谱到目标频谱的映射与分离,多视角张量融合负责把多个视角的唇嵌入整合成与音频帧对齐的视觉上下文,二者搭配的原因是分离器需要逐帧的视觉辅助而单视角在转头时会缺失,组合意义是把跨视角的共有发音信息先融合为稳定的视觉条件,再与音频特征拼接后送入分离器。

融合前的时序建模使用共享的单层长短期记忆网络。所有视角共用同一组循环参数,输入是各自投影后的视觉序列,输出是保留时间维度的隐序列。共享参数的意义是让不同视角的动态特征落在可比的空间中,避免为每个相机位置单独学习一套时序模型,也为后续的外积交互提供对齐的特征维度。

长短期记忆网络 × 外积: 长短期记忆网络负责在每个视角内部建模唇动的时间依赖,外积负责在同一时刻对两个视角的特征向量做两两相乘以显式构造 2 阶交互,二者搭配的原因是单纯相加只能保留加性信息而无法表达视角间互补的协同关系,组合意义是先让时序平滑再做乘法交互,从而在融合时抑制单视角噪声并保留跨视角共有结构。

外积融合的具体动作是先给每个特征向量补一个常数 1,再对视角对做逐时刻的外积。补 1 的作用是让展平后的张量同时包含单视角项与双视角乘积项。两两外积捕捉的是乘法交互,这是简单相加难以表达的。成对张量经展平、层归一化与线性层投影回原始维度,再对所有视角对取平均得到融合视觉上下文,最后增加一个维度以便与音频特征拼接。视角对集合允许自身与自身配对,因此单视角复制 3 次时仍可计算,训练用多视角、推理用单视角在形状上得以统一。

训练如何组织多视角?推理如何补齐缺失视角?

训练的输入策略有 3 种,论文用它们做消融。随机三视角策略是每批从 7 个视角中抽 3 个不同视角,重复单视角策略是每批随机抽 1 个视角并复制 3 次,正面重复策略是只用正面复制 3 次。不带融合模块的基线也有两种,分别是正面训练与每批随机抽 1 个单视角。所有模型共享同样的时频主干、优化设置与评测协议,因此差异可归因于输入策略与融合模块。

优化使用自适应矩估计优化器,初始学习率较小并在验证集连续多轮无提升时减半,连续多轮无提升则早停,最多训练一定轮数并对梯度做范数裁剪以稳定训练。监督来源是干净目标语音,以尺度不变信失真比为损失。论文未报告视觉编码器是否冻结或微调的具体参数更新范围,也未给出短时傅里叶变换窗长跳长等频谱参数的完整取值,这两项属于复现时的缺项,不应从模型名称推定。

推理的补齐规则是直接复制可用视角以补足缺失通道。例如单视角输入复制 3 次以满足 3 通道输入,双视角时将其中一个视角再复制 1 次。这种复制不创造新信息,只是让成对交互仍可计算。对称性保证了输入顺序不影响结果,测试相机位置不必与训练一致。

正面训练 × 随机多视角训练: 正面训练负责只用正面唇视频建立基线映射,随机多视角训练负责每批从 7 个视角中抽取不同视角组合来暴露姿态变化,二者搭配比较的原因是要分离融合模块的作用与数据多样性的作用,组合意义是证明同样的主干在见到多视角关联后,单视角测试也能调用学到的共有发音表示。

需要强调的是,随机抽视角与融合模块是两个独立因素。随机单视角基线已经能带来视角多样性,而随机三视角加融合进一步建模视角间乘法关系。论文通过重复单视角加融合的对照,说明仅有融合形状而无视角多样性时增益有限,从而支持多样性是关键这一判断。

数据、混合条件与评价指标如何设定?

实验使用多视角视听情感数据集,仅选用中性情感以隔离视角变化与情感变化的影响。数据集提供 7 个同步相机角度,覆盖正面、顶部、俯视、左右 30 度与左右 60 度。每个混合由来自不同说话人的目标与干扰语音构成,目标与干扰在话语与说话人层面与训练验证测试划分无重叠。干净话语按随机信噪比混合,音频重采样到固定采样率,视频按固定帧率处理。

评价指标包括尺度不变信失真比、语音质量感知评价与短时客观可懂度。前者越高表示波形失真越小,后两者分别反映感知质量与可懂度,方向均为越高越好。论文还构造了模拟转头的混合视角测试集,保持音频混合不变,在正面序列的随机位置插入一定比例的侧面特征段,以检验头部姿态连续变化下的稳定性。

SI-SDR × PESQ: SI-SDR 负责度量分离波形与干净目标在能量归一化后的失真比,越高表示波形保真越好,PESQ 负责从听感模型预测语音质量,越高表示感知质量越好,二者搭配的原因是前者对波形误差敏感而后者更接近人耳评价,组合意义是同时检查论文的方法是否既把波形分干净又保留了可懂度和自然度。

下表把论文正文连续句子中实际出现的关键实验配置集中为可核对的行,便于复现前先对齐采样、帧率、优化与混合信噪比,避免因配置不一致导致结果不可比。

环节对象取值指标或说明适用条件
音频采样全部音频信号16 kHz重采样混合前后统一
视频采样视频帧25 frames-per-second帧率唇序列处理
优化起点Adam 优化器1e-3初始学习率训练开始
训练上限模型训练100 epochs最大轮数早停前
混合条件干净话语混合-10 dB and 10 dBSignal-to-Noise Ratio 随机范围双人混合

该表覆盖的 5 个取值均有原文连续句支撑,阅读时应注意单位与对象绑定,采样率属于音频,帧率属于视频,学习率与轮数属于优化,信噪比范围属于混合生成。表中未列出的频谱参数与视觉编码器更新策略属于原文未交代项,复现时需回到公开代码核对,不应自行假设。

单视角测试与转头鲁棒性得到了什么数字?

比较问题是同样的单视角测试输入下,随机多视角训练加融合是否优于正面训练与随机单视角基线。公平条件是所有模型共享主干与优化设置,测试为同样的 1000 个混合,指标方向均为越高越好。下表集中了论文直接报告的核心数字,重点看平均值与跨视角稳定性,而非只看正面一列。

对比维度指标MVTF 随机多视角结果对照结果差异或第三方
单视角平均SI-SDR15.718 dBfrontal-only counterpart 相差 1.616 dB多视角知识带来增益
多视角推理SI-SDR15.85 dBPESQ near 2.90STOI above 0.915

论文报告随机多视角的融合模型取得平均 15.718 dB 的最佳单视角平均结果,比其正面训练对照高 1.616 dB,增益在顶部等困难视角下尤其明显。正面训练的普通网格基线在某些侧面反而高于正面,论文将其归因于预训练视觉编码器对特定角度的固有鲁棒性,但融合模型整体更稳定。跨七视角的平均语音失真比达到 10.81 dB,高于姿态不变基线的 8.18 dB,论文将其解释为显式多视角融合加时频主干在视角变化下更稳定,但需注意两者在预训练与话语划分上不完全一致,因此只能视为指示性比较而非严格同条件胜负。

在模拟转头的混合视角序列上,融合模型保持稳定,而随机单视角与正面基线出现退化,尤其是正面基线退化明显。这支持了跨视角关联有助于补偿连续姿态变化的判断。多视角推理的多种角度组合均在 15.85 dB 附近,感知质量接近 2.90,可懂度高于 0.915,表明模型不依赖特定相机配置。未胜出的情况也要看到,简单相加与注意力融合在同样多视角训练下反而低于随机单视角基线,说明融合不当会引入噪声,这反衬了外积建模的必要性。

拿掉多样性或换掉融合方式会发生什么?

第一个反证是输入策略消融。随机三视角加融合优于重复单视角加融合与正面重复加融合,说明仅有融合计算图而无视角多样性时,模型见不到跨视角互补,增益有限。所有用随机视角训练的模型都好于只用正面的模型,这进一步把多样性确立为泛化的关键因素。

第二个反证是融合机制替换。在相同多视角训练下,投影相加只捕捉加性交互,注意力融合因随机查询键值分配而不稳定,两者都低于随机单视角基线,而外积融合取得三者中最高。这表明多视角信息本身不是免费增益,融合方式必须能表达非线性乘法关系并抑制噪声。论文还报告了参数与计算量,融合模型仅比单视角基线增加少量参数与浮点运算,却带来实质增益,说明代价主要在训练期多视角数据而非推理期复杂度。

第 3 个边界是推理视角数组合。多种三视角组合在推理时表现一致,均在高位附近波动,说明模型对角度编排不敏感。但这不等于任意缺失都无代价,论文的缺失处理是复制而非重建,极端遮挡或唇部完全不可见的情形未被评测,不能从现有数字推广到全遮挡。

哪些结论尚未被验证?适用边界在哪里?

首先,数据集限定为中性情感与受控的 7 个固定机位,真实场景中的表情、光照、遮挡与连续无级转动未被系统评测。混合视角测试是用特征段插入模拟转头,保持音频不变,这种构造能检验稳定性,但不等同于真实转头时的音画同步变化。

其次,与姿态不变基线的比较存在预训练与划分差异,论文已注明话语级划分可能不同且对方在其他数据集预训练后微调,而己方从零训练,因此平均值的差距应读作支持而非因果证明。若要严格比较,需要统一划分、混合生成与预训练条件。

再次,论文未测量误判目标、推理延迟与内存占用随序列长度的变化,也未报告视觉编码器更新状态与频谱超参数。总体趋势不等于每组都成立,例如正面基线在个别侧面反超正面的现象提醒我们,单点数字不能推广为全程规律。可能但待验证的是,更多视角或更长的跨视角上下文会进一步提升稳定性,这需要新的实验而非从现有增益外推。

复现应先对齐什么?代码与数据当前是什么状态?

复现的第一步是对齐数据构造。按原文生成目标与干扰来自不同说话人的双人混合,训练验证测试各为 10000、1000、1000 个混合,在话语与说话人层面无重叠,混合信噪比在给定范围内随机,音频与视频分别按固定采样率与帧率处理,仅用中性情感以隔离情感因素。若划分或混合脚本不一致,平均值的比较将失去意义。

第二步是对齐输入策略与补齐规则。训练时实现每批随机抽三视角、随机抽一视角复制 3 次、正面复制 3 次 3 种模式,推理时单视角复制 3 次以满足通道数,并验证输入顺序置换后结果不变。第三步是固定主干与优化设置,再分别接入外积融合、投影相加与注意力融合,以复现融合不当反而退化的现象。

资源状态是正文开源声明的唯一依据,当前代码资源状态为可用,链接可达并返回成功状态,论文称演示、代码与数据已公开。复现时应以该页面实际提供的脚本与划分核对缺失的频谱参数与编码器更新策略,不要从模型名称推定实现。若页面结构变化,应以本次可达状态为准并记录访问时间。

何时值得尝试这种方法?还需补哪项验证?

当训练能获得同步多视角唇视频而部署只有单相机时,这种方法值得尝试。它的核心动作不是在测试时依赖多相机,而是在训练期用跨视角乘法交互丰富每个单视角的表示,从而在转头或侧面测试时仍能调用共有发音结构。若只有正面数据,至少应引入随机视角或合成视角变化,否则正面模型的跨视角稳定性可能不足。

当测试本身就有多相机且位置固定时,同样可用该框架直接做多视角推理,论文显示不同角度组合表现一致,适合相机固定而人移动的场景。但若唇部长期被遮挡或视角超出训练覆盖,复制补齐不能创造信息,此时应先补遮挡鲁棒性验证。

还需补的验证包括统一划分下的严格基线比较、真实连续转头视频的端到端测试,以及延迟与计算预算随输入时长的测量。对研究生而言,可复述的方法要点是音频做谱映射、视觉做对齐上采样与共享时序建模、融合做补 1 外积与成对平均、推理做复制补齐与顺序无关计算,评价同时看波形失真、感知质量与可懂度,并用输入消融与融合替换来证明增益来源。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总