英文题目:Adaptive AVSR: Integrating Speaker and Environmental Embeddings for Robust Audio-Visual Speech Recognition

会议身份:conference:interspeech:2026:conference-paper-id:simic26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#Adapter #鲁棒性 #音视频 #语音 #音视频语音识别

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Christopher Simic:机构信息未能从会议 PDF 纯文本可靠映射
  • Korbinian Riedhammer:机构信息未能从会议 PDF 纯文本可靠映射
  • Tobias Bocklet:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音视频语音识别(Audio-Visual Speech Recognition,AVSR)以带噪语音与唇部视频为输入并输出转写文本,难点在于低信噪比下音频退化且音画融合权重难以随说话人与环境动态调整。本文以预训练语音识别模型 Whisper 为基座并在其上游增加音画自注意力融合模块,将音频与视觉特征拼接分块后联合编码,再分别从音频提取说话人嵌入与环境噪声嵌入并经多层感知机映射后注入模型,最后用融合后编码与解码器生成文本。与已有音画融合方法相比,关键差异是将噪声嵌入用于融合层内的模态加权而将说话人嵌入用于解码器前的语境增强,并对比前缀拼接、交叉注意力与门控加权三种注入机制。在 LRS3 测试集全混合噪声平均上,最优噪声门控模型词错率降至 4.26%,相对本文无自适应基线与 AV-HuBERT 分别降低约 3.5%与 13.4%。该结论主要适用于英语 TED 演讲类数据与 -5dB 至 10dB 的四类合成噪声,极低信噪比 babble 下仍落后于强视觉依赖模型且双嵌入联合无增益。原文披露基线预训练约 50 小时、每轮微调约 2.5 小时及单批次推理耗时,部署成本未系统讨论。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么、目标是什么:为什么噪声下要加看脸的识别?

这篇论文研究的输入是一段含噪语音加同步的唇动视频,目标是输出对应的英文转写文字。评价用词错误率,数值越低表示错词越少。初学者可以这样理解任务依赖:干净语音下只听音频就够了,预训练语音识别模型已经很强;但当背景有人声、音乐或自然噪声时,音频中的目标语音会被掩蔽,只靠声音的模型就会明显变差。

此时唇动视频不受声学噪声影响,能提供发音部位和时序约束,因此音视语音识别要把两路信息融合起来。对于刚入门的研究生,必须保留的关键信息是数据集划分、信噪比条件、噪声类别和基线配置,否则不同论文的数字无法比较。本文的输出是一套可复述的方法:基线如何融合、说话人与噪声向量从哪里来、以什么位置和计算方式注入、训练与测试条件如何控制。

本文不声称代码已公开,资源状态证据显示当前没有可验证的公开链接,因此解读只依据论文正文证据。学习这篇论文要先建立动作链:拿一条样本,先看音频信噪比和噪声类别,再看说话人是否与训练重叠,然后跟踪特征提取、融合、编码、解码 4 个阶段,最后看词错误率按条件分档的变化。

后文按任务与路线、方法全景、组件计算、训练推理、实验条件、结果反证、复现收束展开,每节只解决一个具体问题。

同输入同目标的前人走了哪几条路?

在同输入同目标的音视识别路线上,论文把相关工作归为 3 类。第一类是主干架构,从基于变换器和构形器的语音识别主干延伸到音视系统,代表是 AV-HuBERT、Whisper-Flamingo 和 AV-Fusion,它们都试图用视觉线索增强噪声鲁棒性。第二类是说话人嵌入,从 i-Vector、X-Vector 到 ECAPA-TDNN,原本用于说话人确认,近年被用于自适应语音识别,也有个别工作用于多说话人场景的音视系统。

第 3 类是环境嵌入,早期有针对语音识别的噪声自适应,AVFormer 把视觉噪声源信息注入构形器,多智能体方法用卷积噪声分类器,本文继承噪声分类思想但改用基于注意力的分类器同时预测噪声等级和类别。对照时要注意运行阶段是否一致:AV-HuBERT 侧重自监督掩码预训练并鼓励依赖视觉,AV-Fusion 基于冻结 Whisper 的伪标签训练,本文基线则用真值标签做有监督微调。

这种监督来源差异直接影响可比性,不能只看平均数字就断定架构优劣。论文选择在预训练 Whisper 上加前置融合模块,而不是从零训练音视模型,理由是复用大模型已学到的声学与语言能力,只需学习融合与适配。对于初学者,例子是:同样是加视觉,有人用交叉注意力让音频查询视觉,有人用拼接加自注意力让两路平等交互。

本文经比较选择后者并报告好 1.3%,这是一个有源对照,不是通用结论。

要回答的具体问题是什么:适配信息放在哪里最有效?

论文要回答的不是视觉是否有用,而是已经有一个能用的音视基线后,额外提供说话人特征和环境噪声特征能否进一步降低词错误率,以及以什么计算方式放在什么位置最有效。形式化地说,输入是含噪对数梅尔谱与唇动视频,辅助输入是从音频端提取的说话人向量和噪声向量,输出是转写序列。

待比较的操作有 3 个:前缀拼接、新增交叉注意力层、门控加权;待比较的位置有两个:噪声嵌入放在音视融合模块内,说话人嵌入放在解码器之前。这个问题有明确的学习依赖:必须先理解基线的前置拼接自注意力融合,才能理解噪声嵌入为何作用于融合层;必须先理解 Whisper 编码器输出的维度,才能理解说话人嵌入为何作用于解码前。

论文还设置了一个反证问题:如果说话人嵌入本身就混入噪声信息,那么说话人适配与噪声适配的增益可能是同源的,联合使用就不应叠加。这个假设后文用噪声分类实验检验。

方法全景:一条样本如何走完输入到输出?

沿一条样本走完全程有助于建立全局图。输入端有两路:音频转成对数梅尔谱,视频截取唇动区域。两路分别做特征提取后拼接成统一特征序列,再按局部交互的想法切分成块,送入若干自注意力编码块完成音视融合。融合输出送入 Whisper 编码器,再经嵌入层送入 Whisper 解码器生成文字。

辅助支路同时工作:同一段含噪音频送入说话人嵌入模型得到 X-Vector,送入自研噪声嵌入模型得到噪声表示;两者先经过嵌入预处理,变成与主干维度对齐的映射嵌入或门控向量,再按所选策略注入。下图是理解位置关系的关键,它把基线、预处理与 3 种适配策略画在同一版式中,上排是说话人适配在编码器嵌入层级,下排是噪声适配在融合层级。

看图路径: 1. 先从左栏自下而上追踪对数梅尔谱与唇动视频到拼接融合再到编码器解码器的主路径;2. 再看中栏上下两行对比说话人嵌入与噪声嵌入各自的映射嵌入与门控向量两条预处理支路;3. 然后对比右栏上排说话人适配与下排噪声适配在前缀拼接与交叉注意力位置上的不同;4. 最后观察右下门控加权如何用一个向量同时乘到音频特征与视觉特征上

原论文 Figure 1:Overview of our baseline model’s architecture (left), MLP-based embedding pre-processing strategy…

论文图 1。原论文 Figure 1:“Overview of our baseline model’s architecture (left), MLP-based embedding pre-processing strategy (middle) and our pro- posed adaptation strategies (right).”。

从像素可见,左栏基线自下而上是梅尔谱与视频、音频与视觉特征提取、拼接、块划分、自注意力、Whisper 编码器、嵌入、解码器与输出;中栏上下分别用不同颜色画出说话人与噪声的两条预处理支路,每条都从含噪音频或谱特征出发,经嵌入模型再分叉为直接映射与加 Sigmoid 的门控向量;右栏三列分别画出前缀拼接把映射嵌入拼到序列侧面、交叉注意力新增一层以嵌入为键值、门控加权用向量逐通道相乘。

其中噪声门控同时作用于音频与视觉两路。这种分层画法直接对应正文的位置安排:噪声管融合时的模态权重,说话人管解码时的身份偏置。

组件与计算:三种注入方式到底改了什么?

基线融合采用拼接加自注意力,而不是交叉注意力。做法是把音频与视觉特征在通道或序列维拼接,切块后送入自注意力层,让任意位置都能同时看到 2 模态。论文报告比较实验显示该选择比交叉注意力好 1.3%,因此后续适配都基于此基线。嵌入预处理有两种:一种是两层多层感知机把嵌入投影到主干处理维度,得到映射嵌入;另一种是两层感知机加 Sigmoid 得到门控向量,用于逐通道加权。

说话人与噪声共用这套预处理思想,但目标维度不同,噪声侧在融合模块内维度为 80,论文报告其感知机约 14k 参数,说话人侧在 Whisper 嵌入层级维度为 512,对应约 263k 参数。

音视融合 × 噪声嵌入: 音视融合负责把音频特征和唇动视觉特征拼成同一序列并做自注意力交互,解决单模态在噪声下不可靠的问题;噪声嵌入负责从含噪语音中提炼当前噪声类别与信噪比等级;两者搭配的理由是融合模块需要知道何时信音频、何时信视觉,组合后噪声嵌入在融合层内调节两路特征的贡献,实现随场景变化的模态偏置。

前缀拼接的具体动作是:说话人场景下把映射嵌入拼到 Whisper 编码器输出序列前面,再送入后续解码器各层;噪声场景下把嵌入加到每个特征块上。新增交叉注意力的动作是:说话人场景下在 Whisper 解码器前插入一层交叉注意力,保持解码器结构不变但让解码表示查询说话人信息;噪声场景下在融合模块每个自注意力块前放一层交叉注意力。

门控加权的动作是:用 Sigmoid 向量逐通道相乘,说话人场景乘在编码器后嵌入上,噪声场景乘在拼接后的音视向量上,显式调节音频与视觉的贡献。新增交叉注意力带来约 3.6M 噪声侧参数和 4.2M 说话人侧参数,前缀拼接本身不新增主干参数。

说话人嵌入 × 解码器: 说话人嵌入是用 X-Vector 从含噪音频中提取的说话人特征向量,负责提供目标说话人的身份线索;解码器负责根据编码器表示逐词生成转写;两者搭配的理由是编码器输出已混入噪声和干扰说话人,在解码前注入说话人信息可以直接约束解码过程关注目标声纹,组合后解码器在入口或各层都能利用该线索做偏置。

噪声嵌入模型本身值得单独说明。它由 4 层编码器、每层 8 个自注意力头、隐维度 256 构成,后接两个预测头:一个是单神经元回归信噪比,用均方误差训练;另一个是四分类头对应 babble、音乐、自然、干扰说话人,用交叉熵训练。取最后一层编码器之后、预测头之前的表示作为噪声嵌入,认为它同时编码等级与类别。说话人侧则直接复用已有的 X-Vector 与 ECAPA-TDNN,不重新训练说话人模型。

前缀拼接 × 交叉注意力: 前缀拼接是把映射后嵌入作为额外序列拼到特征序列前面,一起送入后续注意力层,分工是让适配信息被所有后续层反复读取;交叉注意力是新增独立注意力层,用主干特征做查询、用嵌入做键值,分工是把适配与预训练主干解耦;两者搭配比较的理由是前者影响更持久但改动原序列结构,后者改动小但只作用 1 次,组合对比能看出持久偏置与隔离注入的优劣。

理解代价时要区分参数与耗时:门控只需小感知机,交叉注意力最重;论文在 A40 上测得每批 8 条时无适配约 0.58s,加噪声适配约 0.63s,加说话人适配约 0.72s,在 A100 上约快 27%。这说明适配不是免费的,说话人支路因维度更大更慢。

门控加权 × X-Vector: 门控加权是用两层感知机加 Sigmoid 生成通道级权重向量,再逐通道乘到特征上,负责抑制或增强特定通道;X-Vector 是输入该门控或前缀模块的说话人表示,负责提供当前试次的说话人与隐含噪声线索;两者搭配的理由是 Whisper 编码器特征通道分布较均匀,直接加权难以带来增益,而音视频拼接特征存在明确的模态分工,加权可以显式调节音频与视觉的贡献。

训练与构造:基线、嵌入模型与适配模型如何分步训练?

训练分 3 个阶段,冻结与更新安排按原文交代。起点是无适配的基线,在 VoxCeleb2 与 LRS3 组合上预训练 3 轮,只调音视融合模块与编码器,用编码器嵌入层的均方误差做自监督,方式类似引用的多智能体方法。噪声嵌入模型单独训练,训练数据是 VoxCeleb2 加基于 MUSAN 的噪声,联合优化信噪比回归与类别分类,训练好后冻结,作为特征提取器供后续适配使用。

随后所有模型含基线都做有监督微调:批量 512,先以恒定学习率微调一轮,再线性衰减 4 轮,若未收敛则以更小起始学习率逐轮续训,最多 11 轮微调,以验证集连续 3 轮无提升为早停。微调损失是编码器嵌入层均方误差加解码器对数交叉熵。数据增强对所有模型一致,训练时干净语音与噪声按均匀采样的信噪比混合。

需要指出的缺项是:论文未报告噪声嵌入模型的学习率、优化器细节与早停轮数,也未说明说话人 X-Vector 模型是否微调,按正文应理解为直接复用冻结模型。梯度路径方面,适配阶段噪声嵌入冻结,只有映射感知机、门控网络、新增交叉注意力与主干可调部分参与更新,但主干具体冻结哪些 Whisper 层未逐层列出,复现时应先按融合模块与编码器可调、解码器按策略插入来实施,并记录实际更新参数量。

预训练约 50 小时,每轮微调约 2.5 小时,均在 4 卡 A40 上完成,这对预算规划是直接依据。

实验条件:数据、划分、噪声与指标如何对齐?

音视数据用 LRS3 与 VoxCeleb2。LRS3 约 430 小时、超 9k 说话人,来自 TED 演讲,分为预训练 407 小时、训练验证 30 小时、测试 1 小时;本文合并前两者训练,从训练验证中留 2048 条做验证选模型,测试集说话人完全独立。最终测试的 babble 由测试集内随机 30 条不同说话人混合生成,干扰说话人也取自测试集,避免训练测试说话人重叠。

VoxCeleb2 约 2k 小时、超 6k 说话人,无转写,只用于伪标签自监督预训练。噪声数据用 MUSAN,分语音 60 小时、音乐 42.5 小时、自然 6 小时,每类按 80/10/10 切分训练验证测试且严格无重叠,babble 按同样混合策略从语音类合成。另有一套严格隔离的增强集:babble 由 LibriSpeech 的 27 到 33 条合成,自然来自 ESC50 的 2k 条覆盖 50 种环境,音乐来自 1886 首 9 流派库,干扰说话人取自 VoxCeleb2,用于检验噪声嵌入与音视模型训练是否需要严格分离。

信噪比 × 词错误率: 信噪比是训练与测试时控制语音与噪声能量比的条件变量,负责定义任务难度,论文训练在 -15 dB 到 30 dB 均匀采样,测试聚焦 -5 dB 到 10 dB 加干净条件;词错误率是衡量转写错误比例的评价指标,数值越低越好;两者搭配的理由是只有把词错误率按信噪比分档报告,才能判断适配是在高噪声下起作用还是全条件一致起作用。

测试协议是 LRS3 测试集上按噪声类别与等级交叉:类别含 MUSAN 与 LRS3 的 babble 平均为 Babble 混合、音乐与自然平均为 Music 加 Natural、干扰说话人单独列,最后全混合为全类别平均;等级为 -5 dB、0 dB、5 dB、10 dB 加干净条件,另有全条件平均列。指标为词错误率百分比,越低越好。比较公平性方面,AV-HuBERT 与 AV-Fusion 用官方检查点在完全相同的测试数据上重测,Whisper-Flamingo 也在同协议下测试,但其多语优化与更大参数量是已知差异。

统计上论文对适配相对基线的提升做单侧 t 检验,噪声适配与说话人适配的 p 值均远小于常用阈值,支持显著性判断。

主结果:适配相对基线与强基线带来了什么?

本节先回答自家基线对照问题:在相同增强与训练流程下加适配能否超越无适配基线。下表整理论文表 1 中全混合下不同等级与平均的关键数字,表头单位为词错误率百分比,数据格为原文裸值,数值越低越好,条件覆盖高噪声到干净输入。

模型-5 dB0 dB5 dB10 dBc平均
Ours baseline11.444.642.521.911.574.42
Noise Prefix Adapt.11.024.512.421.971.614.30
Noise Cross-Attn Adapt.10.914.422.561.941.504.27
Noise Gated Weight Adapt.10.864.432.511.931.584.26
Speaker Prefix Adapt.10.794.402.612.001.564.27
Speaker Cross-Attn Adapt.10.934.472.521.951.564.29
Speaker Gated Weight Adapt.11.484.462.591.951.614.42

表中噪声门控平均 4.26 相对基线 4.42 对应约 3.5% 相对下降,说话人前缀 4.27 对应约 3.2% 相对下降,且在 -5 dB 下改善最大,噪声侧最高相对下降约 5.1%,说话人前缀在 -5 dB 相对下降约 5.7%。表后需要同时看到代价与反例:10 dB 下噪声适配相对基线略有下降,干净条件下与基线基本相当,说明未明显损伤干净性能;说话人门控加权平均与基线持平,是明确的未胜出项,论文解释为编码器嵌入信息分布均匀,加权掩蔽难以获益。

下面再回答外部强基线对照问题:最强配置能否超越已发表的音视模型。下表整理论文表 2 中按类别与全平均的关键数字,同样为词错误率百分比裸值,数值越低越好,覆盖 babble、音乐自然、干扰说话人与全平均。

模型Babble -5 dBMusic+Natural -5 dBSidesp. -5 dBAll Mix 平均clean c
AV-HuBERT base18.46.79.24.921.80
Whisper Flamingo small25.87.726.37.871.20
AV-Fusion base25.35.76.95.291.65
Ours Noise Gated Weight Adapt.22.44.95.34.261.58

该表显示本文最强配置平均 4.26 相对 AV-HuBERT 的 4.92 下降约 13.4%,相对 AV-Fusion 的 5.29 下降约 16.5%,支持总体优势判断。但反例必须保留:在 babble 极高噪声 -5 dB 下 AV-HuBERT 的 18.4 优于本文的 22.4,论文将其归因于训练目标差异与视觉依赖程度不同,AV-HuBERT 只在干净或 0 dB 训练并做音频掩码,更依赖视觉,在语音掩蔽语音时更有利。

而本文模型更侧重用视觉做滤波,在可分离的干扰说话人上优势更大。这提示总体趋势不等于每组都成立,选型应按目标噪声类别权衡。

消融与反证:为什么说话人适配也像噪声适配?

本节回答机制层面的疑问:说话人适配为何主要在高噪声下改善,以及噪声与说话人联合是否叠加。论文先比较说话人嵌入来源,X-Vector 平均比 ECAPA-TDNN 低约 0.8% 词错误率,因此聚焦 X-Vector。为检验 X-Vector 是否隐含噪声信息,作者在 X-Vector 上训练噪声分类器,报告准确率 90%,接近专用噪声模型的 94%,而 ECAPA 上同样实验仅 64%。

这支持 X-Vector 含有显式噪声场景信息的判断,也解释了两者改善模式相似与 ECAPA 适配较弱的现象,但仍是相关性证据,不是因果证明。第二个反证是联合模型:把最强的噪声门控加权与说话人前缀拼接放在同一模型中,结果与单噪声门控几乎相同,在全混合 10 dB 最大绝对差仅 0.03%,即 1.93% 对 1.96%。

这进一步支持两者信息冗余、联合不带来额外增益的假设。第 3 个消融是更换严格隔离的噪声增强集,结果无显著差异,说明两种噪声嵌入学到相似表示,严格分离训练并未改善性能。对于初学者,复述要点是:3 种策略排序为噪声侧门控最优、交叉注意力次之、前缀再次之,说话人侧前缀最优、交叉注意力次之、门控无效。

排序只在本文基线与数据条件下成立,换主干或维度可能变化。

边界与未验证事项:哪些结论不能推广?

首先是数据边界:训练增强覆盖 babble、音乐、自然与干扰说话人,测试也在同一类别体系内,未评测完全未见的大类噪声与真实房间混响,跨域泛化待验证。其次是说话人边界:LRS3 测试说话人独立,但均为 TED 演讲风格,与 VoxCeleb2 的名人访谈仍属近域,远域口音与儿童语音未覆盖。

再次是监督差异带来的可比性限制:本文用 LRS3 真值微调,而 AV-Fusion 用冻结 Whisper 伪标签,AV-HuBERT 训练信噪比仅干净或 0 dB,因此外部比较混合了数据、监督与架构三重差异,不能简单解读为融合或适配的单点胜利。未测量的量不能承诺改善:论文未报告误判率分解、逐词延迟、内存峰值与流式性能,推理耗时只给批处理均值,不能推定实时系统延迟同样下降。

统计上虽有单侧 t 检验,但未说明试次划分与方差来源,复现时应补报多种子均值方差。最后是开源状态:正文末称将发布代码,但本次可验证资源为空,不得写成已公开,复现只能依据论文文字与超参数进行。

复现先做什么:按什么顺序搭出可运行基线?

复现应先搭基线再加适配。第一步准备 LRS3 与 VoxCeleb2 按原文划分,LRS3 合并预训练与训练验证并留 2048 条验证,测试集保持独立;MUSAN 按每类 80/10/10 切分且无重叠,另按论文准备 LibriSpeech、ESC50 与音乐库的隔离增强集以备消融。第二步实现拼接加自注意力融合与 Whisper 基础量级主干,融合模块约 13M,先做 3 轮自监督预训练,只调融合与编码器。

第三步独立训练噪声嵌入模型,4 层八头隐维 256,双头回归信噪比与四分类,冻结后供适配使用;说话人侧直接调用现成 X-Vector 提取器。第四步按 3 种策略分别实现前缀、交叉注意力与门控,注意噪声在融合内维度 80、说话人在嵌入层维度 512,微调批量 512 与学习率日程按原文设置,最多 11 轮并以验证集早停。

验证时先复现表 1 的平均与 -5 dB 分档,再复现表 2 的跨模型比较,重点检查干净条件是否退化、10 dB 是否持平或微降、高噪声是否显著改善。若说话人门控无效、联合模型不叠加,则与原文一致,不应强行调参掩盖。还需补的验证是多次随机种子的方差、不同噪声库的交叉测试,以及在 A40 或等效硬件上的批耗时与参数量记录,以便区分精度收益与部署代价。

何时值得尝试这种适配:收束判断是什么?

当系统已有一个可用的 Whisper 音视基线,且主要错误集中在高噪声与多说话人场景时,值得尝试本文的适配。选型建议是:若目标噪声多变且需调节模态信任,优先在融合层做噪声门控加权;若有可靠的 X-Vector 且解码受说话人混淆影响,优先在解码前做前缀拼接;若希望改动最小且保持预训练层不动,可考虑交叉注意力,但要接受额外数百万参数。

X-Vector 本身含噪声信息意味着在资源受限时可先只做其一,不必同时部署两套嵌入。收束时回到可核对的事实:噪声门控平均相对基线约 3.5%,说话人前缀约 3.2%,最强配置相对 AV-HuBERT 约 13.4%,但 babble 极高噪声下仍不及 AV-HuBERT,联合适配无叠加,干净性能基本不退化。

这些数字都绑定到 LRS3 特定划分、信噪比分档与词错误率定义,换条件需重测。对于研究生,可复述的方法链是输入到表示到组件到目标到输出,再到训练冻结与早停,最后到按条件分档的评价,任何一步缺失都会让比较失去意义。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总