英文题目:Audio-Visual Feature Reconstruction Pretraining for Noise-Robust Emotion Recognition

会议身份:conference:interspeech:2026:conference-paper-id:parmonangan26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #鲁棒性 #预训练 #音视频 #语音情感识别

评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

排名:后50% | 文档类型:方法研究

👥 作者与机构

  • Ivan Halim Parmonangan:机构信息未能从会议 PDF 纯文本可靠映射
  • Tharindu Fernando:机构信息未能从会议 PDF 纯文本可靠映射
  • Simon Denman:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为同步语音与人脸视频,输出为8类离散情绪标签,难点是背景噪声、混响、削波丢包与冻结撕裂等退化会让受损模态主导融合并压制干净模态。该方法先用冻结的语音编码器EAT-base与视频编码器Timesformer-Base抽取潜特征,再经各自3层Mamba2状态空间模型编码器做时序建模并映射到统一维度。接着以2层双向交叉注意力让音频以注意力池化后视频为条件、视频以音频为条件做信息交换,其输出进入独立反投影加3层Mamba2解码器从带噪双模态重构干净特征。两阶段自监督预训练先只训单模态编码器做模态内去噪80轮,再冻结编码器训融合与解码器200轮并用梯度归一化GradNorm平衡双模态均方误差损失,下游则冻结预训练表征另训注意力池化加GeLU加余弦分类器,音频与视频分支独立评测。与已有对齐式音视频预训练的关键差异是显式保留输入细节的跨模态条件去噪重构,而非只学跨模态语义对应,这使噪声鲁棒性来自干净模态对受损模态的直接修复。在RAVDESS基准下,无预训练含噪音频的准确率为39%,低于无预训练含噪视频的准确率79%。结论仅适用于短句摆拍英语情绪数据与特征级合成退化,向自发情绪、长时对话与真实信道失配的外推尚未验证。原文未披露训练时长、推理时延与部署成本,仅给出参数量与计算量对比。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么噪声会破坏融合?

本文的输入是同步的语音音频与人脸视频,目标是在真实损坏下做情感识别。输出是 8 类情感之一。研究默认从原文独立写作,事实只依据论文原文证据。必须保留的信息包括数据划分、损坏构造、冻结与更新安排、评估条件与统计检验,输出是 1 篇可核对、可复述方法的技术解读。

对刚入门的研究生,先建立直觉:音视频情感识别之所以有效,是因为声音的韵律与脸部表情互补。当两个模态都干净时,融合通常优于单模态。但当一个模态被背景噪声、混响、丢包或冻帧污染后,常用的注意力融合可能被坏模态主导,反而压制干净模态的证据,导致明明有一路是干净的,整体结果却下降。论文把这个矛盾作为起点。

白话先讲跨模态对齐:它是指让音频和视频在语义或时间上对上,例如说到某个词时嘴型对应上,英文是 cross-modal alignment。白话再讲特征重建:它是指用被损坏的输入去恢复干净输入的特征,英文是 feature reconstruction。已有自监督音视频预训练多做前者,优化通用表示质量,但缺少显式的跨模态去噪,因此迁移到情感任务时抗噪不足。本文选择后者,即只在预训练阶段从损坏的音视频输入重建干净特征,以学到抗噪表示。

特征重建预训练 × 对比对齐预训练: 特征重建预训练要求从被损坏的输入恢复出干净特征的细节,保留对情感有用的输入细节并显式学习去噪;对比对齐预训练更关注跨模态语义对应与同步,优化表示的通用对应关系;本文选择前者是因为目标是噪声下不让坏模态压制好模态,需要显式的跨模态去噪能力而不仅是对齐。

论文还强调效率约束。白话讲 2 次复杂度:Transformer 的自注意力计算量随序列长度平方增长,长多模态序列难以扩展。本文因此用状态空间模型做时序建模。白话讲状态空间模型:它是用可递推的状态来处理序列的模型,本文用的是 Mamba2,英文是 Mamba2 state-space model。后续方法节会沿一个样本走完输入到输出,再展开 2 阶段训练。

已有路线在同输入同目标下做了什么,还缺哪块证据?

在同输入同目标下,已有工作证明融合音频与视觉有助于情感识别,近年多采用基于交叉注意力的融合机制。论文引用了噪声鲁棒多模态 Transformer 等工作,说明该方向已意识到噪声问题。但原文指出,现有融合方法通常假设输入模态可靠,噪声模态的特征可能干扰干净模态,导致情感结果下降。

在同监督同阶段上,近期自监督音视频预训练主要关注语义对应、同步或对比对齐,以提升通用表示质量。论文的判断是,这类方法缺乏显式的跨模态去噪,限制了向情感任务迁移时的鲁棒性。这不是说对齐无用,而是在噪声评估下缺少去噪证据。

在架构路线上,多数已有方法依赖 Transformer 架构,论文指出其 2 次复杂度限制了长多模态序列的可扩展性与噪声处理效率。本文因此把效率与去噪一起作为设计约束:用 Mamba2 处理时序,用交叉注意力做模态条件去噪。相关工作对照停留在有源范围,不把类别差异当成同条件胜负,后续实验节会用同一特征抽取器下的可运行基线做公平比较。

要解决的具体问题与评估方式是什么?

具体问题是:在音频可能含背景噪声、混响、比特率下降、削波、 chopped speech,视频可能含冻帧、压缩伪影、颜色失真、撕裂与噪声时,如何让融合不被坏模态带偏,并保持情感识别准确率。教学例子:例如音频被强噪声淹没但人脸清晰,理想模型应更多依赖视频;若反过来视频冻帧而音频干净,则应更多依赖音频。本文明确评估这种不对称损坏下的表现。

评估方式是引入超出预训练所见水平的损坏等级,测试在更低与更高噪声下的保持能力。预训练用 LRS2,下游用 RAVDESS,两者用的背景噪声与脉冲响应数据集明确错开,以避免预训练与下游设置重叠,同时模拟真实损坏。下游分别评估音频特征与视频特征,而不是只报一个融合分数,这样能看清是哪一路获益、哪一路受损。

需要区分的是,本文报告的是准确率方向的比较,更高的准确率表示更好。统计上用 McNemar 显著性检验比较非预训练与编码器预训练、编码器预训练与多模态融合预训练。资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开,只能按原文交代复现所需的构造与超参数。

方法全景:一个样本如何从原始信号走到重建与分类?

先沿一个样本走完全程。输入是一段同步音视频。原始音频被重采样并转成梅尔谱,原始视频按帧采样。冻结的 EAT 模型抽音频隐特征,冻结的 Timesformer 抽视频隐特征。损坏只加在原始信号层,且对所有比较方法相同,重建只在得到的表示上进行。

随后音频与视频各走 3 层 Mamba2 编码器,经线性层转到公共维度,再经双向交叉注意力互相借证据,最后经线性回投与 3 层 Mamba2 解码器重建出干净特征。下游则把去噪后的单模态 token 送入余弦分类器得到情感标签。

该全景图对应的架构在原文图 1 中分为预训练结构与下游分类器结构。预训练时输入是带噪特征,目标是干净特征;下游训练用干净数据,测试用干净与多级噪声数据。请按以下导读顺序看图,再对照后一段解释核对每个模块的功能。

看图路径: 1. 先从左侧橙色音频支路与绿色视频支路分别追踪归一化与 Mamba2 编码器的走向;2. 再看中间线性层与注意力池化如何把两路特征送入上下两个交叉注意力块;3. 最后看右侧线性回投与 Mamba2 解码器如何输出重建的音频与视频特征,以及下游余弦分类器的堆叠顺序

原论文 Figure 1:The architecture used in this study.

论文图 1。原论文 Figure 1:“The architecture used in this study. The proposed architecture for pretraining is illustrated in (a). The downstream classifica- tion architecture is illustrated in (b).”。

从像素可见,图 1 左侧有两条横向支路,上为橙色音频,下为绿色视频,均标有 Layer Norm 与 Mamba2 Layers。中间经 Layer Norm 与 Linear 汇入深蓝色 Linear 与绿色 Att_pool,产生池化后的视频 token。右侧上下各有一个交叉注意力块,分别标注 XAttn 方向与位置编码输入,再经 Linear 回投与 Mamba2 解码器输出重建特征。最右侧下游分类器自上而下为 Layer Norm、注意力池化、线性加激活与丢弃、余弦分类器,最终输出标签。该布局支持后文 2 阶段训练的叙述:先训编码器,再冻结编码器训融合与解码器。

组件与计算:编码器、融合、解码器各自算什么?

特征抽取是冻结的。音频用在 AudioSet-2M 上预训练 30 轮的 EAT-base,其骨干是 ViT-B;视频用在 Kinetics-400 上预训练的 Timesformer 基础尺寸模型。两者只从干净与损坏信号抽隐特征,保持冻结。音频预处理为重采样到 16 kHz 并转单声道,再转为 128 个频率 bins 的梅尔谱,汉宁窗 25 ms,帧移 10 ms。视频原始 25 fps,采样策略是视频长度除以 12.5 后四舍五入到最近的 8,再均匀采样,保证短视频至少采 8 帧,长视频按比例多采,避免视频相对音频欠采样。

编码器部分,音频与视频各用 3 层 Mamba2。设批量为 B,音频 token 数为 Ta、维度为 Da,视频为 Tv 与 Dv。输入先经层归一化再进各自编码器堆栈,输出记为音频编码输出与视频编码输出。再经线性层转到公共维度 768 并再次归一化,再经共享线性层得到同维度的音频与视频特征。因为音频 token 远少于含空间信息的视频 token,论文用两个单向交叉注意力:一个用注意力池化后的视频 token 更新音频 token,另一个用音频 token 更新视频 token。交叉注意力是顺序无关的,因此在第一层交叉注意力前加入音频与视频各自的位置编码。

经过两层交叉注意力后,token 经各自线性层投回原始维度,再送入各自的 3 层 Mamba2 解码器,得到去噪后的重建音频与视频特征。下游分类器对单模态 token 先层归一化,再经注意力池化、线性层加高斯误差线性单元激活与 0.1 丢弃,最后用余弦分类器分类,目的是降低对特征范数的敏感并改善校准。音频与视频下游结构相同,但特征已通过交叉注意力被另一模态丰富。

交叉注意力融合 × Mamba2 状态空间模型: 交叉注意力融合负责让音频 token 去查询视频信息、视频 token 去查询音频信息,解决单模态受损时向另一干净模态借证据的问题;Mamba2 状态空间模型负责对各自模态的长时序特征做线性复杂度的时序建模,解决 Transformer 2 次复杂度在长多模态序列上难扩展的问题;两者搭配是先用 Mamba2 把各模态时序理顺,再用交叉注意力做有条件的跨模态去噪重建。

两阶段如何训练,损失权重与冻结安排是什么?

预训练用 LRS2 的 pretrain 子集,主子集整体用于预训练验证。输入是带噪音视频特征,监督是干净特征。第一阶段只训练编码器流水线 80 轮,让编码器从模态内损坏中重建干净特征。第二阶段持续 200 轮,冻结编码器,只训练交叉注意力和解码器,让融合利用双模态信息生成更鲁棒的特征。两步都用均方误差损失,第一步按单模态方式无加权计算,第二步按下式加权求和,音频初始权重 0.8、视频初始权重 1.2,再用 GradNorm 按各模态训练速率动态调整交叉注意力与解码器参数上的权重,并重归一化保持总损失尺度稳定。

单模态编码器预训练 × 多模态融合预训练: 单模态编码器预训练只让音频编码器重建干净音频、视频编码器重建干净视频,学习各自模态内的抗损坏能力;多模态融合预训练在冻结编码器后训练交叉注意力和解码器,让重建可以利用另一模态的干净证据;2 阶段搭配是先打好单模态基础,再学跨模态借力,避免一开始就让噪声在融合中互相污染。

GradNorm 动态加权 × 均方误差重建损失: 均方误差重建损失负责度量重建的干净音频特征与干净视频特征各自的误差,是 2 阶段优化的基本监督信号;GradNorm 动态加权负责在第二阶段根据 2 模态训练速率调整音频权重与视频权重并重归一化保持总尺度稳定;两者搭配是让音频和视频的重建任务按难度自适应平衡,防止某一模态主导融合解码器的学习。

下游评估用 RAVDESS 的 80% 训练、20% 测试,用 PyTorch 随机划分函数加种子保证可复现。下游用干净数据训练,用干净与多级噪声测试,噪声等级通过将各损坏类型的概率相对预训练上下浮动 25% 与 50% 得到。参数量方面,排除冻结特征抽取器,共享 Mamba2 编码器在第一阶段占 46.4 M 可训练参数;第二阶段带交叉注意力和 Mamba2 解码器的模型为 76 M 参数、576 GFLOPs 含冻结编码器,而可比的 Transformer 解码器第二阶段为 73.4 M 参数、591 GFLOPs。原文未给出优化器细节与学习率时程等缺项,复现时需按缺项处理,不从模型名推定实现。

数据、损坏构造与噪声错开如何保证公平?

预训练数据 LRS2 来自 BBC 电视广播的数千句带同步音视频,视频裁剪到脸与嘴部,含光照、姿态、背景噪声与说话风格变化。pretrain 子集超 96000 条,main 子集超 48000 条,原意是前者预训练、后者做自身监督下游任务,本文用 pretrain 子集自监督预训练、用整个 main 子集做预训练验证。情感数据 RAVDESS 由 24 名演员表演,12 女 12 男,21 到 33 岁,英语母语、中性北美口音,含 8 类情感与正常及强烈强度,中性无强烈,两句固定语句,含音频、视频与音视频条件。

损坏构造分两组。源损坏先加,包括背景噪声与房间混响;传输损坏后加,包括比特率下降、削波与 chopped speech。音频每样本按概率随机设置:背景噪声 0.4、混响 0.2、比特深度下降 0.2、削波 0.2、断续效应 0.2。背景噪声按 5 到 20 dB 添加,混响强度 0.1 到 0.5,用原波形加归一化后与脉冲响应卷积的波形实现。

断续从 dropout、stutter、丢包中均匀随机选,dropout 用 0.01 到 0.1 概率将 10 ms 到 1 s 片段置零,stutter 复制 100 ms 到 2 s 短段到连续多段,丢包复制 20 ms 片段并在段内随机丢弃或 1.5 到 2 倍加速。比特深度在 4 到 24 位随机,削波钳制波形最大值。视频每帧按概率损坏:冻帧 0.3、压缩伪影 0.2、颜色失真 0.15、模糊 0.15、撕裂 0.1、噪声 0.1,除冻帧、撕裂与噪声外多在 50 到 150 像素方块上操作,冻帧复制到后 5 到 10 帧,撕裂每帧两处垂直或水平,高斯噪声强度 0.05 整帧添加,压缩将 1 到 5 块质量降至多达 30%,颜色在 HSV 上色调移正负 30、饱和度与明度移正负 50,模糊对 1 到 3 块做高斯模糊。

关键公平设计是噪声数据集错开:预训练增强用 FSDNoisy18K 加 AIR,预训练验证用 WHAM!加 IR-C4DM,下游 RAVDESS 用 UrbanSound8K 加 MicIRP。合成损坏在原始信号层对所有比较方法完全相同,因此下游差异可归因于预训练与融合,而非特征抽取器不同。

主结果:噪声音频提升多少,视频是否被拖累?

本节回答 3 个问题:不预训练时基线多脆弱;单模态编码器预训练带来多少;多模态融合预训练是否让噪声音频显著受益且视频基本保持。比较条件一致:同一冻结特征、同一 Mamba2 编码器、同一损坏构造,仅融合与解码阶段不同。指标是准确率,越高越好,噪声等级相对预训练上下浮动。

下表整理原文直接报告的基线与单模态预训练区间,单位与精度保留原文写法,用于核对音频更脆弱、视频更稳定的前提。表前已提出比较问题与公平条件,读表时注意音频与视频是分别评估的模态列,不能跨模态直接相减当成融合收益。

条件指标非预训练音频非预训练视频单模态预训练音频单模态预训练视频
干净输入准确率77% accuracy93%77% 附近基线93% 附近基线
噪声输入区间准确率39% and 70%79% and 89%44% and 76%84% to 90%

表后解释:非预训练时干净音频仅 77% 准确率,低于干净视频 93%,说明 EAT 音频特征在 RAVDESS 上判别性弱于 Timesformer 视频特征。噪声下音频掉到 39% 到 70%,视频保持 79% 到 89%,确认音频是噪声敏感模态。单模态编码器预训练后,噪声音频升到 44% 到 76%,噪声视频升到 84% 到 90%,趋势改善但 McNemar 检验总体不显著,仅在比预训练低 25% 噪声的噪声音频上显著。图 2 的前两幅子图直观显示了这一差距,导读如下。

看图路径: 1. 先对照左上非预训练与右上编码器预训练中深绿音频柱与浅蓝视频柱随噪声等级的变化;2. 再看左下融合后音频图中四种组合柱形在高噪声下是否仍保持分离;3. 最后看右下融合后视频图中各类组合是否贴近顶部横线,判断视频是否饱和

原论文 Figure 2:The results of the downstream emotion recognition task using (a) direct features from EAT and…

论文图 2。原论文 Figure 2:“The results of the downstream emotion recognition task using (a) direct features from EAT and Timesformer, (b) features refined via unimodal pretrained encoders, and (c) and (d)…”。

从像素可见,图 2 左上非预训练与右上编码器预训练均以横轴噪声等级、纵轴准确率展示,深绿噪声音频柱随噪声加重明显下探,浅蓝噪声视频柱相对平稳,两条横线分别标示干净音频与干净视频。左下融合后音频出现 4 种组合柱形,高噪声下仍有绿色柱保持高位;右下融合后视频各组合贴近顶部,说明视频接近饱和。像素不能精确读出的具体柱高不硬写,以正文报告的区间与显著性为准。

多模态融合后,原文报告相比单模态编码器预训练,噪声音频在 NACV 上提升 5.8%、在 NANV 上提升 4.6%,视频平均下降 2.1% 到 3.2%。显著性上,NACV 在与预训练同级与高 25% 噪声下显著优于编码器预训练,NANV 在高 25% 与高 50% 下显著优于仅用编码器噪声音频特征。视频侧,仅在同级噪声下干净音频加噪声视频显著优于仅用单模态噪声视频特征,其余多为轻微下降,支持噪声敏感模态借力更耐噪模态、而耐噪模态可能被低精度音频轻微拖累的判断。

对照与反证:哪种组合真正起作用,哪种没有?

为分离融合的作用,论文设置了三档可运行策略:直接用冻结特征不预训练、只用单模态编码器去噪特征、用融合预训练后的去噪特征。编码器与融合模型共享同一冻结特征与同一 Mamba2 编码器,仅交叉注意力与解码阶段不同,因此差异可归因于是否允许跨模态借证据。

下表把融合预训练的组合条件与原文报告的相对增益放在同一 5 列结构中,便于核对音频获益与视频代价是否同时成立。NANV 指噪声音频加噪声视频,CANV 指干净音频加噪声视频,NACV 指噪声音频加干净视频,CACV 指干净音频加干净视频。

评估特征组合条件基线策略本方法相对变化显著性结论
融合后音频NACV单模态编码器噪声音频5.8% for NACV同级与高 25% 显著
融合后音频NANV单模态编码器噪声音频4.6% for NANV高 25% 与高 50% 显著
融合后视频CACV, NACV, CANV, and NANV单模态编码器噪声视频2.1%-3.2% average drop仅 CANV 同级显著更好其余轻微下降
信号层设置5-20 dB, 16 kHz, 128 frequency-bins, 25 ms, 10 ms shift全方法相同不作为收益列保证公平

表后解释:主要收益在音频侧,且在噪声音频配干净视频时最大,说明干净视频提供了有效条件。代价在视频侧,融合更鲁棒的视频与噪声敏感的音频会降低精度,平均下降 2.1% 到 3.2%。未胜出项是视频多数组合,负结果是单模态预训练总体不显著,这提示仅靠模态内去噪不够,需要跨模态条件。未评测边界包括更长的多轮对话噪声与极端丢包下的时序错位,原文未报告则不推测必然如何。

限制:哪些结论有边界,哪些量没有被测量?

直接报告显示音频获益与视频轻微下降并存,支持跨模态去噪对噪声音频有效,但视频饱和与音频本身精度低限制了双向增益。可能与待验证的是,视频下降是否完全由音频精度低导致,还是融合权重未能自适应关闭有害借力,原文提出未来用自适应融合来判断何时融合有益,但未在本研究验证。

缺失证据不是技术错误,但需明确:原文未报告误判率分布、延迟、推理开销与实际帧率随序列长度的变化,只给了参数量与 GFLOPs 的总体趋势,不能承诺这些量得到改善。总体趋势不等于每组每步都成立,例如视频在 CANV 同级噪声下显著更好,说明并非所有视频组合都下降。

相关性不等于因果:噪声等级与准确率的单调关系在柱形上可见,但不能据此推断某一具体损坏类型必然导致固定点数的下降,因为每样本损坏是按概率随机组合的。复现时应保留原文的随机损坏组合与错开数据集设计,否则跨数据集噪声重叠会高估或低估鲁棒性。

复现先做什么,需要哪些超参数与信息条件?

先准备数据与噪声库。预训练用 LRS2 pretrain,验证用 LRS2 main;下游用 RAVDESS 按 80% 训练、20% 测试的随机划分加种子。背景噪声与脉冲响应必须按 FSDNoisy18K 与 AIR 用于预训练、WHAM!与 IR-C4DM 用于预训练验证、UrbanSound8K 与 MicIRP 用于下游的错开方式准备,避免重叠。损坏概率与强度按实验设置节原值实现,音频 5 到 20 dB、混响 0.1 到 0.5、视频冻帧 0.3 等,合成损坏在原始信号层对所有方法相同。

再搭建冻结特征与可训练部分。EAT-base 与 Timesformer 保持冻结,只训 Mamba2 编码器、交叉注意力与 Mamba2 解码器。公共维度 768,第一阶段 80 轮只训编码器,第二阶段 200 轮冻结编码器训融合与解码,损失为均方误差,音频初权 0.8、视频初权 1.2 并用 GradNorm 动态调整。下游余弦分类器用干净数据训练,再在干净与相对预训练上下 25% 与 50% 的噪声等级上测试,并做 McNemar 检验。

关于可用性,当前无完成验证的资源绑定,因此只能写本次未能确认代码与权重可达,需按论文文字重实现。区分代码开源、权重下载与系统可运行:即使特征抽取器有公开权重,本文的融合预训练权重与完整流水线仍需自行训练才能称为可运行系统。

何时值得尝试,一句话如何带走?

当你的任务是音视频情感识别,且音频易受背景噪声与传输损伤而视频相对稳定时,值得尝试这种只在预训练阶段重建干净特征的跨模态去噪。复现优先级是先保证损坏构造与数据集错开的公平性,再实现 2 阶段冻结安排,最后才调权重与轮数。还需补的验证是自适应融合是否能避免视频被低精度音频拖累,以及在更长序列与实时约束下的开销。

常见误解是把融合增益当成双向必然提升,本文特有的证据恰恰是单向增益加轻微代价:噪声音频借干净视频显著变好,视频多数组合轻微下降。另一个误解是把单模态去噪当成足够,本文显示其总体不显著,跨模态条件才是关键。带走一句话:在冻结强特征的基础上,先让各模态学会自救,再让坏模态向好模态借证据,才能在噪声下保持情感识别。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总