英文题目:Robust Audio-Visual Emotion Recognition via Conditional Transformer U-Nets with Frequency-Injected Visual Stream

会议身份:conference:interspeech:2026:conference-paper-id:chung26b_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #Transformer #鲁棒性 #音视频 #语音情感识别

评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Hanwook Chung:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

音视频情感识别需从语音与人脸视频联合预测情绪类别,背景噪声与混响会破坏音频线索并导致融合失配。该方法输入为噪声混响语音波形与人脸视频剪辑,输出为离散情绪标签。音频流模块先由卷积Transformer前端在64维对数梅尔滤波器组域做时变逆滤波重构以同时抑制噪声与长混响,再与视觉流模块的卷积Transformer U-Net编码器分别抽取紧凑瓶颈表征,其中视觉支路对查询、键与值的空间维做一维快速傅里叶变换并拼接对数幅度谱分支以增强表情动态。两路瓶颈经时间压缩对齐、拼接与提示生成模块引导后送入融合情感解码器分类,同时两路辅助解码器以预测情感嵌入为条件重构中间特征并以平均绝对误差正则化表征。训练分两段:先以平均绝对误差训练前端逼近干净特征并冻结,再以交叉熵加两路重构损失联合优化双U-Net与融合解码器。在CREMA-D上融合模型达到非加权平均召回率89.14%与加权平均召回率89.11%,在RAVDESS音视子集上达到91.69%与90.97%,高于同表HiCMAE约4.2和3.7个百分点。结论仅在4秒短剪辑、MTCNN正面人脸与NOISEX-92加DEMAND加C4DM合成退化下验证,未测试遮挡、模糊、低光照与真实远场偏移。原文未披露参数量、训练硬件与推理成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要解决什么退化?

本文的输入是带人声的视频片段,输出是对整段的情绪类别判断。学习者可以把任务想成老师听学生朗读并看表情后打一个情绪标签,标签集合在不同数据上不同,例如愤怒、厌恶、恐惧、高兴、中性、悲伤等。研究默认从原文独立写作,事实只来自论文正文证据与本次收到的官方原图像素,不继承外部评价。必须保留的信息包括数据划分与噪声混响条件、特征做法、冻结与更新安排、指标方向与聚合方式,输出是 1 篇可核对、可复述方法的技术解读。

语音情感识别容易受背景噪声和混响破坏,噪声在时域近似为加性过程,混响是语音与房间冲激响应的卷积,二者叠加后语音能量分布被掩盖或拖尾,仅靠音频分支难以稳定分类。音视频情感识别希望用脸部表情补偿受损音频,但若融合时不对退化建模,差的音频特征仍会污染联合表示。本文因此把鲁棒性放在首位,既在音频端做增强,又在视觉端加强细微动态建模,再用条件重建约束保证融合前的单模态表示是情绪一致的。后续按任务与路线、方法全景、组件计算、训练与推理、实验条件、结果与反证、复现与收束展开,每节只承担一个教学任务。

已有路线在何处止步,本文接在哪个缺口上?

第一条路线是语音情感识别中的辅助特征解码器。早期有用预测情绪嵌入参与卷积 U-Net 辅助解码的做法,后来扩展到卷积 Transformer U-Net 与更复杂的条件方案,其作用是以重建损失增加监督并保持情绪一致性。本文沿用该思想,但把条件解码同时放在音频流与视觉流,而不是只做单模态。

第二条路线是语音增强前端。常见做法是在对数功率谱上做渐进掩蔽估计,但特征维数高、计算代价大,也有直接增强低维梅尔倒谱系数以降低复杂度的做法。本文选择在对数 Mel 滤波器组域操作,并引入基于逆滤波的重建方法处理强混响,区别于只做掩蔽的频域增强。第三条路线是频率感知建模。在图像复原中频谱线索常辅助空间特征做去模糊去噪,在视觉情感识别中则有傅里叶预处理、小波频率局部性注意力与谱线性注意力等尝试。本文的不同是把傅里叶变换特征直接注入卷积 Transformer 的查询键值,与空间分支拼接后联合建模,而不是只做预处理。

在音视频融合侧,已有混合融合缓解声学噪声、早晚融合加跨模态注意力提升噪声下性能的报道,但原文指出这些工作未显式建模鲁棒性或主要依赖数据多样性。本文因此把显式处理噪声与混响作为主线,用增强前端、频率注入视觉建模与情绪条件重建三者配合进入融合,而不是只增加数据扰动。

样本从波形和视频帧出发要经历哪些变换?

沿一个样本走完全程有助于建立坐标系。假设取一段 4 秒视频,先做音视频分离。音频侧把波形重采样到 16 千赫,做预加重,再用 512 点汉明窗、50% 重叠做短时傅里叶变换,提取 64 维对数 Mel 滤波器组特征并做帧级零均值归一化,得到时间帧数乘特征维的矩阵。视频侧用人脸检测器裁出脸部区域,缩放到 224 乘 224 乘 3,用 ImageNet 均值与标准差归一化,时间上降采样为原来的 1/4 以减少冗余,训练时对 25% 样本做随机水平翻转,再用预训练人脸网络提特征并与视觉网络联合优化。

随后音频特征先经前端增强得到干净估计,再与视觉特征分别进入各自的卷积 Transformer U-Net 编码器压缩为瓶颈表示,两个瓶颈经时间对齐与维度对齐后拼接,送入融合情绪解码器得到情绪状态。训练时另有两条辅助解码支路,分别以预测情绪嵌入为条件重建音频与视觉中间特征,用重建损失约束表示学习。推理时主要路径是增强、编码、融合与分类,辅助重建不直接产生标签,但其训练效果保留在编码器参数中。教学例子仅为帮助理解流程,不附加无源数值或效果断言。

双路 U-Net 与融合解码器如何分工?

方法全景可概括为 2 流一融合。音频流模块包含特征提取、前端增强、音频情感编码器与音频特征解码器,视觉流模块包含特征提取、视觉情感编码器与视觉特征解码器,中间由融合情绪解码器汇合。原文图 1 把这种分工画成左上总体框图、左下音频与视觉共用的 U-Net 版式、左下音频前端细节与右列子模块,值得对照阅读。

下段先给出导读,读图时先看主路径再看条件支路。总体框图左侧红色为视觉流,右侧蓝色为音频流,中间绿色为融合情绪解码器与预测情绪,虚线表示预测情绪嵌入回送到两侧辅助解码器,橙色小框为前端编码器与重建。左下 U-Net 版式上方为编码下采样主路,下方为带情绪嵌入的上采样辅路,跳跃连接在同尺度间传递细节。

看图路径: 1. 先沿左上总体框图从视频切分与音频采样走到视觉流与音频流再汇入融合情绪解码器;2. 再看左下 CTr U-Net 主路下采样与辅路带情绪嵌入上采样的跳跃连接位置;3. 对照左下音频前端从时移堆叠到求和输出增强特征的支路;4. 核对右列子模块中卷积注意力与情绪嵌入时间拉伸的输入输出标注

原论文 Figure 1:Block diagrams of proposed robust AVER model.

论文图 1。原论文 Figure 1:“Block diagrams of proposed robust AVER model.”。

上图显示了双路结构与子模块的对应关系。可见内容支持以下核对:音频样本先经特征提取再进前端增强,视频片段先切分出图像块再经特征提取,两侧瓶颈都指向融合情绪解码器;子模块中卷积块、下采样、上采样、卷积 Transformer、卷积注意力、通道注意力与情绪嵌入时间拉伸均有独立小图;融合部分包含时间压缩、重塑、提示生成模块与分类。像素可辨的标注包括通道数 32、卷积核尺寸与上下采样方式,数值细节以正文为准,不猜测图中未标注的维度。这种版式把增强、表示与融合解耦,便于消融时逐个替换前端、频率注入与情绪条件。

音频前端与编码器做了什么计算?

音频特征提取把含噪混响语音建模为房间冲激响应卷积干净语音再加噪声。对给定波形提取对数 Mel 滤波器组系数作为音频 U-Net 输入,记为时间帧乘特征维矩阵。该表示近似人耳频率分辨率,把语音能量分布压缩为紧凑谱表示。

前端模块包含多个卷积 Transformer 块与重建阶段,采用帧级处理。传统掩蔽假设冲激响应短于时频分析窗,在强混响下不成立,本文采用的卷积传递函数观点把混响表示为时间上的卷积,基于此的逆滤波模型估计时变逆滤波器。实现上把对数 Mel 特征做时移并堆叠为滤波器长度乘时间乘频率的 3 维张量,与估计的逆滤波器逐元相乘再沿通道求和,得到增强特征。原文明确该操作直接在对数 Mel 域同时处理混响与噪声。

音频 U-Net 由音频情感编码器与特征解码器组成。核心是卷积 Transformer,其卷积注意力对查询键值先做核长为 3 的卷积,再按多头切分做帧级通道注意力,每个时间帧独立计算通道间注意力图,随后经卷积前馈处理。编码器输出的音频瓶颈送入融合解码器,辅助特征解码器把预测情绪嵌入先做时间拉伸对齐隐特征,再通道拼接卷积、与隐特征相乘、再与原隐特征拼接以保留残差信息,重建结果记为与输入同尺寸的音频特征矩阵。

卷积 Transformer × U-Net: 卷积 Transformer 负责在每个尺度上用卷积生成的查询键值做帧级通道注意力与卷积前馈,捕捉上下文与时空依赖,U-Net 负责用下采样编码压缩到瓶颈再用上采样解码重建并保留跳跃连接,二者搭配的理由是注意力需要多尺度紧凑表示才能稳定学习,组合后新增的作用是以瓶颈特征同时支撑情感分类与条件重建。

逆滤波前端 × 对数 Mel 滤波器组: 对数 Mel 滤波器组分工是将波形经预加重、分帧加窗与 Mel 滤波压缩为感知 motivated 的低维能量分布作为网络输入,逆滤波前端分工是在该域估计时变逆滤波器并对时移堆叠特征做逐元相乘再沿通道求和以反演卷积性混响,二者搭配是因为直接在低维域增强可降低计算量并绕开短窗假设,组合后得到增强语音特征再送入音频编码器。

视觉频率注入与融合解码器如何配合?

视觉特征提取对每帧序列用预训练人脸网络提特征,得到帧数乘特征维矩阵,并与视觉 U-Net 联合优化。视觉 U-Net 大体沿用音频 U-Net 结构,区别在于频率注入过程。具体地,对查询键值的空间分支沿空间维做 1 维快速傅里叶变换,取对数幅度谱再做核长为 3 的卷积得到频谱分支,把空间与频谱分支沿通道拼接形成 2 倍通道的查询键值,编码器输出的视觉瓶颈送入融合解码器,重建结果为与输入同尺寸的视觉特征矩阵。

融合情绪解码器先把音频瓶颈做时间压缩以对齐视觉帧数,再做卷积投影对齐维度,拼接后经卷积 Transformer 块、帧级平均池化与 Softmax 分类得到情绪状态。为增强判别力,引入提示生成模块学习情绪专用提示,经逐元操作与拼接引导注意力关注情绪相关表示。沿样本看,瓶颈对齐解决时长不一致,提示解决情绪类别间的细粒度区分,条件重建解决单模态表示漂移,三者作用正交。

频率注入 × 视觉流: 视觉流分工是用 EfficientFace 提脸部特征并用 CTr U-Net 学习表情动态的瓶颈表示,频率注入分工是对查询键值的空间分支再做 1 维快速傅里叶变换取对数幅度谱并卷积得到频谱分支,二者搭配的理由是细微表情在空间域不易分辨而频域可补充纹理与边缘变化,组合后经通道拼接形成空间谱联合注意力以增强视觉判别力。

情绪条件辅助解码器 × 融合情绪解码器: 融合情绪解码器分工是将音频与视觉瓶颈做时间对齐、拼接与 CTr 处理后经池化与 Softmax 输出情绪状态,情绪条件辅助解码器分工是将预测情绪嵌入经时间拉伸后与隐特征拼接卷积相乘再残差拼接以重建中间特征,二者搭配的理由是让重建损失受情绪一致性约束,组合后新增的作用是以正则化重建同时加强单模态表示学习与跨模态融合。

两阶段训练冻结了什么,损失来自哪里?

整体训练分 2 个阶段。第一阶段训练前端模型,最小化干净与估计对数 Mel 系数之间的平均绝对误差。第二阶段冻结前端,只联合优化音频与视觉 U-Net 及融合解码器,目标由三项组成:情绪交叉熵损失加音频重建平均绝对误差加视觉重建平均绝对误差,其中两项重建系数的原文取值为千分之一量级。目标情绪标签记为类别乘时间的矩阵,瓶颈与重建的梯度路径按原文仅说明经由编码器与解码器回传,未报告的细节不推定。

优化器采用 Adam,训练 200 轮,批量大小为 20,初始学习率为 10 的负 4 次方,每 20 轮衰减 15%。前端冻结意味着第二阶段增强参数不再更新,梯度只调整编码、解码与融合部分,监督来源包括人工情绪标签与干净谱及原始视觉特征的重建目标。原文未报告梯度裁剪、权重衰减、早停阈值与参数重置时机,这些缺项在复现时需如实记录为未报告,不能从模型名称推定实现。辅助解码器的条件来自预测情绪嵌入,训练时允许重建损失把情绪一致性压力传回编码器,这是加强单模态与融合的机制所在。

数据、退化构造与评价口径是什么?

数据采用 CREMA-D 与 RAVDESS 的视听子集,鲁棒语音实验另加 IEMOCAP。CREMA-D 含 6 类情绪,RAVDESS 含 8 类情绪,IEMOCAP 按常见做法合并高兴与兴奋后用 4 类情绪,并在即兴与混合会话上分别报告。视频最长切分为 CREMA-D 与 RAVDESS 为 4 秒,IEMOCAP 为 8 秒,音频统一重采样。评价采用 5 折交叉验证,以非加权平均召回率与加权平均召回率为主指标,数值越高越好,并辅以混淆矩阵观察类间混淆。

退化构造用加性噪声与房间冲激响应模拟。噪声来自 NOISEX 与 DEMAND,混响来自 C4DM,文件分为见过与未见两类:见过类型同时用于训练与测试,未见类型只用于测试以考查泛化。加噪信噪比在负 10 到 20 分贝范围内用于训练与测试。特征侧音频为 64 维对数 Mel 滤波器组,视频为人脸裁剪归一化与降采样。比较公平性上,消融内对比是否含前端、是否频率注入、是否情绪嵌入,外部对比区分单模态与多模态基线,并把干净训练与退化训练分开报告,避免把不同训练条件下的数字直接比大小。当前资源状态下未发现可验证的代码模型数据链接,不得声称已公开。

主结果在什么条件下比过了谁,混淆矩阵说明了什么?

主结果按干净与鲁棒两类组织。干净音视频任务上,带频率注入与情绪条件的模型在 CREMA-D 与 RAVDESS 的音频、视觉与融合三档均报告最优附近的数字,仅 RAVDESS 上有个别外部方法在加权召回上更高,原文明确指出该例外。鲁棒语音任务上,逆滤波前端在多信噪比下优于掩蔽前端与无前端基线。鲁棒音视频任务上,带前端的融合模型在见过与未见退化下保持稳定,显著高于仅干净训练的基线,支持视觉补偿受损音频的判断。

下表整理鲁棒语音消融的关键数字,比较问题是同一退化平均下不同前端策略是否有增益,公平条件是同数据同划分同指标平均,指标方向为越高越好。表中条件为数据集平均,指标为非加权与加权召回,基线为仅干净训练与退化训练两种可运行策略,本方法为逆滤波前端。

条件指标仅干净训练含退化训练逆滤波前端
CREMA-D 平均非加权召回36.5858.6360.50
CREMA-D 平均加权召回37.4058.5460.06
RAVDESS 平均非加权召回39.3272.4973.65
RAVDESS 平均加权召回40.4872.4973.67

上表显示从仅干净训练到含退化训练有大幅提升,逆滤波前端在此基础上进一步提高,代价是前端需单独预训练并冻结,增加了流程复杂度。未胜出项是部分掩蔽前端在个别子集上接近逆滤波,需结合未见噪声条件看泛化差距,不能只看平均值。下表整理干净任务的单模态与融合数字,条件为数据集,指标方向同样越高越好。

条件指标音频本方法视觉本方法融合本方法
CREMA-D非加权召回71.3484.9289.14
CREMA-D加权召回71.3085.2889.11
RAVDESS非加权召回82.3276.4391.69
RAVDESS加权召回83.3377.4390.97

融合高于任一单模态,支持互补假设,但不同数据集上音频与视觉的相对强弱互换,说明模态贡献与数据相关,不能推广为视觉恒优。

下段导读混淆矩阵图:4 个子图分别为语音、视觉、融合与鲁棒融合,横轴为预测、纵轴为真实,类别缩写对应愤怒、厌恶、恐惧、高兴、中性、悲伤,颜色越深数值越大。重点看对角线与非对角混淆是否随融合减轻。

看图路径: 1. 先确认四个子图标题与横轴预测纵轴真实的六类情绪排列是否一致;2. 再逐行比较语音单模态与视觉单模态对角线深浅与混淆位置差异;3. 观察融合后与鲁棒融合下恐惧与悲伤两行的非对角数值变化

原论文 Figure 2:Confusion matrices for CREMA-D.

论文图 2。原论文 Figure 2:“Confusion matrices for CREMA-D.”。

上图可见语音子图在悲伤中性恐惧之间混淆较重,视觉子图对高兴与厌恶的对角更深,融合后多数对角加深且非对角变浅,鲁棒融合下恐惧行向悲伤的泄漏仍明显,说明退化主要损伤声学相似类的可分性,视觉补偿不能完全消除该混淆。像素不能精确辨别的格点小数不硬写,具体数值以正文表格为准。

拿掉频率注入与情绪条件会发生什么变化?

消融围绕 3 个开关展开:视觉是否频率注入、辅助解码是否情绪条件、音频是否有增强前端。视觉消融以无辅助解码的卷积 Transformer 编码器为基线,加入频率注入后性能提升,再加入辅助解码后进一步提升,支持空间谱联合建模与正则化重建各自有效的判断。融合消融在已用频率注入的前提下比较有无情绪嵌入,有情绪条件的一组更高,支持跨模态交互被情绪一致性加强的解释。

音频鲁棒消融比较仅干净训练、退化训练无前端、掩蔽前端与逆滤波前端。仅干净训练在退化测试下显著下降,退化训练恢复大部分性能,掩蔽前端在部分集上有效但在强混响下受限,逆滤波前端取得总体最优。反例是掩蔽前端在个别信噪比或子集上与逆滤波接近,说明前端收益与退化类型相关,不能断言所有条件下逆滤波恒胜。未评测边界包括视觉模糊噪声等退化,原文未来工作明确提出要补视觉鲁棒性。

训练与部署成本按原文交代:前端单独训练后再冻结,主网络训练 200 轮,批量 20,学习率按固定 schedule 衰减。原文未报告参数量、浮点运算量、推理延迟与显存占用,因此不能承诺延迟或成本改善,总体趋势不等于每组每步都成立。复现时应先固定退化划分与信噪比网格,再逐个开关做受控对比,并保留未见噪声文件的隔离。

哪些结论有边界,哪些量没有被测量?

已验证的边界包括数据集差异与未见退化。RAVDESS 上个别外部方法在加权召回上更高,说明最优性与数据相关。未见噪声与未见混响下的数字普遍低于见过条件,说明泛化仍有损失。混淆矩阵显示恐惧与悲伤等声学相似类的混淆在鲁棒条件下残留,视觉补偿减轻但未消除。

未测量的量包括误判率分解、延迟、吞吐、模型大小与训练能耗,原文未报告这些量,因此不能声称实时性或轻量优势。统计显著性、置信区间与多次种子的方差也未报告,数值比较应表述为报告显示而非因果断言。相关性不等于因果,重建损失与性能提升并存支持正则化有效的解释,但未做因果分离实验的条件下应保留为可能与待验证。原文表头与图注若出现口径冲突,应明确标注冲突而不自行编造划分来圆成一致。

要复现应先固定什么,再跑什么?

复现先固定信息条件:数据集版本与情绪映射、5 折划分、噪声与混响的见过未见文件清单、信噪比网格、音频采样率与分帧参数、视频人脸裁剪与归一化、最大时长与降采样因子。关键超参数包括 64 维对数 Mel、帧级零均值归一化、Adam 批量 20 训练 200 轮、初始学习率与每 20 轮衰减 15%、重建系数千分之一、前后端 2 阶段冻结安排。先跑仅干净训练与退化训练两个可运行基线,再依次加入掩蔽前端、逆滤波前端、频率注入与情绪条件,每步保留非加权与加权召回及混淆矩阵。

还需补的验证包括未见噪声文件的严格隔离测试、不同混响强度分档报告、视觉退化补充实验与多次种子的稳定性报告。代码、权重与数据可用性以资源状态为准,本次未发现可验证的公开链接,不得写已公开或当前可用,只能写链接当前不可用或本次未能确认可达。区分代码开源、权重下载与系统可运行三者,缺少任一都不等同于可部署收益。

何时值得尝试这套做法,如何一句话记住它?

当应用必须在噪声与混响下做音视频情绪判断,且视觉可用时,值得尝试该做法:音频侧用低维域逆滤波先恢复能量结构,视觉侧用频率注入捕捉细微表情动态,融合前用情绪条件重建保持两侧表示一致,最后再做对齐融合与提示引导分类。若只有干净音频或视觉缺失,不必照搬全套,可按需取用前端或频率注入之一。

常见误解是把融合增益当成视觉恒优,实际 2 数据集上单模态强弱互换,增益来自互补而非单一模态压倒另一模态。另一误解是把辅助重建当成推理必需,实际推理主路径不依赖重建输出,重建的作用已沉淀在编码器参数中。记住一句话:先在各自模态把退化与细节处理干净并用情绪约束对齐,再融合才稳定。未来可按原文方向补文本线索与自监督训练,并把视觉模糊噪声纳入鲁棒评估。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总