会议论文 ID:
conference:icassp:2026:icassp-arnumber:11460389
标签:#语音情感识别 #注意力机制 #多模态学习 #正则化
📌 核心摘要
该任务输入为视觉(vision)、音频(audio)、文本(text)三模态未对齐序列,输出为 -3 到 +3 的情感强度回归值,难点在于真实场景中任一模态随机缺失与融合时文本主导导致的模态不平衡。方法链分四步:先以全连接层将各模态映射至统一维度 \(d=128\) 并拼接为全局不完整表示,再由门控序列恢复(Gated Sequence Restoration,GSR)模块以可学习注意力矩阵与偏置从全局上下文重建缺失片段并经门控与原始特征自适应融合,最后由动态平衡跨模态注意力(Dynamic Balanced Cross-modal Attention,DBCA)模块以三路注意力及熵正则约束实现均衡的跨模态信息交换并经多层感知机(Multilayer Perceptron,MLP)回归预测。与依赖生成式映射或固定梯度调制的已有方法不同,该工作在特征层以多重 softmax 约束与最大熵均匀分布约束显式抑制注意力坍缩并保留模态特异性。在 CMU-MOSI 不完整设置(缺失率 0.0 至 0.9 平均)上相对最强基线 EMT-DLFR 的 Acc-7 从 33.1% 提升至 35.4%,在 CMU-MOSEI 完整设置上 Acc-7 达 54.2% 保持竞争力。结论仅在两数据集的随机掩码缺失协议下验证,未检验真实光照、噪声或完全缺失模态的外推能力。原文未披露训练、推理或部署成本。
🧭 深度解读
输入是什么、要预测什么、必须保留什么信息?
多模态情感分析的输入是同一段视频对应的 3 种异构序列:视觉序列、音频序列和文本序列。论文用 Xm 表示第 m 个模态的完整特征序列,形状为 Tm×Fm,Tm 是序列长度,Fm 是该模态的特征维度,m 取值于视觉、音频、文本。目标是从这些序列预测一个情感强度分数,取值范围为负 3 到正 3,负值表示消极,正值表示积极,零附近为中性。必须保留的信息包括两类:一是模态共享的情感线索,例如文本中的积极词汇与笑容同时出现;二是模态特有的线索,例如只有语音语调才能体现的迟疑。
输出是一个连续分数,评估时既看回归误差,也把分数离散化为 2 类、5 类、7 类来算准确率。论文强调真实部署中会出现两类退化:一是模态不完整,环境因素导致某段视觉或音频丢失;二是模态不平衡,融合时模型过度依赖文本等强模态而忽略弱模态的补充。理解这两点是后续所有设计的学习依赖。
同类任务有哪些路线,各自在什么条件下成立?
在相同输入和相同预测目标下,现有工作可分为两条路线。第一条处理模态不完整,常见做法是用生成模型如生成对抗网络或变分自编码器去恢复缺失特征,或从可用模态推断潜在表示。这类方法在论文的描述中成立条件是能够学到稳定的跨模态映射,但在静态映射下容易不加区分地融合,引入无关噪声,且往往忽略长程依赖,难以保留模态特异性。第二条处理模态不平衡,常见做法是加入带固定模态优先规则的辅助分支、梯度混合或动态梯度调制。
这类方法成立条件是能够通过级联子网络或多阶段优化来抑制强模态主导,但会增加结构复杂度,且缺少在特征层面显式约束注意力均衡的机制。论文指出两条路线的共同局限是把修复与均衡分开处理,没有在同一特征交互层面上同时解决缺失与偏置。
因此本文的对照对象既包括面向完整模态的融合模型,也包括专门面向不完整模态的修复模型,比较时需要保持相同的数据集、相同的缺失模拟方式和相同的指标方向,否则无法判断收益是否来自更公平的注意力分配。
问题如何形式化,缺失如何模拟?
论文把问题形式化为从不完整多模态输入预测情感强度。完整特征 Xm 先被随机掩码 mask incom 作用,得到不完整序列 Xm,形状仍为 Tm×Fm,但其中一部分位置被标记为缺失。文本缺失位置用 BERT 词表中的 UNK 标记填充,视觉和音频缺失位置用零填充,掩码值为 0 表示缺失。以视觉部分缺失为例,多模态输入记为{Xv, Xa, Xt},更一般地记为{Xv, Xa, Xt}。每个模态的不完整特征先经过各自的全连接层映射到统一维度 d,得到 Hm,形状为 Tm×d,3 个全连接层参数不共享。
随后把 3 个模态的表示拼接成全局不完整表示 H*G,形状为(Tv+Ta+Tt)×d,拼接操作记为⊕。这种形式化的好处是后续所有注意力与修复操作都在同一维度 d 上进行,便于跨模态比较与融合。需要区分的是,缺失模拟是随机掩码,评估时在 0.0 到 0.9 的缺失率区间内平均结果,而不是只测单一缺失率,这对鲁棒性判断至关重要。
总体框架如何分工,一条样本走完会经历什么?
框架名为动态平衡跨模态注意与门控序列修复,简称 DBCA-GSR,包含两个主要组件。第一步是数据准备与映射:3 模态原始特征经随机掩码与全连接映射得到 Hm,并拼接成 HG。第二步是门控序列修复:以视觉修复为例,模块利用全局不完整表示 HG 与可学习注意力矩阵和偏置向量生成候补修复特征,再用门控将原始不完整特征 Hv 与候补特征自适应融合,得到修复后表示 Hv,同理可得 Ha 与 Ht,并拼接成全局修复表示 HG。
第三步是动态平衡跨模态注意:以修复后表示 Hm 为查询,以全局修复表示 HG 为键和值,计算注意力并用熵正则约束注意力分布趋向均匀,得到均衡后的表示 H≃m。第四步是预测:把 3 个模态的 H≃m 拼接成 H≃G,送入多层感知机预测情感强度,训练时用均方误差与注意力熵约束的加权和作为总损失。沿一条样本走完,信息流是输入序列→统一维度映射→缺失位置的全局上下文修复→门控保留可靠观测→均衡的跨模态交互→回归预测。
** 门控序列修复 × 动态平衡跨模态注意:** 门控序列修复的分工是针对缺失位置利用全局上下文生成候补特征并通过门控与原始输入做自适应融合,负责把不完整序列补到可用状态;动态平衡跨模态注意的分工是在已修复的全局表示上建模模态间信息交换,并用熵正则约束注意力不过度集中于强模态,负责在特征层实现均衡交互。二者搭配的原因是先修复再均衡:若不修复,平衡注意会在空洞上分配权重;若只修复不均衡,强模态仍会压制弱模态。组合后的新增作用是既保留模态特有线索,又让 3 模态在统一尺度下互相补充。
门控序列修复如何计算,怎样只补缺失不改已有?
门控序列修复的核心是用全局上下文为每个模态生成候补特征,并只在缺失位置填充。计算上先定义可学习注意力矩阵 Am 和偏置向量 Bm,以及由全局不完整表示派生的值矩阵 VG = HG WG。Am 按模态分区为 Avm、Aam、Atm,分别对应视觉、音频、文本对全局的关注。修复候补的计算形式为对 3 个分区分别做 softmax 后拼接,再与 VG 相乘并加上 Bm,得到 H•m。论文强调多 softmax 约束的作用是防止注意力跨模态主导,每个分区的 softmax 独立归一,避免强模态的注意力权重压制弱模态。
偏置向量 Bm 的作用是显式编码模态先验,使修复更贴合该模态的特征分布。得到候补后,模块用门控做自适应融合:Gm = sigmoid(wgm [Hm ⊕ H•m] + bgm),其中 wgm 与 bgm 为门控的可学习参数,⊕为拼接,sigmoid 输出 0 到 1 的权重。最终修复表示为 H~m = Gm ⊙ Hm + (1-Gm) ⊙ H•m,⊙为逐元素相乘。为了保证可用特征不受影响,论文明确说明只在 mask incom 为 0 的缺失位置填入修复特征,可用位置保持原值。修复后的 3 模态表示再拼接成 H~G,供后续均衡注意使用。
** 可学习注意力矩阵 × 多 softmax 约束:** 可学习注意力矩阵的分工是像缩放点积注意力那样计算全局不完整表示到待修复模态的关联权重,负责提供长程跨模态的上下文来源;多 softmax 约束的分工是对注意力矩阵按模态分区后分别做 softmax,负责防止单一模态的注意力质量占优而压制其他模态。搭配原因是单一 softmax 会让注意力自然偏向信息量大的模态,多分区 softmax 则强制每个模态内部归一后再拼接。组合后新增作用是在修复阶段就实现去噪与均衡,避免引入无关噪声的低质量重构。
** 偏置向量 × 门控融合:** 偏置向量的分工是显式编码模态先验知识,加到注意力加权后的全局值向量上,负责为不同模态的修复提供差异化起点;门控融合的分工是用 sigmoid 门根据原始不完整特征与修复候补特征的拼接计算逐位置权重,负责在缺失处用修复特征、在可用处保留原始特征。搭配原因是偏置向量保证修复候补本身具有模态特异性,门控则保证最终融合不覆盖已有的可靠观测。组合后新增作用是只在 mask 为 0 的位置填补,且融合比例可随样本自适应。
动态平衡跨模态注意如何用熵约束实现均衡?
动态平衡跨模态注意的目标是在建模跨模态交互的同时抑制强模态主导。给定修复后模态表示 Hm 与全局修复表示 HG,模块定义查询 Qm = Hm WQ,键 KG = HG WK,值 VG = HG WV,其中 WQ、WK、WV 为可学习投影矩阵。注意力表示计算为 H≃m = softmax(Qm KG^T / sqrt(dK)) V~G,记注意力分布为 AGm。论文把 AGm 解释为概率质量函数,模态 m 关注全局第 i 个位置的概率记为 P(m→i)=Aim,i 取值于视觉、音频、文本对应的索引区间。具体分区为 Avm 取 AGm 的前 Tv 行,Aam 取中间 Ta 行,Atm 取最后 Tt 行。
熵的定义为 E(AGm)= -求和 Aim log Aim,求和遍历 3 个模态分区,衡量注意力分配的均匀程度。由拉格朗日乘子法可知当 Aim=1/M 时熵最大,最大值为 logM,M 为模态数 3。为了鼓励均衡,模块最小化经验分布与均匀分布 U 的 KL 散度:LKL(m)=求和 Aim log(Aim/(1/M)) = logM - E(AGm)。最终注意力正则损失为 Law = 对 m 求和 LKL(m)。这种软约束的好处是不强制硬性平均,而是在特征层面推动注意力趋向均匀,同时保留对关键模态线索的敏感性。
** 注意力分布 × 熵正则:** 注意力分布的分工是将 DBCA 中查询对全局键的相似度归一化为概率质量函数,负责量化每个模态关注全局各位置的程度;熵正则的分工是将该分布与均匀分布的 KL 散度作为损失,负责推动分布趋向均匀。搭配原因是熵在均匀分布时取得最大值 logM,KL 散度恰好等于 logM 减熵,最小化 KL 等价于最大化熵。组合后新增作用是在不引入硬性平均的前提下以软约束实现特征层面的均衡交互,同时保留对关键模态线索的敏感性。
训练如何组织,损失、优化与早停如何配合?
训练阶段的输入是不完整多模态序列,监督信号是真实情感强度分数。预测模块把 DBCA 输出的 3 模态表示 H≃m 拼接成全局上下文表示 H≃G,送入多层感知机得到预测值 y_hat。回归损失定义为预测与真实值的均方误差 Lcls = MSE(y_hat, y)。注意力正则损失 Law 按上一节定义计算。总损失为 Ltotal = λcls·Lcls + λaw·Law,其中 λcls 与 λaw 为权衡超参数,论文取值为 2 和 1。
优化器采用 Adam,BERT 参数的学习率为 5×10^-5,其余参数为 1×10^-5,批量大小为 32,特征维度固定为 d=128。训练在未对齐的模态特征上进行,采用早停策略,耐心为 8 个轮次以防止过拟合。需要明确的是,论文未报告冻结 BERT 或全量微调的逐层细节,也未给出梯度是否在修复与注意模块间截断的显式说明,因此复现时应按原文超参数保持优化设置一致,并在验证集上监控总损失与回归损失的变化,避免因熵约束过强导致注意力过度均匀而损失判别力。
** 回归损失 × 注意力权重熵约束损失:** 回归损失的分工是用均方误差衡量预测情感强度与真实标签的差距,负责主任务的监督;注意力权重熵约束损失的分工是对 3 个模态的注意力分布分别计算与均匀分布的 KL 散度并求和,负责约束跨模态注意力不过度集中。搭配原因是用两个超参数 λcls 与 λaw 加权求和形成总损失,兼顾拟合精度与均衡性。组合后新增作用是让模型在优化预测的同时显式学习平衡的跨模态交互,避免仅靠主任务梯度导致的模态偏置。
在什么数据、什么协议、什么指标下比较?
实验在两个公开情感分析数据集上进行。CMU-MOSI 包含来自 93 个视频的 2199 个片段,涉及 89 个说话人;CMU-MOSEI 包含来自 1000 个说话人和 250 个主题的 23453 个手工标注视频片段。每个样本的标签为负 3 到正 3 的情感强度分数。评估同时采用回归与分类指标:回归用平均绝对误差 MAE 和皮尔逊相关系数 Corr,MAE 越低越好,Corr 越高越好。
分类将连续分数离散化为类别,用 7 类准确率 Acc-7、5 类准确率 Acc-5、2 类准确率 Acc-2 和 F1 分数,均为越高越好。2 类设置下 Acc-2 与 F1 按两种方案计算,一是负值对非负值含零,二是负值对正值不含零,结果以 x/y 形式报告,左侧对应负/非负,右侧对应负/正。比较的基线包括面向不完整模态的代表方法:多模态 Transformer、模态不变与特有表示、自监督多任务多模态学习、多模态信息最大化、基于 Transformer 的特征重建网络、带双层特征修复的高效多模态 Transformer 以及语言主导的抗噪学习网络。
实验分两种条件:完整模态与不完整模态。不完整条件下缺失率从 0.0 到 0.9 均匀采样,结果取平均,以考察对随机缺失的鲁棒性。实现上模型用 PyTorch 搭建,特征未对齐,训练与评估的划分与指标聚合均按数据集原始协议执行。
下表总结了论文报告的数据集规模、标签范围与核心训练配置,便于核对实验条件是否一致。
| 数据集/配置项 | 规模与来源 | 标签与任务 | 关键超参数 | 优化与早停 |
|---|---|---|---|---|
| CMU-MOSEI | 23,453 clips 来自 1,000 speakers,250 topics | 同上,含 Acc-7/Acc-5/Acc-2/F1 | 损失权重 λcls=2,λaw=1 | 同上,未对齐特征 |
该表对应的文本证据明确给出了数据集规模、标签范围、优化器与损失权重,便于复现时逐项对齐,避免因学习率或批量大小不一致导致的不公平比较。
主结果在什么条件下与谁比,关键数字与方向如何?
主结果的比较问题是:在完整与不完整两种条件下,DBCA-GSR 是否在相同数据集和相同指标下优于已有的可运行基线,且在不完整条件下的平均性能是否保持稳定。公平条件是所有方法在相同缺失模拟与相同指标定义下评估,MAE 越低越好,其余指标越高越好。
| 条件 | 数据集 | 指标 | 基线最优 | 本文方法 | 提升说明 |
|---|---|---|---|---|---|
| 不完整平均 0.0-0.9 | CMU-MOSI | Acc-7 ↑ | 33.1 | 35.4 | 提升 2.3 个百分点 |
表后解释需要同时看到收益与代价。在不完整条件下,论文报告本文方法在 CMU-MOSI 与 CMU-MOSEI 上均取得 MAE、Corr、Acc-7、Acc-5 的最优平均结果,尤其在 CMU-MOSI 上 Acc-7 较最强基线提升 2.3 个百分点,支持其对随机缺失的鲁棒性与泛化能力。在完整条件下,方法仍保持竞争性,在 CMU-MOSI 的 Acc-7 与 Acc-5 以及 CMU-MOSEI 的 Acc-7 等指标上取得最优或次优,说明改进不限于缺失场景,也有助于完整模态下的特征交互与表示学习。
未胜出项方面,完整条件下 CMU-MOSI 的 MAE 最优为 0.712,本文为 0.718,Corr 最优为 0.798,本文为 0.794,说明在个别回归指标上仍有基线略优,提示均衡约束可能在完整数据上带来轻微的拟合权衡。所有比较均基于相同的不完整平均协议与相同的分类离散化方式,避免把不同缺失率或不同 2 类划分下的数值直接对比。
消融与模态组合如何反证各模块的作用?
消融实验的目的是验证门控序列修复与熵约束各自是否带来可复现的增益,以及多模态是否真正优于单模态。实验在 CMU-MOSEI 的不完整平均条件下进行,缺失率同样从 0.0 到 0.9 平均。
| 模块配置 | MAE ↓ | Corr ↑ | Acc-7 ↑ | Acc-5 ↑ | Acc-2 ↑ | F1 ↑ |
|---|---|---|---|---|---|---|
| 仅跨模态基线 | 0.769 | 0.491 | 46.4 | 46.7 | 73.0 / 73.8 | 73.1 / 73.9 |
| 跨模态+GSR | 0.673 | 0.572 | 47.3 | 47.9 | 74.3 / 77.1 | 75.0 / 77.1 |
| DBCA 不含熵约束 | 0.671 | 0.580 | 47.2 | 47.9 | 72.3 / 76.1 | 73.3 / 76.2 |
| DBCA-GSR 完整 | 0.658 | 0.591 | 48.1 | 48.9 | 77.8 / 77.8 | 76.9 / 77.6 |
表后解释显示两点支持性证据。其一,加入 GSR 的跨模态基线相比不含 GSR 的基线在 MAE 上从 0.769 降至 0.673,Corr 从 0.491 升至 0.572,说明全局修复机制在相同跨模态骨干上稳定提升不完整条件下的平均性能。其二,DBCA 完整版相比不含熵约束的 DBCA 在 MAE、Corr、Acc-7 等指标上均有提升,支持熵均衡缓解了对特定模态的过度依赖。代价与边界方面,DBCA 不含熵约束在 Acc-2 上为 72.3/76.1,低于跨模态+GSR 的 74.3/77.1,说明仅做均衡而不修复时 2 类判别可能受限。
| 模态组合 | MAE ↓ | Corr ↑ | Acc-7 ↑ | Acc-5 ↑ | Acc-2 ↑ | F1 ↑ |
|---|---|---|---|---|---|---|
| 仅视觉 | 0.783 | 0.409 | 41.4 | 41.7 | 67.6 / 67.4 | 67.7 / 66.4 |
| 仅音频 | 0.800 | 0.376 | 41.2 | 41.3 | 67.1 / 67.1 | 67.5 / 66.3 |
| 仅文本 | 0.562 | 0.712 | 52.7 | 54.1 | 81.8 / 84.6 | 82.2 / 84.5 |
| 视觉+ 音频 | 0.768 | 0.421 | 42.7 | 43.0 | 68.7 / 69.3 | 68.9 / 69.4 |
| 视觉+ 文本 | 0.586 | 0.749 | 53.3 | 55.2 | 79.2 / 84.7 | 79.9 / 84.8 |
| 音频+ 文本 | 0.587 | 0.746 | 53.2 | 54.9 | 79.6 / 84.8 | 80.0 / 84.9 |
| 视觉+ 音频+ 文本 | 0.535 | 0.769 | 54.2 | 56.1 | 84.8 / 86.2 | 84.6 / 86.1 |
该表显示单模态中文本最强,多模态组合普遍优于单模态,且 3 模态齐全时取得最优,支持 DBCA 在多模态下防止对单一模态过度依赖的论断。未胜出项是视觉+ 音频组合在多数指标上仍弱于仅文本,说明弱模态组合若无文本参与,收益有限,这与文本在情感分析中的主导地位一致。
哪些边界未被验证,哪些代价需要权衡?
论文的验证边界需要明确区分已报告与未验证的部分。已报告的是在 CMU-MOSI 与 CMU-MOSEI 上,缺失率 0.0 到 0.9 平均条件下的回归与分类指标,以及模块与模态的消融结果。未验证的边界包括:缺失模式是否为随机均匀掩码之外的结构化缺失,例如整段文本完全缺失或连续视觉帧丢失时的表现未单独报告;不同缺失率下的逐点曲线未在文本中以可重放数值给出,无法判断收益是否在高缺失率下依然单调。
推理延迟、显存占用与训练时长等成本未量化,无法评估门控与熵约束带来的额外开销。代价权衡方面,熵约束推动注意力均匀,可能在完整模态下削弱对强模态关键线索的聚焦,这与完整条件下个别回归指标略低于最强基线的现象一致。门控修复依赖全局上下文,若全局表示本身噪声较大,修复候补质量可能下降,此时门控虽能抑制覆盖,但仍需承担额外的参数与计算。
此外,论文未提供代码、模型权重或数据的可下载链接,资源状态为未发现完成 HTTPS 验证的绑定,因此不能声称代码或模型已公开,复现需自行实现。
复现前先做什么,如何保证条件一致?
复现的第一步是按原文重建数据与缺失模拟。视觉、音频、文本特征需分别提取,文本缺失用 UNK 填充,视觉与音频缺失用零填充,并记录 mask incom 以便只在缺失位置填入修复特征。全连接映射需为 3 模态各自独立,统一到 d=128。GSR 的实现要点是维护可学习注意力矩阵 Am 与偏置向量 Bm,按模态分区做 softmax 后再与 V*G 相乘,门控的输入为原始与候补的拼接,输出经 sigmoid 得到逐位置权重。DBCA 的实现要点是按修复后表示计算 Q、K、V,注意力分布按 Tv、Ta、Tt 分区解释为概率质量函数,并计算熵与 KL 散度形成 Law。
训练时总损失为 2·Lcls + 1·Law,优化器 Adam,BERT 学习率 5×10^-5,其余 1×10^-5,批量 32,早停耐心 8。评估时需严格复刻指标:MAE 与 Corr 为回归,Acc-7、Acc-5、Acc-2、F1 为分类离散化结果,2 类需同时报告负/非负与负/正两种划分的 x/y 形式,且不完整结果需在 0.0 到 0.9 缺失率上平均。常见误解是把自动指标的提升等同于人工感知的提升,或把完整条件下的最优直接推广到不完整条件,需分别报告两种条件。另一误解是认为门控必然提升所有指标,实际上消融显示不同指标对修复与均衡的敏感度不同,应逐指标核对。
何时值得尝试,还需补哪项验证?
当任务同时面临随机缺失与模态不平衡,且文本等强模态可能缺席时,本文的先修复后均衡的思路值得尝试。其价值在于把修复放在特征层并用门控保留可靠观测,再用熵软约束在注意力层面实现均衡,既不引入硬性平均,也不依赖级联子网络的多阶段优化。适用条件是能够获得全局上下文表示且缺失位置可通过掩码明确标识;若缺失完全无规律或全局上下文本身不可靠,修复收益可能受限。
后续验证建议补充三项:一是按缺失率分档报告逐点曲线,明确在高缺失率下的稳定性;二是报告推理延迟与显存占用,量化门控与熵约束的实际成本;三是测试结构化缺失与跨数据集迁移,检验方法在更贴近部署的噪声下的泛化。总体上,论文在两个基准数据集上以可运行基线为对照,提供了完整与不完整双条件下的多指标证据,支持其在处理异构不完整序列方面的有效性,但仍需在成本与更复杂缺失模式上补足验证后再做部署决策。