📄 Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations
标签:#音视频理解 #多模态模型 #鲁棒性 #音频理解 #Transformer
6.2/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5
✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #多模态模型 | #鲁棒性 #音频理解 | arxiv
👥 作者与机构
- 第一作者:Chunlei Meng(复旦大学)
- 通讯作者:Chun Ouyang(复旦大学)
- 作者列表:Chunlei Meng(复旦大学)、Jacqueline J. Pang(未说明)、Pengbin Feng(未说明)、Zhenyu Yu(未说明)、Chun Ouyang(复旦大学)、Zhongxue Gan(复旦大学)
💡 毒舌点评
论文对不完整多模态情感分析中的模态可靠性问题给出了清晰且动机良好的诊断,显式建模的思路具有洞察力;实验对比全面,消融分析扎实。然而,可靠性代理目标完全由模型自身预测派生,存在循环论证风险,且代码与权重完全未公开,使得这一框架的真实泛用性和实现细节存疑——如果不能开源,该工作的工程参考价值将大打折扣。
📌 核心摘要
本文针对现实场景中多模态情感分析(MSA)常面临模态缺失导致信息不可靠的问题,提出了一种显式建模样本级模态可靠性的框架 MRCF。该框架包含三个紧密耦合的模块:可靠性感知分支(RAB)从模态内部质量与跨模态语义一致性估计可靠性分数;可靠性引导交互分支(RGIB)利用估计分数调节跨模态消息传递,抑制低可靠模态的信息流向高可靠模态;可靠性校准融合模块(RCFM)则结合语义与可靠性线索完成最终预测,并在训练时以完整观测的融合锚点进行校准。与先前仅隐式处理或忽略可靠性的方法不同,MRCF 首次将可靠性作为可学习的样本特异性变量,并贯穿交互与融合全过程。在 CMU-MOSI、CMU-MOSEI 和 CH-SIMS 三个基准上的实验表明,MRCF 在多种缺失率与缺失模式下均达到或超越现有最强方法。在 IMM 设置下,MRCF 在 MOSI 上取得 F1 74.39%(negative/positive 划分)和 MAE 0.986,在 MOSEI 上取得 F1 80.39% 和 MAE 0.642;在 CH-SIMS 上取得 F1 79.71% 和 MAE 0.481。在 FMM 设置下,MRCF 在两个数据集上均取得 81.65% 的平均 F1,且在仅保留视觉和音频的极端情况下 MOSI F1 达 84.47%,仅保留文本时 MOSI F1 达 84.34%、MOSEI F1 达 84.80%。消融结果证明可靠性分支、交互调节和融合校准各自均有显著贡献,其中移除可靠性引导交互分支造成的降幅最大。该工作为不完整观测下的多模态融合提供了更精细的控制手段,有望提升情感识别系统在现实噪声环境中的鲁棒性。主要局限是可靠性监督信号源于模型自身预测的代理目标,而非客观真实可靠性,且目前未提供开源代码与模型。
关键结果表格(IMM 设置下部分方法对比,MOSI/MOSEI 取 negative/positive 划分):
| Model | MOSI Acc-2 | MOSI F1 | MOSI MAE | MOSEI Acc-2 | MOSEI F1 | MOSEI MAE |
|---|---|---|---|---|---|---|
| LNLN | 72.55 | 72.73 | 1.046 | 76.30 | 77.77 | 0.692 |
| P-RMF | 72.81 | 72.93 | 1.038 | 78.14 | 79.33 | 0.658 |
| DAR | 73.18 | 73.15 | 1.069 | 78.14 | 77.51 | 0.666 |
| MRCF | 74.26 | 74.39 | 0.986 | 80.07 | 80.39 | 0.642 |
🔗 开源详情
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:论文使用了 CMU-MOSI、CMU-MOSEI、CH-SIMS 三个公开数据集,但未提供具体下载链接或开源协议信息
- Demo:论文中未提及
- 复现材料:论文中未提及
- 论文中引用的开源项目:PyTorch (https://pytorch.org)
🏗️ 方法概述和架构
MRCF 是一个端到端的多模态情感分析框架,其核心设计理念是将模态可靠性从隐式副产品提升为显式的、样本特异性的可学习量,并使其贯穿特征提取后的交互与融合两个阶段。整个框架由三个组件构成:可靠性感知分支(RAB)、可靠性引导交互分支(RGIB)和可靠性校准融合模块(RCFM)。输入为可能包含随机时序掩蔽的文本、音频、视觉三模态序列,输出为连续情感分数。
下图展示了 MRCF 的整体框架,可直观理解三个模块的协作流程。

图中可见,可靠性感知分支从单模态质量与跨模态一致性估计可靠性,可靠性引导交互分支据此调节跨模态消息路由,可靠性校准融合模块则将更新后的特征与可靠性线索结合进行最终预测。
首先,各模态经由独立的编码器(如 BERT 用于文本,卷积网络用于音频和视觉)提取时序隐含表示 \(\mathbf{H}_i^{(m)} \in \mathbb{R}^{L_i^{(m)} \times d}\),再经池化得到紧凑的模态向量 \(\mathbf{h}_i^{(m)} \in \mathbb{R}^d\)。训练时额外编码完整观测得到 \(\mathbf{h}_{i,c}^{(m)}\),仅用作训练锚点,推理时不需要。
RAB 负责为每个样本的每个模态估计一个实值可靠性分数 \(\rho_i^{(m)} \in (0,1)\)。该估计由两部分信息合成:(1)模态内质量线索——将池化后的模态表示 \(\mathbf{h}_i^{(m)}\) 与该模态的可观测比率 \(\gamma_i^{(m)}\) 拼接后,通过模态特定的投影网络 \(\phi_q^{(m)}\) 得到质量特征 \(\mathbf{q}_i^{(m)} \in \mathbb{R}^{d_q}\);(2)跨模态语义一致性线索——计算当前模态与其他模态池化表示在可学习投影空间中的余弦相似度,并取平均得到一致性分数 \(s_i^{(m)}\)。两个线索经拼接和非线性映射(tanh + 线性 + sigmoid)后输出可靠性分数。训练时,以该模态的孤立预测 \(\hat{y}_i^{(m)}\) 与完整观测联合预测 \(\hat{y}_i^c\) 之间差异的指数衰减值作为代理目标 \(\bar{\rho}_i^{(m)} = \exp(-|\hat{y}_i^{(m)} - \operatorname{sg}(\hat{y}_i^c)|)\),并用 Smooth L1 回归损失 \(\mathcal{L}_{\mathrm{rel}}\) 和成对排序损失 \(\mathcal{L}_{\mathrm{rank}}\) 监督可靠性估计。排序损失鼓励估计的可靠性排序与代理目标排序一致。
RGIB 将可靠性分数注入跨模态注意力交互中。对每个有序模态对 \((m,n)\),计算缩放点积注意力消息 \(\mathbf{U}_i^{m\leftarrow n}\)。与传统直接聚合不同,RGIB 用源模态可靠性经 softmax 得到路由权重 \(\alpha_i^{m\leftarrow n}\),并用目标模态的可靠性来缩放更新幅度:\(\widetilde{\mathbf{H}}_i^{(m)} = \mathbf{H}_i^{(m)} + (1-\rho_i^{(m)}) \sum_{n\neq m} \alpha_i^{m\leftarrow n} \mathbf{U}_i^{m\leftarrow n}\)。该设计实现双重控制:高可靠模态作为源时获得更高的消息传出权重;高可靠模态作为目标时则减少外部消息的引入,避免被低质量信息污染。此外,还引入基于代理可靠性的消息能量正则项 \(\mathcal{L}_{\mathrm{prop}}\),以代理可靠性加权惩罚低可靠源发出的消息 Frobenius 范数平方。
RCFM 将交互后的模态序列池化得到 \(\widetilde{\mathbf{h}}_i^{(m)}\),并在融合时同时考虑语义表示和估计可靠性:融合权重 \(\beta_i^{(m)}\) 由拼接 \([\widetilde{\mathbf{h}}_i^{(m)}; \rho_i^{(m)}]\) 经可学习向量 \(\mathbf{w}_f \in \mathbb{R}^{d+1}\) 线性打分后 softmax 得到。最终加权的融合表示 \(\mathbf{z}_i = \sum_m \beta_i^{(m)} \widetilde{\mathbf{h}}_i^{(m)}\) 送入回归头 \(g_f\) 得到预测 \(\hat{y}_i\)。训练时,额外构建完整观测的融合表示 \(\mathbf{z}_i^c\) 作为锚点,通过均方误差损失 \(\mathcal{L}_{\mathrm{cal}} = \frac{1}{N}\sum_i \|\mathbf{z}_i - \operatorname{sg}(\mathbf{z}_i^c)\|_2^2\) 拉近不完整观测融合表示与完整锚点的距离,以鼓励表示稳定性和互补信息的保留。总训练损失为 \(\mathcal{L} = \mathcal{L}_{\mathrm{task}} + \lambda_1 \mathcal{L}_{\mathrm{aware}} + \lambda_2 \mathcal{L}_{\mathrm{prop}} + \lambda_3 \mathcal{L}_{\mathrm{cal}}\),其中 \(\mathcal{L}_{\mathrm{task}}\) 为 L1 回归损失,\(\mathcal{L}_{\mathrm{aware}} = \mathcal{L}_{\mathrm{rel}} + \lambda_r \mathcal{L}_{\mathrm{rank}}\)。推理时仅使用不完整观测分支。
方法的关键设计动机源自对模态可靠性不匹配和传播偏差的诊断:可靠性随缺失率动态变化且各模态衰减速率不同;不加控制的跨模态交互会将低可靠模态的误差传播到全局表示。MRCF 通过显式评估并利用可靠性来分别缓解这两个问题。
下图从不完整观测下模态可靠性的诊断角度,说明了 MRCF 设计动机背后的经验现象。

图中显示,随着缺失率升高,不同模态的可靠性下降速度并不一致,文本通常保持较高可靠性;同时,在低缺失率时丢弃最不可靠模态会造成性能下降,而在高缺失率时可能带来正向收益,表明需要显式根据可靠性控制跨模态信息传播。
💡 核心创新点
- 显式可靠性建模:首次将模态可靠性提升为可学习的样本特异性变量,而非以往工作中仅在特征学习或融合设计中隐式体现。通过模态内质量线索和跨模态语义一致性联合估计,使模型能动态感知各模态在当前样本下的可信度。
- 可靠性引导的跨模态交互:设计了依赖可靠性分数的消息路由和更新幅度调节机制,解决了传统交互中低质量信息不受限传播的问题。该机制使高可靠模态获得更大的话语权,同时保护高可靠模态不被低质消息破坏。
- 可靠性校准融合与锚点训练:在融合权重中显式编码可靠性,并以完整观测的表征作为校准目标,兼顾保留残余互补信息和抑制不可靠证据。这种训练时的锚点约束提供了稳定的语义监督,有助于在不完整观测下维持表示一致性。
- 代理可靠性监督与排序学习:利用完整观测预测与孤立模态预测的差异构建自举式代理目标,并结合排序损失,使得可靠性估计无需外部标注,同时能保持模态间相对可靠性的合理排序。
📊 实验结果
论文在 CMU-MOSI、CMU-MOSEI、CH-SIMS 三个标准 MSA 数据集上进行了全面评估,覆盖两种主流的缺失模式:模态内随机时序缺失(IMM)和固定模态缺失(FMM)。评价指标包括 Acc-2、F1、Acc-5、Acc-7、MAE 和 Corr,其中 Acc-2 和 F1 分别按 negative-versus-non-negative 和 negative-versus-positive 两种标签划分报告。
在 IMM 设置下(随机掩蔽 0% 到 90% 时序位置,取十档平均),MRCF 在 MOSI 和 MOSEI 上均取得最优结果。具体而言,MOSI 上 MRCF 的 F1 为 73.31%(non-negative)和 74.39%(positive),MAE 降至 0.986;MOSEI 上 F1 达到 80.27% 和 80.39%,MAE 为 0.642,显著优于 P-RMF(79.33%)和 DAR(77.51%)。在 CH-SIMS 上,MRCF 取得 79.71% 的 F1 和 0.481 的 MAE,同样优于所有基线。完整表格已在核心摘要中列出。
CH-SIMS 完整结果(IMM):
| Model | Acc-2 | F1 | Acc-3 | Acc-5 | MAE (↓) | Corr |
|---|---|---|---|---|---|---|
| MISA | 72.71 | 66.30 | 56.87 | 31.53 | 0.539 | 0.348 |
| S-MM | 72.81 | 68.43 | 56.75 | 32.28 | 0.508 | 0.376 |
| MMIM | 69.86 | 66.21 | 52.76 | 31.81 | 0.544 | 0.339 |
| CENET | 68.13 | 57.90 | 53.17 | 22.29 | 0.589 | 0.107 |
| TFR-Net | 68.13 | 58.70 | 52.89 | 26.52 | 0.661 | 0.169 |
| P-RMF | 73.64 | 74.65 | 54.75 | 34.83 | 0.500 | 0.414 |
| LNLN | 72.73 | 79.43 | 57.14 | 34.64 | 0.514 | 0.397 |
| MRCF | 75.16 | 79.71 | 57.97 | 35.44 | 0.481 | 0.435 |
在 FMM 设置下(训练用完整数据,测试删除一到两个模态),MRCF 在 MOSI 和 MOSEI 上均达到最高的平均 F1(81.65%)。在仅保留视觉和音频的极端情况下,MRCF 在 MOSI 上取得 84.47% F1,超过 ROSA 的 83.81%;当仅保留文本时,F1 达 84.34%(MOSI)和 84.80%(MOSEI),显示出对主导模态缺失时的良好适应力。
FMM 关键结果(MOSI F1,%):
| Model | {l,v,a} | {l,v} | {l,a} | {v,a} | {l} | {v} | {a} | 平均 |
|---|---|---|---|---|---|---|---|---|
| ROSA | 86.30 | 85.39 | 85.13 | 83.81 | 83.64 | 56.79 | 81.91 | 80.42 |
| P-RMF | 84.37 | 81.94 | 82.10 | 73.11 | 81.36 | 70.32 | 71.44 | 77.81 |
| MRCF | 86.79 | 86.08 | 85.85 | 84.47 | 84.34 | 61.67 | 82.35 | 81.65 |
关键消融实验(IMM,平均缺失率 0.1–0.9)显示:同时移除 RAB 和 RGIB 导致 MOSI F1 从 73.31% 降至 69.90%,MAE 升至 1.063,为组件级最大降幅;单独移除 RGIB(F1 降至 71.86%)的降幅大于单独移除 RAB(F1 降至 72.09%),说明交互调节尤为关键。移除跨模态一致性线索使 F1 降至 71.98%,比移除模态内质量线索(72.46%)影响更大。在各项损失中,去除可靠性回归损失 \(\mathcal{L}_{\mathrm{rel}}\) 造成最大降幅(F1 降至 71.95%);去除消息能量正则 \(\mathcal{L}_{\mathrm{prop}}\) 和校准损失 \(\mathcal{L}_{\mathrm{cal}}\) 也分别导致性能下降。将可靠性引导交互替换为均匀交互(F1 71.22%)或仅将可靠性用于晚期融合(F1 71.59%),均导致性能明显下降,证实了在网络中对消息传递进行早期调节的重要性。统计稳定性分析表明 MRCF 在不同种子和缺失率下的 F1 和 MAE 分布比 LNLN 和 P-RMF 更集中,鲁棒性更优。
下图给出了不同方法在 MOSI 上跨缺失率与多次随机种子的稳定性对比。

图中可见,MRCF 的 F1 分布均值最高且波动范围最小,MAE 分布均值最低且更集中,说明其在不同缺失率和初始化条件下均具有更优的统计稳定性。
此外,论文通过可靠性对齐分析(Fig. 3)表明,估计的可靠性分数 \(\rho_i^{(m)}\) 与基于预测一致性定义的诊断指标 \(q_i^{(m)}(r) = \exp(-|\hat{y}_i^{(m,r)} - \hat{y}_i^c|)\) 呈正相关,验证了可靠性估计与既定准则的一致性。交互行为分析(Fig. 4)显示,MRCF 的高可靠→低可靠方向交互强度比均匀交互显著更高,且随缺失率增加而增强,支持了可靠性引导交互的有效性。
下图进一步展示了可靠性对齐诊断结果,以及可靠性引导交互分支在实际数据上的消息路由行为。

图中显示,估计的可靠性与基于预测一致性的诊断指标保持正相关,说明可靠性分数能够追踪模态在缺失观测下的有效性变化。

图中可见,MRCF 在高可靠源到低可靠目标方向上的交互比例显著高于均匀交互,且该比例随缺失率增加而上升;MOSI 上的路由热图也显示文本作为源时对音频和视觉的传递权重明显高于反向路径,与可靠性引导的设计目标一致。
🔬 细节详述
- 训练数据:CMU-MOSI、CMU-MOSEI、CH-SIMS 的完整训练集,应用标准时序掩蔽获得不完整输入。掩蔽模式:每个模态独立随机掩蔽固定比例的时间步(IMM,\(r \in \{0.0, 0.1, \ldots, 0.9\}\)),或固定丢弃整个模态(FMM)。数据预处理沿用已有基准流程,未引入额外增强。
- 损失函数:总损失 \(\mathcal{L} = \mathcal{L}_{\mathrm{task}} + \lambda_1 \mathcal{L}_{\mathrm{aware}} + \lambda_2 \mathcal{L}_{\mathrm{prop}} + \lambda_3 \mathcal{L}_{\mathrm{cal}}\)。\(\mathcal{L}_{\mathrm{task}}\) 为 L1 回归损失。\(\mathcal{L}_{\mathrm{aware}} = \mathcal{L}_{\mathrm{rel}} + \lambda_r \mathcal{L}_{\mathrm{rank}}\),其中 \(\mathcal{L}_{\mathrm{rel}}\) 为 Smooth L1 损失,用于匹配估计可靠性与代理目标;\(\mathcal{L}_{\mathrm{rank}}\) 为基于代理目标相对大小的成对逻辑损失,鼓励可靠性排序一致。\(\mathcal{L}_{\mathrm{prop}}\) 是基于代理可靠性加权的消息 Frobenius 范数平方正则项,抑制低可靠源的消息能量。\(\mathcal{L}_{\mathrm{cal}}\) 为不完整观测融合表示 \(\mathbf{z}_i\) 与完整观测融合表示 \(\mathbf{z}_i^c\)(梯度截断)之间的均方误差。平衡系数 \(\lambda_1, \lambda_2, \lambda_3, \lambda_r\) 正文未给出具体值,仅说明为超参数。
- 训练策略:优化器 Adam,学习率 \(10^{-4}\),batch size 32,训练 100 个 epoch。所有实验在 PyTorch 上完成。调度策略未提及。
- 关键超参数:BERT 作为语言主干;音频和视觉特征提取沿用已有基线流程(如 Librosa 特征与 OpenFace 特征)。共享隐藏维度 \(d\)、投影维度 \(d_q\)、\(d_r\) 等正文未明确给出数值。池化方式未明确,推测为平均池化或注意力池化。
- 训练硬件:单块 NVIDIA A100 GPU,训练时长未提供。
- 推理细节:推理时仅使用不完整观测,移除完整观测分支,无需额外解码策略。可靠性分数的计算为前向推断,无需外部标签。
- 正则化与稳定训练:使用了 Smooth L1 损失、代理目标中梯度截断(sg 操作)、消息能量正则 \(\mathcal{L}_{\mathrm{prop}}\) 和校准损失 \(\mathcal{L}_{\mathrm{cal}}\) 来稳定训练。正文未提及 dropout 或 weight decay 等通用正则化手段。附录含超参数敏感性分析和效率比较。
⚖️ 评分理由
创新性 (1.5/2):首次将模态可靠性提升为显式、样本特异性可学习量并使其贯穿交互与融合全过程(RAB、RGIB、RCFM 三模块协同),为不完整观测多模态融合提供了更精细的控制,设计新颖且具有洞察力。[A_SUMMARY][A_METHOD]
技术严谨性 (1.0/1.5):代理可靠性目标完全由模型自身预测差异定义,即使使用梯度截断,估计与优化仍在同一参数空间内,存在自我实现和偏向易拟合样本的风险,且未讨论模型预测本身不可靠时代理的可信度,逻辑闭环论证不充分。[A_LIMITS] 第1条
实验充分性 (1.0/1.5):实验在三个标准数据集、两种缺失模式下全面对比强基线,消融细致且包含统计稳定性、交互行为分析,但可靠性分数未经外部人工标注或客观真值验证,诊断指标本身亦由模型派生,无法独立证明可靠性估计的真实有效性。[A_LIMITS] 第4条[A_RESULTS]
清晰度 (0.8/1):方法总体表述清晰,但正文未给出关键超参数λ1–λ3、λr的具体取值,隐藏维度和投影维度等缺少数值说明,读者难以独立评估模型配置和调参难度。[A_LIMITS] 第6条[A_METHOD]
影响力 (1.0/1.5):工作针对多模态情感分析中亟需的鲁棒性问题,显式可靠性建模思想对后续噪声环境下的融合研究有启发意义,但核心贡献主要面向多模态情感理解,对纯音频/语音社区的直接影响有限。[A_SUMMARY]
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.1/0.5):虽然给出了架构、损失函数、优化器和基础训练配置,但隐藏维度、投影维度、池化方式及损失平衡系数等关键训练配置缺失,复现需要大量推断和试错。[A_LIMITS] 第6条[A_METHOD]
工程/实践价值 (0.8/1.5):提出的可靠性引导交互和校准融合机制为在工程中处理模态缺失与噪声提供了精细控制手段,推理时无需完整观测分支,设计具有实际部署潜力,但论文未讨论系统延迟、吞吐等工程指标。[A_SUMMARY][A_METHOD]
🚨 局限与问题
论文明确承认的局限:论文并未列出专门的小节讨论局限或未来工作,未主动明确承认方法上的假设或限制。
审稿人发现的潜在问题:
- 代理可靠性目标的自我实现风险:\(\bar{\rho}_i^{(m)}\) 由模型自身预测的差异定义,虽然梯度截断避免了直接循环,但可靠性估计仍在同一模型参数空间中优化,可能导致可靠性偏向于容易拟合的样本,而非真实信息质量。论文未讨论当模型预测本身不可靠时代理目标的可信度。
- 完整观测依赖的适用范围限制:训练严重依赖完整观测作为锚点和监督源(代理目标、校准损失均需完整观测融合表示 \(\mathbf{z}_i^c\)),在完全无法获得完整观测的真实场景中将完全失效。论文未讨论如何将该方法适配到仅有不完整观测的训练场景。
- 三模态设置的扩展性:所有设计均基于 \(\mathcal{M} = \{t, a, v\}\) 三模态,当模态数量更多或存在额外传感器时,softmax 路由和相对排序损失可能面临扩展困难,且各模态的可靠性独立性假设可能不再成立。
- 缺少对可靠性分数的真实验证:虽然 Fig. 3 展示了与诊断指标的对齐,但该诊断指标本身也是模型派生的,并非客观真值。论文未与人工标注的模态可信度或外部知识进行对比,导致该分数是否真正"可靠"仍属未知。
- 固定特征提取器的限制:所有实验均使用预提取的固定特征(如 BERT、OpenFace),未探究端到端微调时可靠性估计和交互是否能进一步受益,也未讨论不同特征质量对可靠性估计的影响。
- 超参数敏感性的不透明:正文未给出 \(\lambda_1\)–\(\lambda_3\)、\(\lambda_r\) 的具体取值,虽然附录有敏感性分析,但正文缺乏这些关键信息使得读者难以独立评估方法的稳健性和调参难度。