📄 C^2MOE: Consistency and Complementarity-guided Mixture of Experts for Incomplete Multimodal Emotion Learning
标签:#音视频理解 #多模态模型 #音频理解 #Transformer #模型评估
4.1/10 | 创新 1.2/2 | 严谨 0.3/1.5 | 实验 0.8/1.5 | 清晰 0.4/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.5/1.5
📝 4.1/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #音视频理解 | #多模态模型 | #音频理解 #Transformer | arxiv
👥 作者与机构
- 第一作者:Yuntao Shou(Central South University of Forestry and Technology;邮箱后缀为 xjtu.edu.cn,与署名机构不一致,原文未解释)
- 通讯作者:未说明
- 作者列表:Yuntao Shou(Central South University of Forestry and Technology)、Tao Meng(Central South University of Forestry and Technology)、Wei Ai(Central South University of Forestry and Technology)、Keqin Li(State University of New York, New Paltz, USA;另附“Xi’an, China”但机构名未说明)
💡 毒舌点评
把一致性拆给一个专家、互补性拆给另一个专家的MoE思路是有嚼头的,且实验覆盖了特定缺失与随机缺失两种设置,工作量值得肯定。但核心信息论目标是自相矛盾的:一致性专家在最小化条件熵的同时又在最大化边缘熵,这在理论上并不自洽;互补预测采用最大化重构误差,实际会鼓励输出偏离真实分布。加上公式编号大面积重复、表2中多个基线数值在不同缺失率下完全相同、关键训练细节与图结构定义缺失,当前版本只能算一份不成熟的工作稿。
📌 核心摘要
- 要解决的问题:多模态对话情感识别(MERC)在真实场景中经常出现模态缺失,导致模型性能显著下降;已有方法主要做跨模态一致性学习,忽略了模态互补性,恢复结果有偏。
- 方法核心:提出C²MOE框架,把多模态表示分解为一致性成分和互补性成分;一致性专家最大化跨模态互信息并最小化条件熵,互补性专家最大化条件熵保留模态特有信息;路由网络动态分配权重,双分支预测后加权融合。
- 相比已有方法的新意:论文声称是第一个尝试将一致性/互补性语义显式放入Mixture of Experts框架中、用路由机制化解两个目标冲突的工作。
- 主要实验结果:在CMU-MOSI和CMU-MOSEI上,C²MOE在多个缺失设置下超过MCTN、MMIN、GCNet、DiCMoR、IMDer、GSDNet等基线;例如CMU-MOSI特定缺失平均ACC2/F1/ACC7为78.4/78.2/38.3,CMU-MOSEI随机缺失率下平均为84.0/83.8/53.0。消融实验显示四个损失联合优化时达到最佳(例如CMU-MOSI 84.8/84.7/43.5),但单独使用预测损失时性能显著下降。
- 实际意义:为缺失模态下的对话情感识别提供了一个“一致性+互补性”可解耦的恢复框架,对鲁棒多模态系统设计有参考价值。
- 主要局限性:理论推导存在明显矛盾,互补预测最大化重构误差缺少合理解释,且代码、详细训练配置与统计显著性检验均未提供,难以独立复现和验证。
🔗 开源详情
- 论文未提供任何开源资源:没有代码仓库链接、模型权重、数据集、配置文件、官方实现地址或补充材料链接。
- 原文仅说明实验使用 PyTorch 在 NVIDIA RTX 4090 GPU 上实现,但未给出可下载或可复现的代码资源。
- 未披露许可证信息,也未承诺未来是否开放源码。
- 在论文可获取范围内,无法通过开源途径验证、运行或扩展该方法的实现,因此开源详情为“未提供”。
🏗️ 方法概述和架构
论文的总体现路是:将多模态情感识别中的模态缺失问题建模为一个“一致性+互补性”解耦的表示学习与缺失模态恢复问题。作者从信息论角度将多模态特征分解为共享(一致)区域与模态特有(互补)区域,并指出两者在优化目标上天然冲突:一致性需要最小化条件熵 \(H(\mathbf{Z}^i \mid \mathbf{Z}^j)\),而互补性需要最大化同一条件熵。C²MOE的核心论证是:通过MoE双专家结构将这两个冲突目标解耦,再经过可学习路由融合,从而在理论上避免直接优化冲突目标带来的互扰。
下图从信息论角度示意了多模态特征中一致性与互补性区域的划分。

图中将两个模态的完整特征分别表示为若干信息区域(R1–R7),其中R3、R4对应共享一致性信息,R2、R5、R6、R7对应模态特有互补信息,解释了两种专家分别关注不同区域的动机。
具体流程如下。对原始文本、音频、视频三模态特征,首先用1D卷积投影到统一维度并加入位置编码;然后每个模态通过一个图自编码器(GAE)做模态内重建,得到潜在表示 \(\mathbf{Z}^m\);随后进入核心的“一致性/互补性MoE”模块,由一致性专家和互补性专家分别处理;路由网络为每个样本生成软分配权重;最终融合表示供下游情感分类使用。整体是一个端到端的多模态表示学习与缺失模态恢复框架。图2的架构图将整个框架分为NN-1(模态内重建)和NN-2(双专家对比学习)两个子模块,但这只是文字层面的模块划分,NN-1与NN-2之间如何端到端联合训练、梯度如何跨模块传播,论文没有展开。
下图展示了C²MOE的整体架构。

图中依次包括1D卷积特征投影与位置编码、图构建与图自编码器模态内重建(NN-1)、一致性/互补性双专家学习(NN-2)以及双分支预测与可学习路由融合,体现了端到端的缺失模态恢复流程。
第一个核心组件是模态编码器。由于文本、音频、视频原始特征维度差异大,直接用会导致分布不匹配,论文用1D卷积对每个模态分别做投影:\(\mathbf{X}^{m'} = \mathrm{Conv1D}(\mathbf{X}^m, l^m) \in \mathbb{R}^{N \times d}\),\(m \in \{t,a,v\}\),其中 \(l^m\) 是1D卷积核大小、\(N\) 是整个对话序列的话语数、\(d\) 是共享隐空间维度。之后加入标准正弦位置编码 \(\mathbf{PE}_{(pos,2i)} = \sin(pos / 10000^{2i/d})\),\(\mathbf{PE}_{(pos,2i+1)} = \cos(pos / 10000^{2i/d})\),并叠加到卷积输出上:\(\mathbf{X}^{m'} = \mathbf{X}^{m'} + \mathbf{PE}\)。论文没有说明 \(l^m\) 如何选择,也没有说明不同模态是否使用不同卷积核大小。
第二个组件是模态内重建模块NN-1。对每个模态使用一个图自编码器(GAE),由图编码器 \(\mathcal{D}^m\) 和图解码器 \(\mathcal{E}^m\) 构成。训练目标有两个:重建损失 \(\mathcal{L}_{rec} = \sum_{m=1}^{3}\sum_{t=1}^{n}\|\mathbf{X}^{m'}_t - \mathcal{D}^m(\mathbf{X}^{m'}_t)\|_2^2\),以及循环一致性损失 \(\mathcal{L}_{cyc} = \sum_{m=1}^{3}\sum_{t=1}^{n}\|\mathbf{X}^{m'}_t - \mathcal{E}^m(\mathcal{D}^m(\mathbf{X}^{m'}_t))\|_2^2\)。将 \(\mathcal{D}^m\) 的输出定义为模态潜在表示 \(\mathbf{Z}^m = \mathcal{D}^m(\mathbf{X}^{m'}_t)\)。论文表示这一组件用于确保单独一个模态也能学到有判别力的表示,从而在其它模态缺失时仍能维持基本性能。关于图的节点和边如何构建、邻接矩阵来自哪里,论文完全未说明。
第三个组件是C²MoE,即一致性/互补性引导的MoE框架,这是论文的核心。信息论出发点是:用一致性专家 \(\mathcal{H}_c\) 最大化 \(I(\mathbf{Z}^i;\mathbf{Z}^j)\),用互补性专家 \(\mathcal{H}_s\) 最大化 \(H(\mathbf{Z}^i \mid \mathbf{Z}^j)\)。MoE输出形式为 \(\mathbf{Z}^m = \sum_{k=1}^{K}\alpha_k^m \cdot \mathcal{H}_k(\mathbf{Z}^m)\),其中 \(\alpha_k^m\) 是路由权重。一致性对比专家 \(f_C(\cdot)\) 接收两个模态潜在表示,输出一致性增强表示 \(\widetilde{\mathbf{Z}}_i^1 = f_C(\mathbf{Z}_i^1)\),\(\widetilde{\mathbf{Z}}_i^2 = f_C(\mathbf{Z}_i^2)\)。论文构造联合共激活矩阵 \(\mathbf{P} = \frac{1}{m}\sum_{i=1}^{m}\widetilde{\mathbf{Z}}_i^1(\widetilde{\mathbf{Z}}_i^2)^\top\),用离散形式的互信息定义损失 \(\mathcal{L}_{cl} = -\sum_{d=1}^{D}\sum_{d'=1}^{D}P_{dd'}\log(P_{dd'}/(P_d P_{d'})) + \alpha(H(\widetilde{\mathbf{Z}}_i^1) + H(\widetilde{\mathbf{Z}}_i^2))\)。这里存在两个严重问题:第一,\(D\)、离散化方式、\(m\) 的确定方式均未定义,公式在实际实现中不可判定;第二,熵正则项 \(\alpha\) 是最大化边缘熵,而条件熵 \(H(\mathbf{Z}^1|\mathbf{Z}^2) = H(\mathbf{Z}^1) - I(\mathbf{Z}^1;\mathbf{Z}^2)\),在固定或最大化互信息时最大化边缘熵会增大条件熵,与“最小化条件熵”的目标直接冲突,论文未给出任何消解推导。
一致性预测分支 \(G^{(C)}(\cdot)\) 用于从观测模态恢复缺失模态的共享语义。论文用变分高斯近似 \(Q(\mathbf{Z}_i^1|\mathbf{Z}_i^2) = \mathcal{N}(G^{(C)}(\mathbf{Z}_i^2), \sigma^2 I)\),最大化条件似然的变分下界,得到最小二乘形式 \(\mathcal{L}'_{cl} = \mathbb{E}\|\mathbf{Z}_i^1 - G^{(C)}(\mathbf{Z}_i^2)\|_2^2\)。这一部分逻辑尚可,但 \(\sigma^2\) 未给出,也没有讨论后验近似不准带来的偏差。
互补性对比专家 \(f_R(\cdot)\) 计算互补表示 \(\widehat{\mathbf{Z}}_i^1 = f_R(\mathbf{Z}_i^1)\),\(\widehat{\mathbf{Z}}_i^2 = f_R(\mathbf{Z}_i^2)\),损失为 \(\mathcal{L}_p = -\sum_{d=1}^{D}[H(P_d^{(1)}) + H(P_d^{(2)})] + \beta \sum_{d,d'}P_{dd'}^{comp}\log(P_{dd'}^p/(P_d^{(1)}P_{d'}^{(2)}))\),即最大化边缘熵、最小化互信息。但论文在式(17)中又定义互补预测损失 \(\mathcal{L}'_p = -\mathbb{E}\|\widetilde{\mathbf{Z}}_i - \mathcal{E}^{(j)}(\mathbf{Z}_i^j)\|_2^2\),即最大化预测与真实值之间的均方误差。这个设计非常反直觉:互补性应指信息不重叠但语义对齐,最大程度远离真实特征不仅不能帮助缺失模态重建,还可能导致恢复表示偏离真实分布。论文没有给出任何理论解释说明这种“最大化重构误差”的合理性,也没有实验证明它比标准重构损失更有效。
最后一个组件是可学习路由融合。对观测模态特征 \(\mathbf{Z}_i^j\),路由网络 \(\mathbf{g}_i = \mathrm{softmax}(\mathbf{W} \cdot \mathbf{Z}_i^j + \mathbf{b})\) 输出二维软分配 \([g_i^C, g_i^R]\),最终预测为 \(\mathbf{Z}_i^{pred} = g_i^C \cdot \bar{\mathbf{Z}}_i + g_i^R \cdot \widetilde{\mathbf{Z}}_i\),其中 \(\bar{\mathbf{Z}}_i = G^{(C)}(\mathbf{Z}_i^j)\) 是一致性预测,\(\widetilde{\mathbf{Z}}_i = \mathcal{E}^{(j)}(\mathbf{Z}_i^j)\) 是互补性预测。总损失为 \(\mathcal{L}_{total} = \lambda_1(\mathcal{L}_{cl} + \cdot \mathcal{L}'_{cl}) + \lambda_2(\mathcal{L}_p + \cdot \mathcal{L}'_p) + \mathcal{L}_{rec} + \mathcal{L}_{cyc}\)。注意原文式(21)中出现了“\(\cdot\)”符号,应是笔误。论文没有说明分类器结构、融合后的表示如何输入分类器以及是否有对话上下文建模模块,这些都是MERC中通常必须细化的关键部分。
💡 核心创新点
- 一致性/互补性MoE专家分解。之前方法通常只做一致性学习或统一约束,C²MOE用两个专家分别优化 \(I(\mathbf{Z}^i;\mathbf{Z}^j)\) 和 \(H(\mathbf{Z}^i|\mathbf{Z}^j)\)。这一设计有直觉上的吸引力,但由于两个目标在条件熵上互相矛盾,且损失函数中熵正则方向相反,实际有效性存疑。
- 信息论视角下的路由融合。路由网络根据观测模态特征动态调整一致性/互补性输出的权重,相比固定加权融合更灵活。论文声称能自适应不同缺失模式,但缺少对路由行为的可视化或分析来证明这一点。
- 模态内GAE重建作为缺失鲁棒性基础。通过每个模态单独训练图自编码器,保留单模态判别信息,保证其他模态缺失时不太退化。该思路有实际价值,但图构建方式未交代,难以评价。
- 双分支预测机制。一致性分支用条件变分推断形式恢复共享语义,互补分支则最大化重构误差以保留独特信号。后者的“反向重建”是反常识的,论文未给出可行性与安全性说明。
- 损失层面的跨模态对齐组合。将对比损失、预测损失、重建损失和循环一致性损失统一到一个目标函数中,并报告整体优于所有基线。但因为没有单独验证 \(\mathcal{L}'_p\) 的有效性,四个损失联合提升也可由多任务正则效应解释。
📊 实验结果
论文在CMU-MOSI和CMU-MOSEI两个数据集上报告ACC2/F1/ACC7三个指标。对比方法包括MCTN、MMIN、GCNet、DiCMoR、IMDer、GSDNet。表1为特定缺失模态设置,表2为随机缺失率设置。下表完整转录原论文结果。
下图展示了不同缺失配置下恢复模态的t-SNE可视化对比。

图中可见的补充证据是:每行对应一种可用模态与缺失模态组合,前四列为各方法恢复的模态分布,后两列为真实分布与C²MOE恢复分布;相比MMIN、GCNet和IMDer,C²MOE恢复的模态在视觉上更接近真实模态的聚类结构。
表1 不同缺失模态下的性能(每格为 ACC2/F1/ACC7,加粗为原论文标注):
| 数据集 | Available | MCTN | MMIN | GCNet | DiCMoR | IMDer | GSDNet | C2MOE (Ours) |
|---|---|---|---|---|---|---|---|---|
| CMU-MOSI | {l} | 79.1/79.2/41.0 | 83.8/83.8/41.6 | 83.7/83.6/42.3 | 84.5/84.4/44.3 | 84.8/84.7/44.8 | 86.4/86.6/45.7 | 87.3/87.7/48.0 |
| CMU-MOSI | {v} | 55.0/54.4/16.3 | 57.0/54.0/15.5 | 56.1/55.7/16.9 | 62.2/60.2/20.9 | 61.3/60.8/22.2 | 64.1/63.7/25.3 | 65.3/64.5/26.1 |
| CMU-MOSI | {a} | 56.1/54.5/16.5 | 55.3/51.5/15.5 | 56.1/54.5/16.6 | 62.2/60.2/20.9 | 62.0/62.2/22.0 | 64.4/64.1/24.6 | 65.6/65.5/26.4 |
| CMU-MOSI | {l,v} | 81.1/81.2/42.1 | 83.8/83.9/42.0 | 84.3/84.2/43.4 | 85.5/85.4/45.2 | 85.5/85.4/45.3 | 86.5/86.4/46.7 | 87.6/87.9/47.4 |
| CMU-MOSI | {l,a} | 81.0/81.0/43.2 | 84.0/84.0/42.3 | 84.5/84.4/43.4 | 85.5/85.5/44.6 | 85.4/85.3/45.0 | 86.7/86.6/46.8 | 88.0/87.8/47.6 |
| CMU-MOSI | {v,a} | 57.5/57.4/16.8 | 60.4/58.5/19.5 | 62.0/61.9/17.2 | 64.0/63.5/21.9 | 63.6/63.4/23.8 | 65.2/64.8/24.9 | 66.7/65.5/25.2 |
| CMU-MOSI | {l,v,a} | 81.4/81.5/43.4 | 84.6/84.4/44.8 | 85.2/85.1/44.9 | 85.7/85.6/45.3 | 85.7/85.6/45.3 | 87.7/87.3/46.8 | 88.5/88.8/47.4 |
| CMU-MOSI | Average | 70.2/69.9/31.3 | 72.7/71.4/31.6 | 73.1/72.8/32.1 | 75.4/75.1/34.7 | 75.5/75.3/35.5 | 77.3/77.1/37.3 | 78.4/78.2/38.3 |
| CMU-MOSEI | {l} | 82.6/82.8/50.2 | 82.3/82.4/51.4 | 83.0/83.2/51.2 | 84.2/84.3/52.4 | 84.5/84.5/52.5 | 86.6/86.1/55.3 | 87.3/87.1/56.7 |
| CMU-MOSEI | {v} | 62.6/57.1/41.6 | 59.3/60.0/40.7 | 61.9/61.6/41.7 | 63.6/63.6/42.0 | 63.9/63.6/42.6 | 65.1/65.7/44.9 | 66.8/66.6/45.7 |
| CMU-MOSEI | {a} | 62.7/54.5/41.4 | 58.9/59.5/40.4 | 60.2/60.3/41.1 | 62.9/60.4/41.4 | 63.8/60.6/41.7 | 64.6/64.2/43.1 | 66.4/65.5/44.4 |
| CMU-MOSEI | {l,v} | 83.2/83.2/50.4 | 83.8/83.4/51.2 | 84.3/84.4/51.1 | 84.9/84.9/53.0 | 85.0/85.0/53.1 | 87.3/87.0/56.2 | 88.8/88.3/57.1 |
| CMU-MOSEI | {l,a} | 83.5/83.3/50.7 | 83.7/83.3/52.0 | 84.3/84.4/51.3 | 85.0/84.9/52.7 | 85.1/85.1/53.1 | 86.2/86.4/55.5 | 87.4/87.7/56.2 |
| CMU-MOSEI | {v,a} | 63.7/62.7/42.1 | 63.5/61.9/41.8 | 64.1/57.2/42.0 | 65.2/64.4/42.4 | 64.9/63.5/42.8 | 66.7/66.3/45.2 | 67.9/66.7/46.0 |
| CMU-MOSEI | {l,v,a} | 84.2/84.2/51.2 | 84.3/84.2/52.4 | 85.2/85.1/51.5 | 85.1/85.1/53.4 | 85.1/85.1/53.4 | 87.3/87.2/54.9 | 88.6/88.1/56.5 |
| CMU-MOSEI | Average | 74.6/72.5/46.8 | 73.7/73.5/47.1 | 74.7/73.7/47.1 | 75.8/75.4/48.2 | 76.0/75.3/48.5 | 77.7/77.6/50.7 | 79.0/78.6/51.8 |
表2 不同随机缺失率下的性能(每格为 ACC2/F1/ACC7):
| 数据集 | Missing Rate | MCTN | MMIN | GCNet | DiCMoR | IMDer | GSDNet | C2MOE (Ours) |
|---|---|---|---|---|---|---|---|---|
| CMU-MOSI | 0.0 | 81.4/81.5/43.4 | 84.6/84.4/44.8 | 85.2/85.1/44.9 | 85.7/85.6/45.3 | 85.7/85.6/45.3 | 87.7/87.3/46.8 | 88.5/88.8/47.4 |
| CMU-MOSI | 0.1 | 78.4/78.5/39.8 | 81.8/81.8/41.2 | 82.3/82.3/42.1 | 83.9/83.9/43.6 | 84.9/84.8/44.8 | 87.1/86.5/46.2 | 88.4/88.0/47.8 |
| CMU-MOSI | 0.2 | 75.6/75.7/38.5 | 79.0/79.1/38.9 | 79.4/79.5/40.0 | 83.9/83.9/43.6 | 83.5/83.4/44.3 | 86.4/86.1/45.2 | 87.1/87.5/46.5 |
| CMU-MOSI | 0.3 | 71.3/71.2/35.5 | 76.1/76.2/36.9 | 77.2/77.2/38.2 | 80.4/80.2/40.6 | 81.2/81.0/42.5 | 85.2/85.0/44.3 | 86.7/86.1/45.8 |
| CMU-MOSI | 0.4 | 68.0/67.6/32.9 | 71.7/71.6/34.9 | 74.3/74.4/36.6 | 77.9/77.7/37.6 | 78.6/78.5/39.7 | 83.3/82.9/42.1 | 85.2/84.7/43.7 |
| CMU-MOSI | 0.5 | 65.4/64.8/31.2 | 67.2/66.5/32.2 | 70.0/69.8/33.9 | 76.7/76.4/36.4 | 76.2/75.9/37.9 | 81.2/81.1/40.6 | 82.4/82.4/41.5 |
| CMU-MOSI | 0.6 | 63.8/62.5/29.7 | 64.9/64.0/29.1 | 67.7/66.7/29.8 | 73.3/73.0/32.7 | 74.7/74.0/35.8 | 80.1/79.7/38.7 | 81.7/81.3/39.2 |
| CMU-MOSI | 0.7 | 61.2/59.0/27.5 | 62.8/61.0/28.4 | 65.7/65.4/28.1 | 71.1/70.8/30.0 | 71.9/71.2/33.4 | 77.6/77.3/35.6 | 78.3/78.5/36.3 |
| CMU-MOSI | Average | 70.6/70.1/34.8 | 73.5/73.1/35.8 | 75.2/75.1/36.7 | 78.9/78.7/38.5 | 79.6/79.3/40.5 | 83.6/83.2/42.3 | 84.8/84.7/43.5 |
| CMU-MOSEI | 0.0 | 84.2/84.2/51.2 | 84.3/84.2/52.4 | 85.2/85.1/51.5 | 78.9/78.7/38.5 | 85.1/85.1/53.4 | 87.3/87.2/54.9 | 88.6/88.1/55.5 |
| CMU-MOSEI | 0.1 | 81.8/81.6/49.8 | 81.9/81.3/50.6 | 82.3/82.1/51.2 | 78.9/78.7/38.5 | 84.8/84.6/53.1 | 86.7/86.5/54.2 | 87.9/87.7/55.6 |
| CMU-MOSEI | 0.2 | 79.0/78.7/48.6 | 79.8/78.8/49.6 | 80.3/79.9/50.2 | 81.8/81.5/51.4 | 82.7/82.4/52.0 | 85.3/85.1/53.5 | 86.2/86.1/54.3 |
| CMU-MOSEI | 0.3 | 76.9/76.2/47.4 | 77.2/75.5/48.1 | 77.5/76.8/49.2 | 79.8/79.3/50.3 | 81.3/80.7/51.3 | 83.3/83.0/52.2 | 84.8/84.6/53.8 |
| CMU-MOSEI | 0.4 | 74.3/74.1/45.6 | 75.2/72.6/47.5 | 76.0/74.9/48.0 | 78.7/77.4/48.8 | 79.3/78.1/50.0 | 81.4/81.2/51.4 | 83.2/82.5/53.2 |
| CMU-MOSEI | 0.5 | 73.6/72.6/45.1 | 73.9/70.7/46.7 | 74.9/73.2/46.7 | 77.7/75.8/47.7 | 79.0/77.4/49.2 | 80.5/80.1/50.7 | 81.3/81.6/51.4 |
| CMU-MOSEI | 0.6 | 73.2/71.1/43.8 | 73.2/70.3/45.6 | 74.1/72.1/45.1 | 77.7/75.8/47.7 | 78.0/75.5/48.5 | 79.4/79.1/49.4 | 80.7/80.3/50.6 |
| CMU-MOSEI | 0.7 | 72.7/70.5/43.6 | 73.1/69.5/44.8 | 73.2/70.4/44.5 | 75.4/72.2/46.2 | 77.3/74.6/47.6 | 78.2/78.1/48.6 | 79.5/79.3/49.7 |
| CMU-MOSEI | Average | 77.0/76.1/46.9 | 77.3/75.4/48.2 | 77.9/76.8/48.3 | 79.9/78.6/49.6 | 80.9/79.8/50.6 | 82.8/82.5/51.9 | 84.0/83.8/53.0 |
下图从另一个角度呈现了不同缺失率下的模态恢复质量。

图中可见的补充证据是:该图以MSE衡量恢复误差,随着缺失率从0.1升至0.7,C²MOE在CMU-MOSI上的误差始终低于IMDer和DiCMoR,与表2中分类性能随缺失率变化的趋势相互印证。
需要指出两个严重问题:一是表2中CMU-MOSEI的DiCMoR在缺失率0.0和0.1下数值完全相同(78.9/78.7/38.5),且与表1中完整模态{l,v,a}下的85.1/85.1/53.4严重不一致;二是CMU-MOSI的DiCMoR在缺失率0.1和0.2下也是同样的83.9/83.9/43.6,表1中DiCMoR在CMU-MOSI的{v}与{a}下同样完全相等(62.2/60.2/20.9)。多个基线出现完全相同的重复数值不像巧合,而更可能是转录或运行错误。此外,CMU-MOSEI表2缺失率0.0下DiCMoR的性能(78.9/78.7/38.5)甚至明显低于表1中只使用文本模态的82.6/82.8/50.2,这违背了“可用模态越多性能越好”的基本常识。这些数据可信度问题直接影响论文结论。
表3 消融实验(原文表3;每格为 ACC2/F1/ACC7,打勾组合按原文排版顺序转录):
| 损失组合(原文打勾方式) | CMU-MOSI ACC2/F1/ACC7 | CMU-MOSEI ACC2/F1/ACC7 |
|---|---|---|
| 第1行组合 | 81.4/81.0/41.2 | 81.1/80.8/50.5 |
| 第2行组合 | 78.6/78.2/39.4 | 78.3/77.7/48.2 |
| 第3行组合 | 74.7/72.0/33.6 | 72.1/71.4/42.3 |
| 第4行组合 | 75.8/75.3/34.1 | 73.0/72.6/45.4 |
| 全部四项(\(\mathcal{L}_{cl}+\mathcal{L}_{p}+\mathcal{L}'_{cl}+\mathcal{L}'_{p}\)) | 84.8/84.7/43.5 | 84.0/83.8/53.0 |
原文表3的列选择排版混乱,正文对第1行“仅使用 \(\mathcal{L}_{cl}\)”的描述与表格中该行同时含有其他损失不一致,进一步说明论文的消融呈现不够严谨。但整体趋势是:四个损失联合最优;只使用预测损失时性能显著下降。
🔬 细节详述
- 训练数据:CMU-MOSI为社交媒体平台视频评论,CMU-MOSEI为YouTube视频评论,均包含文本、音频、视频三模态,情感标注范围从-3(非常消极)到+3(非常积极),0为中性。论文未给出样本总数、说话人数、对话数、数据划分比例等具体统计信息;预处理只提到特征提取,未说明原始音视频如何切片、对齐、标准化、数据增强。
- 特征:wav2vec-large 提取512维声学特征;MA-Net 提取1024维面部特征;DeBERTa 提取1024维文本特征。具体版本、输入形式、池化方式未说明。
- 缺失率定义:\(\eta = 1 - \frac{\sum_{i=1}^{L}m_i}{L \times M}\),其中 \(m_i\) 是第 \(i\) 个样本的可用模态数,\(L\) 是样本数,\(M\) 是模态总数;随机掩码保证每个样本至少保留一个模态(\(1 \le m_i \le M\)),因此 \(\eta \le (M-1)/M\)。对 \(M=3\),\(\eta\) 从0.0到0.7按0.1步长变化。论文明确说明同一缺失率应用于训练、验证和测试。
- 损失函数:\(\mathcal{L}_{total} = \lambda_1(\mathcal{L}_{cl} + \mathcal{L}'_{cl}) + \lambda_2(\mathcal{L}_p + \mathcal{L}'_p) + \mathcal{L}_{rec} + \mathcal{L}_{cyc}\)。其中 \(\mathcal{L}_{cl}\) 是离散互信息对比损失,\(\mathcal{L}'_{cl}\) 是一致性均方重建损失,\(\mathcal{L}_p\) 是熵最大化+互信息惩罚互补损失,\(\mathcal{L}'_p\) 是负的均方重建误差,\(\mathcal{L}_{rec}\) 是模态内重建损失,\(\mathcal{L}_{cyc}\) 是循环一致性损失。权重 \(\lambda_1\)、\(\lambda_2\) 的具体搜索范围未给;论文只说 \(\lambda_1 \in [0.6,0.8]\)、\(\lambda_2 \in [0.3,0.5]\) 时有峰值,但未给最终使用值。
- 训练策略:batch size 16,最多60轮,早停。学习率、优化器、warmup、权重衰减、梯度裁剪全部未说明。
- 关键超参数:隐空间维度 \(d\) 未说明;1D卷积核大小 \(l^m\) 未说明;GAE图结构未说明;离散化bin数 \(D\)、样本数 \(m\)、离散化方式未说明;熵正则系数 \(\alpha\)、互信息惩罚 \(\beta\)、\(\sigma^2\) 未说明;MoE专家网络结构(层数、宽度、激活函数)未说明;路由网络结构未说明;分类器结构未说明。
- 训练硬件:NVIDIA RTX 4090 GPU(原文未说明数量);训练时长未说明。
- 推理细节:解码策略、温度、beam等不适用;分类时如何从恢复表示得到最终情感标签的流程未说明。
- 正则化或稳定训练技巧:未说明。熵正则项声称防专家崩溃,但没有具体实现方式。
- 可视化:图4为t-SNE嵌入空间可视化,图5为不同缺失率下的插值性能对比,图3为 \(\lambda_1\)、\(\lambda_2\) 的F1热力图;这些图均无数值指标支撑,仅能定性说明。
⚖️ 评分理由
创新性 (1.2/2):首次将一致性/互补性语义显式分解到MoE双专家中,并以可学习路由融合双分支预测,组合方式有一定新意;但该组合的理论根基不稳,难以构成高影响力新范式。
技术严谨性 (0.3/1.5):一致性分支声称最小化条件熵,但损失中最大化边缘熵会增大条件熵,理论目标自相矛盾;互补预测最大化重构误差会把缺失表示推向远离真实分布,论文未给出任何理论解释或约束。
实验充分性 (0.8/1.5):在两个数据集、多种缺失设置上与6个基线比较,并包含消融与超参热力图,覆盖面较广;但表2/表1中DiCMoR出现整行完全相同的异常数值,且缺乏统计显著性检验与误差分析,削弱结论可信度。
清晰度 (0.4/1):公式编号大面积重复,式(21)存在孤立‘·’符号笔误,表3的勾选组合与正文描述不一致,离散化符号D/m等也未解释,严重影响可读性。
影响力 (0.8/1.5):面向多模态对话情感识别,包含音频模态,对语音/音频相关情感计算有一定辐射;但核心贡献属于通用多模态框架,且理论缺陷限制后续引用和扩展潜力。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.1/0.5):论文仅披露batch size 16、最多60轮、早停、RTX 4090及特征提取器,未给最终λ1/λ2、优化器、学习率、隐维度、GAE邻接矩阵构建、分类器结构等大量关键配置,几乎无法独立复现。
工程/实践价值 (0.5/1.5):端到端工程链路完整,涵盖1D卷积投影、GAE重建、双专家MoE、路由融合与多设置评测;但缺少效率、延迟、参数量、部署约束或失败案例分析,工程成熟度有限。
🚨 局限与问题
论文明确承认的局限:论文没有设置专门的Limitations小节,也没有在结论中讨论方法自身的局限。唯一提到的是“真实数据中的缺失模式是多样化的”,但未给出相应应对措施。论文在引言中承认一致性与互补性存在内在冲突,但未承认其损失设计是否真正解决了该冲突。论文未讨论“至少保留一个模态”的限制,也未讨论训练/测试缺失率同分布这一假设与现实是否一致。
审稿人发现的潜在问题:
- 信息论目标自相矛盾:一致性分支声称最小化条件熵,实际损失却在最大化边缘熵且没有约束互信息下界,导致一致性目标的数学定义与优化方向不一致。
- 互补预测使用最大化重构误差,理论上会把补出来的表示推向远离真实特征的学习信号,这与“恢复/插补”语义冲突;论文未给出任何正则项或实验证明这种做法有利于下游分类。
- 表2中DiCMoR在CMU-MOSEI的0.0与0.1行完全相同(78.9/78.7/38.5),在CMU-MOSI的0.1与0.2行也完全相同(83.9/83.9/43.6),且表1中DiCMoR在CMU-MOSI的{v}与{a}下同为62.2/60.2/20.9。多个基线出现完全相同的重复数值不像巧合,而更可能是转录或运行错误;这些数据可信度问题直接影响论文结论。