英文题目:TiCAL:Typicality-Based Consistency-Aware Learning for Multimodal Emotion Recognition
会议身份:
conference:aaai:2026:conference-paper-id:38854
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#多模态学习 #正则化 #音视频 #语音 #语音情感识别
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Wen Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Siyu Zhan:机构信息未能从会议 PDF 纯文本可靠映射
- Cencen Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Guiduo Duan:机构信息未能从会议 PDF 纯文本可靠映射
- Xiurui Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Yuan-Fang Li:机构信息未能从会议 PDF 纯文本可靠映射
- Tao He:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多模态情感识别输入为同一话语的文本、视觉与声学特征,输出为离散情感类别或-3到+3的七级情感分,难点在于不同模态常表达冲突情感倾向而统一标签监督会引入歧义。该方法先用高置信锚样本表为各单模态生成伪单模态标签以刻画模态特有倾向,其输出的伪标签与典型性得分共同用于估计样本级模态间一致性。接着将单模态特征嵌入庞加莱球并以层次标签树正则化以增强细粒度可分性,为一致性估计提供结构化表示。然后以一致性加权早期感知、相关整合与高级认知三阶段损失与推理融合,使高一致样本偏向浅层、低一致样本偏向深层。与统一融合或仅优化单模态损失的方法相比,关键差异在于显式量化可信度加权的一致性并据此动态分配不同融合阶段的优化比重,具有处理冲突样本的实际意义。在MOSI基准下,TiCAL的Acc-2为88.10,高于DMD的86.00。该结论适用边界受限于三模态完整且伪标签可初始化的影视独白类数据,缺失模态与强噪声通道的失败条件尚未验证;训练硬件为单张NVIDIARTX4090 GPU训练30轮,推理开销与部署计算量原文未量化。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要输出什么?
这篇论文研究的是多模态情感识别。输入是一个视频片段同时带有的 3 路信号:文本是说话内容,视觉是面部表情和场景画面,音频是语调、强度等声音特征。目标是判断这个片段整体表达的情感。在情感分类任务里输出 6 类离散情感,在情感强度分析任务里输出从负到正的七档分数,例如从负 3 分到正 3 分。初学者容易以为 3 路信号总是指向同一情感,论文首先打破这个假设。
作者指出很多样本存在模态间情感冲突,也就是文本很积极而声音很冲,或者表情惊讶而语言平淡。如果训练时只给一个统一标签,模型会被迫把冲突信号都往同一个答案上拉,学到的特征就会含糊。论文要保留的信息是每个模态自己的倾向、可信程度,以及样本整体的一致程度,最后输出一个考虑了冲突的融合预测。没有收到本次可验证的开源代码与数据链接,因此下文只讲论文报告的方法和数字,不声称代码已公开。
已有路线为什么没有解决冲突?
第一条路线是改进融合结构和表征学习,例如用更强的编码器、对比学习、解耦模态特有和模态共享特征。这类方法让融合更充分,但训练时仍然用统一标签监督每路,没有显式度量模态之间是否一致。第二条路线是不平衡多模态学习,关注模型过度依赖强势模态,例如用梯度调制或轮流单模态优化来平衡学习。这类方法多在梯度层面做调整,没有为每个模态建立明确的学习目标,也没有把一致性作为融合阶段的依据。
第三条相关尝试是优化单模态预测分支,但论文指出它没有刻画模态之间的对齐程度,因此在需要深度自适应融合的冲突样本上仍显不足。教学例子是把 3 个人同时说话录下来,如果只听混合后的总音量,就不知道谁在大声谁在小声,TiCAL 的做法相当于先估计每个人各自的音量和可信度,再决定怎么混合。
冲突长什么样,人又是怎么处理的?
论文用一个电影评论片段说明冲突。文本写着对书的评价,语言极性为正 2 分,视觉倾向惊讶方向为正 3 分,而音频倾向愤怒方向为负 3 分。整体人工标注偏向快乐,但如果只看音频会完全走偏。作者解释高响度既可能出现在快乐也可能出现在愤怒,单靠声音容易误判。人类处理这类问题被描述为分阶段进行,先独立感知各通道,再整合相关信号,最后用高级推理调和矛盾。
论文还引用相关研究说明一致性影响融合网络的优化,冲突样本需要更深和更自适应的整合。这就引出要解决的问题:能否显式算出每个样本的模态间一致性,并用它指导融合。 下面这张图先展示冲突实例,再对比旧范式与新范式,值得按导读顺序细看。
看图路径: 1. 先看上面一行三个模态各自给出的情感词和极性分数;2. 再看下面左侧旧范式与右侧新范式的箭头走向差异;3. 找到右侧图中典型性和一致性进入动态融合的位置;4. 对照中间人类三阶段标注理解从感知到认知的顺序
论文图 1。原论文 Figure 1:“(a) Example of inter-modal emotional conflict where modalities show divergent affective cues.”。
上图上半部分把同一句话的文本、人物海边画面和声音波形并排放置,分别标出快乐加 2 分、惊讶加 3 分、愤怒减 3 分,直观显示 3 路倾向并不相同。下半部分左侧是旧框架,3 路编码后直接融合再输出统一标签,右侧是新框架,先得到各模态伪标签,再算出典型性和一致性去控制动态融合。中间一列把人类过程标为早期感知、相关整合和高级认知,对应模型的 3 个阶段。读图时不要把颜色深浅直接当成性能好坏,颜色只区分模态和阶段,关键是箭头表示信息流向。
TiCAL 把样本从输入带到输出经过哪几站?
沿着一个样本走一遍会更清楚。输入是文本、视觉、音频 3 路原始数据,各自经过模态编码器得到特征向量。接着进入可靠一致性估计,先用高置信锚样本表为每路找一个伪标签,再算每路的典型性,最后合成样本级一致性。然后进入类人分阶段感知,模型同时做早期感知、相关整合和高级认知 3 个预测,训练时用典型性和一致性调整各阶段损失权重,推理时再按一致性加权 3 个阶段的预测得到最终答案。整个流程分为两大块,一块负责测量,一块负责按测量结果学习。
相关整合 × 动态融合: 相关整合的分工是保证基本的多模态信息汇合,动态融合的分工是根据典型性和一致性调整各阶段用力程度,二者搭配的理由是不能让冲突样本的错误早期预测主导训练,也不能丢掉基本融合能力,组合意义是中间阶段固定权重、两端阶段按一致性加权。
下面是整体结构图,左侧是编码,右上是测量,右下是分阶段学习。
看图路径: 1. 沿左侧语言视觉音频的编码箭头找到三个单模态特征;2. 看右上可靠一致性估计中锚表到测量再到正则化的回路;3. 看右下三阶段分支各自对应哪一个损失符号
论文图 2。原论文 Figure 2:“The overview of our proposed TiCAL. TiCAL comprises Reliable Consistency Estimation and Human-like Stage- wise Perception.”。
这张图左侧显示文本视觉音频分别编码为特征,中间用虚线框标出 3 个特征向量。右上绿色区域是可靠一致性估计,包含锚表、测量和标签树正则化,虚线箭头表示真值用于更新锚表,一致性结果向下传给优化。右下黄色区域是类人分阶段感知,早期感知接原始特征,相关整合与高级认知接融合模块,3 个分支分别对应各自损失。观察时先走主路径,再看测量到优化的跨区箭头,就能理解测量如何控制学习。
伪标签和典型性具体怎么算?
先说伪标签。高置信锚样本表是为每个模态维护的一个定长列表,里面只放模型曾预测正确且置信度超过阈值的样本特征和标签。训练早期按阈值收集,收集满后用先进先出的方式更新。过了设定的轮数后,对每个新样本计算它与同模态锚表中所有特征的距离,取距离最小的那个锚的标签作为该模态的伪标签。这个做法的白话理解是,不直接遮住 2 模态去猜剩下一模态,而是看它长得最像哪一个过去的高分样本。
\[Sm = {(fmi, y)} ,\]上式中花括号表示锚表是特征与标签的集合,论文用双曲距离比较特征,细节见双曲部分。
伪单模态标签 × 高置信锚样本表: 伪单模态标签的分工是说出每个模态自己倾向什么情感,高置信锚样本表的分工是提供可信的参照特征库,二者搭配的理由是直接遮蔽另 2 模态去预测容易受噪声干扰,而用与锚特征的距离找最近邻更稳定,组合意义是得到可用于后续一致性计算的单模态倾向估计。
再说典型性。典型性衡量伪标签是否可信,计算依据是该样本到锚表的最小距离在当前批次中的相对位置。距离越小越靠近锚分布,典型性越高,反之越可能是含糊或非典型样本。对每个模态都会得到 1 对伪标签和典型性。
典型性 × 模态间一致性: 典型性的分工是评价伪标签是否可信,越靠近锚分布越典型,模态间一致性的分工是评价 3 个模态是否说同一件事,二者搭配的理由是只看标签是否相等会漏掉一模态很确定、另一模态很含糊的情形,组合意义是用典型性加权的标签差异得到更可靠的样本级一致性分数。
最后说一致性。一致性同时看标签差异和典型性乘积,标签越分散则一致性越低,任一模态典型性很低也会拉低一致性。公式中用温度和缩放超参数控制敏感度,用密度超参数控制标签差异的形状。
双曲空间 × 标签树: 双曲空间的分工是提供能容纳层次关系的几何距离,标签树的分工是把离散情感类别变成带权重的层次结构,二者搭配的理由是快乐与愤怒在响度上可能相近,需要层次约束来拉开细粒度差异,组合意义是通过对齐树距离与双曲距离来正则化单模态特征。
双曲与标签树的配合是为了解决情感类别边界模糊的问题。庞加莱球模型把特征放在单位开球内,用双曲距离代替欧氏距离,树距离定义为标签树上两节点最短路径的权重和,训练时最大化两类距离的相关系数,使层次相近的情感在特征空间也相近。
三个阶段如何加权训练和推理?
模型分成早期感知、相关整合和高级认知 3 个阶段。早期感知直接对原始特征做预测,相关整合用交叉注意力做基本融合后预测,高级认知在融合后用更深的分支做预测。每阶段都用类别加权的交叉熵损失来缓解长尾问题,网络结构多为轻量多层感知机。典型性用来给高级认知阶段的 3 个单模态分支加权,典型性越高反而权重越低,目的是不让某个占优模态长期主导。一致性用来在早期感知和高级认知之间分配权重,一致性高则重视早期感知,一致性低则把学习推向高级认知,中间的相关整合阶段权重固定以保证基本融合能力。
早期感知 × 高级认知: 早期感知的分工是直接从原始单模态特征做预测,高级认知的分工是在融合后做更深入的再预测,二者搭配的理由是高一致样本适合早阶段学,低一致样本需要晚阶段精修,组合意义是用一致性分数动态分配两个阶段的损失权重。
训练分两段进行。前面若干轮只用任务损失做常规训练,不启动动态加权和双曲正则,后面才引入典型性、一致性和双曲相关损失。推理时把 3 个阶段的预测按一致性加权相加,一致性高更相信早期感知,一致性低更相信高级认知。
\[LAC =ϕ(τl)Ll\]上式是高级认知阶段按典型性加权的损失,权重函数随典型性增大而减小。
\[Ltask = κLEP(ˆy\]上式是总任务损失,一致性控制早期感知与高级认知的相对比重。
\[Lall = Ltask −LHypCPCC(fm\]上式是后段训练的总目标,任务损失减去双曲相关项,含义是最大化特征与标签层次的一致性。
\[ˆyfinal = κˆyEP + ˆyCI + (1 −κ)ˆyAC.\]上式是推理时的最终预测组合,同样用一致性在早期与高级预测之间插值,中间保留相关整合的预测。
在什么数据和条件下测,指标方向是什么?
论文在 4 个公开数据集上验证。文本情感强度任务用 CMU-MOSI 和 CMU-MOSEI,前者约 2000 个独白片段,后者约两万多个电影评论片段,每个样本标注负三到正三的七档分数。离散情感任务用 DFEW 和 MER2023,视频来自电影电视剧,标注 6 类离散情感。特征方面文本用预训练语言模型得到原始特征,视觉和音频分别用常用面部与声音工具提取。评价指标在强度任务上用 2 分类准确率、七分类准确率和 F1 分数,数值越高越好,其中 2 分类只看正负。
在离散任务上用非加权平均召回和加权平均召回,同样越高越好。训练在一块显存较大的显卡上用常见深度学习框架完成,优化器为常用自适应优化器。比较对象包括情感与多模态专用模型、多模态学习方法以及部分大语言模型,论文说明其中部分多模态学习基线是用公开代码复现的。 下面这张表把训练与一致性相关的关键设置放在一起,共有五列,便于 1 次核对学习率、批量、轮数、阈值和一致性参数。
表前的问题是复现时哪些数字必须照抄,公平条件是同硬件同特征下只改方法,指标方向都是越高越好。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 学习率批量衰减 | 训练配置 | 1e-4 | 16 | 0.005 与 30 轮 |
| 一致性超参 | 初始化轮数 | 5 | 密度 4 | 缩放 0.5 与温度五分之一 |
| 锚表阈值 | 最高精度点 | 0.5 | 0.8 | 0.9 下降 |
| 任务类型 | 数据集 | MOSI | MOSEI | DFEW 与 MER2023 |
| 监督方式 | 标签 | 统一标签 | 伪标签加典型性 | 一致性加权 |
表后需要说明代价。固定阈值和轮数简化了复现,但阈值过高会导致锚表初始化不足,阈值过低则混入不可靠样本。
后段才引入动态加权意味着前期测量尚未稳定,复现时要严格按轮数切换。未报告训练时长和推理延迟,因此不能从准确率推断效率优势。
主结果在什么条件下胜出,哪里没有胜出?
要回答的核心问题是考虑冲突后是否在保持公平特征和划分下提升准确率。论文报告在 MOSI 上 2 分类准确率、F1 和七分类准确率都超过解耦蒸馏基线,在 MOSEI 上总体也更好,但在 F1 一项上优势不明显。作者把原因归于多阶段融合更好地利用了时序和上下文依赖,这属于有限解释而非因果证明。在离散情感任务上,方法在 DFEW 和 MER2023 上超过任务专用基线和大语言模型基线,显示对极性和离散类别都有适应性。
需要保留的一个未胜出项是 MOSEI 的 F1 没有拉开差距,说明在更大更杂的数据上提升并不均匀。另一个边界是所有主结果都假设 3 模态完整可用,没有评测缺失或强噪声模态下的表现。 下面这张表用五列整理主结果的比较问题、指标、基线数字、本方法数字和提升口径,数字保留原文写法。表前的问题是谁在什么指标上比谁高,公平条件是同数据集同指标,指标方向都是越高越好。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| MOSEI 综合 | 准确率与 F1 | 86.60 与 86.60 | 87.03 与 87.05 | 提升较小 |
表后解释主要收益与代价。收益集中在冲突样本上,因为一致性把难样本推向更深的融合分支。代价是引入锚表长度、阈值、温度、缩放和密度等多个超参数,调参负担增加。不能把总体提升推广到每个样本都变好,也不能把自动指标的提升等同于人工感知的提升。
拿掉哪一块掉得最多,阈值怎么选?
消融要回答每个组件是否必要。论文在 MOSI 上报告,去掉典型性加权后 2 分类和 F1 下降约 0.9 个百分点,去掉一致性加权后下降约 1.5 个百分点,去掉双曲距离改用欧氏距离后也有下降,去掉双曲相关损失后下降约两个百分点,是下降幅度最大的一项。这支持双曲结构化对伪标签质量很关键,但仍是支持性证据,不是拿掉后必然如何的普遍规律。另一个特有细节是阈值分析,模型在阈值为 0.8 时最高,阈值为 0.9 时反而下降,原因是过严的阈值使锚表无法充分初始化。 下面这张阈值图需要在同一小节形成导读与解释的闭环。
看图路径: 1. 先确认横轴是阈值而纵轴是 MOSI 与 MOSEI 上的性能;2. 比较 0.8 处两根柱子与其他阈值的高度差异;3. 观察 0.9 处柱子下降的幅度
论文图 3。原论文 Figure 3:“The performance of our TiCAL method with dif- ferent confidence threshold θ in HASL initialization. The left side is on MOSI and the right side is on MOSEI.”。
这张图左右两幅分别是在 MOSI 和 MOSEI 上阈值从 0.5 到 0.9 的柱状对比,每组有 2 分类准确率和 F1 两根柱子。可见 0.8 处两根柱子最高,红色虚线标出该高度,0.9 处明显回落。像素能辨别的是相对高低,不能读出精确到小数点后 2 位的数值,具体数值以正文表格为准。也不要把单阈值最优推广为所有数据集通用,复现时仍需在验证集上搜索。 下面这张表用五列整理消融条件、指标、完整模型、本方法缺失项和下降口径。
表前的问题是哪个缺失代价最大,公平条件是同数据同训练轮数,指标越高越好。
| 条件 | 指标 | 基线 | 本方法 |
|---|---|---|---|
| 去典型性 | 2 分类 | 88.10 | 87.18 |
| 去一致性 | 2 分类 | 88.10 | 86.59 |
| 去双曲损失 | 2 分类 | 88.10 | 86.03 |
| 去典型性 F1 | F1 分数 | 88.09 | 87.20 |
| 去一致性七分类 | 七分类 | 46.79 | 44.68 |
表后要指出反例与限制。双曲损失缺失时掉得最多,说明层次约束重要,但欧氏距离在某些简单一致样本上可能已够用,论文没有分样本类型报告消融,因此不能断言每类样本都一样。
阈值分析只覆盖 0.5 到 0.9,没有报告锚表长度和批次大小的联合影响。
哪些结论还不能下,边界在哪里?
论文明确承认一个局限,即训练和推理都假设模态完整可用,在真实场景中某些模态可能缺失或噪声很大,未来需要扩展到不完整模态。从证据角度看,还有几项未验证的推测需要区分。人类 3 阶段只是设计灵感,不能当成模型真的实现了神经机制。案例中展示的伪标签和一致性分数能解释单个预测,但不等于整体可解释性得到度量。论文没有报告误判率分布、延迟、显存占用和推理帧率,因此不能承诺这些量得到改善。
相关性也不等于因果,例如一致性低的样本更难,不一定是动态加权本身带来了全部提升,还可能与特征质量有关。适用边界是 3 模态齐全、标注为统一情感标签、有足够高置信样本可建锚表的数据,超出这个范围的效果待验证。
要复现先做什么,需要哪些信息条件?
复现先从数据和特征对齐做起。按论文交代准备 MOSI 与 MOSEI 的划分,用相同的文本、视觉、音频编码器得到原始特征,再实现 3 阶段的轻量分支和交叉注意力融合。接着实现锚表逻辑,定长列表只收预测正确且置信度超过阈值的样本,满后先进先出更新,阈值先设 0.8,初始化轮数设为 5 轮。训练前 5 轮只用任务损失,之后再加入典型性加权、一致性加权和双曲相关损失,一致性参数按密度四、缩放 0.5、温度五分之一起步。推理时按一致性加权 3 个阶段的预测。
由于本次没有验证通过的公开链接,不能写代码已公开,复现时要自己实现锚表更新、双曲距离和标签树距离。还需要补做的验证是记录不同随机种子的波动、缺失模态下的退化曲线,以及训练与推理的实际耗时,否则无法判断收益是否值得额外复杂度。
何时值得尝试这个方法?
当你的多模态数据中经常出现文本与声音或表情不一致,而统一标签又不得不给一个时,这个方法值得尝试。它的核心动作是先为每路估计倾向和可信度,再用样本级一致性决定浅层与深层分支各自用多大力气,最后用层次约束让易混情感分得更开。如果数据本身高度一致,动态加权的收益可能有限,却要付出调参和维护锚表的代价。初学者复述时可以这样记,先找可信参照,再给每路打分,然后按总一致性分配学习,最后按同一权重组合预测。
记住区分论文直接报告的数字、支持性解释和未验证推测,冲突处理的有效性在完整模态下得到报告,在缺失模态和部署成本上仍是开放问题。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


