英文题目:MultiEmoVec: Learning Generalised Multimodal Emotion Representation by Momentum Contrast and Multi-task Reconstruction

会议身份:conference:interspeech:2026:conference-paper-id:liu26m_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #多任务学习 #预训练 #语音情感识别

评分:7.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:方法研究

👥 作者与机构

  • Junchen Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Jesin James:机构信息未能从会议 PDF 纯文本可靠映射
  • Karan Nathwani:机构信息未能从会议 PDF 纯文本可靠映射
  • Michael Witbrock:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多模态情感识别以语音、视频、文本为输入并输出情感或观点类别,难点是大规模情感标注稀缺,且真实情感库普遍存在模态缺失、噪声污染与跨采集条件不一致的问题。该方法先将Wav2Vec语音、MA-Net视频与DeBERTa文本特征经两层MLP投影到共享512维空间,再并行执行掩码重建以恢复缺失模态与加噪去噪重建以抵抗混合污染。重建后的原始特征进入6层交叉注意力与单层Transformer编码器构成的9嵌入融合,输出的融合表示再由动量对比编码器与动态负样本队列学习判别性表示,并用自适应损失缩放平衡多目标。与依赖文本锚点或复杂图聚合的前人方法不同,该框架以轻量注意力融合替代构图,以双重建缓解纯对比学习对损坏输入的脆弱性。在CMU-MOSEI评测下,MultiEmoVec的Acc-7准确率为55.31%,高于MGAFR基线的Acc-7准确率52.24%。其适用边界是结论主要受限于YouTube风格观点视频,向实验室双人交互数据的外推仅在IEMOCAP上有限验证且尚未验证跨库超越同库监督。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么,目标是什么,本文要解决什么困难?

本文的输入是同一个话语片段的 3 个模态:说话声音、面部视频和文字转录。目标是判断这段话的情绪或情感强度,例如在 CMU-MOSEI 和 CMU-MOSI 上做七分类和二分类,在 IEMOCAP 上做四分类和六分类。必须保留的一个信息是,情绪数据库普遍存在标注贵、模态缺失、噪声大、记录条件不一致的问题,文本有时并不可靠,视频常受姿态光照影响。输出是先用无情绪标签的方式学一个通用多模态情绪表示,再冻结编码器,用一个轻量分类器在不同数据库上复用。

学习这篇论文时,先把流程记成一条主线:用固定抽取器得到 3 路特征,用掩蔽和去噪两个重建任务练补全和抗噪,用动量对比练可分性,用自适应缩放平衡 3 个损失,最后冻结迁移。后续所有细节都挂在这条主线上,就不容易把特征抽取、融合、预训练、微调 4 个阶段混淆。

已有路线为什么不够用?

第一条路线是有监督多模态融合,直接用标注学跨模态线索,效果好但依赖大规模标注,而情绪标注既贵又主观,这是本文要绕开的前提。第二条路线是多视角聚类,例如深层不完整多视角聚类和鲁棒多视角聚类,原本不是为情绪设计,搬到情绪任务时会遇到情绪表达细微、重叠、上下文依赖的问题,类间可分性弱,加上常用浅层手工特征,难以刻画语义复杂度。

第 3 条路线是以文本为锚的无监督对比学习,用语言驱动跨模态对齐,但它默认文本总是最可靠的情绪载体,当文本有噪声或与真实情绪不一致时就会失效。第四条路线是图神经网络,例如作为基线的 MGAFR 框架,用动态近邻补全、跨模态多路图聚合、动态特征精炼和跨模态对比对齐来处理缺失模态,但建可靠图结构难且计算代价高。

MultiEmoVec 的选择是保留无监督表示学习的思路,但不用聚类决定类别,不把文本当唯一锚,不建复杂图,而用轻量注意力融合加动量对比加双重建,论文报告其可训练参数为 16.28M,比基线少 6.8M,这支持其更轻的主张,但是否在所有规模下都更省,需要按原文硬件条件复测才能确认。

任务形式与评测口径是什么?

预训练只用 CMU-MOSEI,该库有 22856 条来自 YouTube 的标注视频话语,情感分数从负 3 到正 3,论文用它学表示是因为规模大、说话人和场景多样。注意预训练阶段不用情绪标签,只用特征本身做掩蔽恢复、去噪恢复和对比一致性。下游评测是冻结预训练得到的编码器,把学到的表示作为固定特征,再在 CMU-MOSEI、CMU-MOSI 和 IEMOCAP 上训练轻量监督分类器。CMU-MOSI 有 2199 个视频片段,同样是负 3 到正 3 的七点强度,论文沿用基线相同的二分类和七分类设置,二分类是负与非负的划分。

IEMOCAP 是 10 个演员的情绪表达,原有 9 类情绪,本文取 4 类和 6 类构成相对均衡、在说话人无关条件下的库。指标方向都是越高越好,包括七分类准确率、二分类准确率、二分类 F1 和加权 F1。论文特别提醒二分类准确率在不均衡库上可能虚高,总预测多数类也显得好,因此强调七分类准确率作为主要指标。这个提醒很重要,读结果时不能只看二分类是否涨了零点几个点。

五步流水线如何串起一个样本?

沿一个样本走一遍最清楚。假设有一条 YouTube 话语,先分别抽出语音、视频、文本 3 路特征,再同时走 3 条并行路径。第一条是掩蔽重建路径,把干净特征随机遮掉一个模态的一部分维度,要求模型用另两个模态补全。第二条是去噪重建路径,先做样本间混合、特征掩蔽和高斯加噪,再要求恢复干净特征。第 3 条是融合对比路径,把原始干净特征送入跨模态注意力和变换器编码器得到融合表示,再做 2 次增强得到查询和键,用动量对比拉近正对、推开队列负样本。

最后用自适应损失缩放把 3 个损失动态加权成一个总损失。下面这张官方框架图把 5 步画在同一张图里,先看文字导读再看图,再读图后解释,就能把分支关系固定下来。

看图路径: 1. 先从左侧多模态输入框沿箭头看到三路特征抽取器分别输出视频语音文本特征;2. 再对比中间上方掩蔽重建分支与中间去噪重建分支的输入污染方式有何不同;3. 接着看下方跨模态注意力到变换器编码器再到解码器和动量对比的融合主路;4. 最后看右上角自适应损失缩放如何同时指向三个损失符号形成闭环

原论文 Figure 1:The proposed pre-training framework follows a multi-stage pipeline for representation learning.

论文图 1。原论文 Figure 1:“The proposed pre-training framework follows a multi-stage pipeline for representation learning.”。

这张图从左到右分为 4 个字母框。框 a 是多模态输入,视频走 MA-Net 得到视频特征,语音走 Wav2Vec 得到语音特征,文本走 DeBERTa 得到文本特征,3 路颜色在后继分支中保持一致,便于追踪。框 b 是掩蔽重建,只有最上一路被部分遮挡,虚线箭头表示用绿色和蓝色完整模态去补黄色缺失块。框 c 是去噪重建,3 路都依次经过混合、特征掩蔽、高斯噪声,阴影和斜线表示污染程度,再经重建回到干净块。

框 d 是跨模态注意力编码器加解码器,先生成交叉嵌入,再经变换器编码器和解码器得到融合特征,随后进入动量对比模块。右上角自适应损失缩放同时指向掩蔽损失、去噪损失和对比损失,蓝色粗箭头表示融合对比结果回送参与总损失。读图时不要把框 b 和框 c 看成串行先后,它们是并行双路径,输入都源于框 a,输出都参与同一总损失。

特征从哪里来,维度如何统一?

特征抽取沿用基线做法,目的是让性能差异归因于框架而非输入质量。语音用 Wav2Vec 基础模型,每条话语输出 512 维嵌入,论文称其能同时捕捉音素细节和副语言线索。视频用 MA-Net,融合多尺度注意力以兼顾局部表情和全局视觉上下文,输出 1024 维表示。文本用 DeBERTa 大模型,在 BERT 基础上改进解耦注意力和位置编码,输出 1024 维表示。3 路维度不同,进入后续网络前先各自经两层带 ReLU 激活和层归一化的多层感知机,投影到共享的 512 维嵌入空间。

投影后的嵌入以 NumPy 格式存好,再送入重建和融合模块。初学者容易误以为本文训练了这 3 个大模型,原文没有这样说,它们是固定的特征抽取器,真正预训练的是后面的重建、融合和对比部分。复现时若换抽取器或维度,就不再是原文的可比条件。

动量对比 × 掩蔽重建: 动量对比负责在融合表示空间里拉近同一 utterance 的两个增强视图、推开队列中的负样本,形成可区分的情绪嵌入;掩蔽重建负责随机遮掉一个模态 20% 维度并用另两个完整模态补全,教会模型跨模态补信息。二者搭配的原因是纯对比学习怕缺损输入,而纯重建缺判别性,组合后表示既完整又可分。

去噪重建 × 混合增强: 去噪重建负责把被污染的特征恢复成干净特征,目标是局部鲁棒;混合增强负责按系数在样本间插值并叠加特征掩蔽和高斯噪声,制造过渡态和全面损坏。二者搭配的原因是只加噪声学的是局部平滑,加上混合才能学到样本之间的过渡边界,组合后模型同时处理信息丢失和全面损坏。

跨模态注意力 × 变换器编码器: 跨模态注意力负责显式建模非对称依赖,生成 6 个交叉嵌入如视频到语音、文本到语音,保留谁补谁的方向信息;变换器编码器负责把 3 个单模态嵌入加 6 个交叉嵌入共 9 个嵌入做全局交互和融合。搭配的原因是只有关注权重没有全局融合会碎片化,只有全局融合没有方向性会丢互补线索,组合后得到统一的融合表示。

具体到掩蔽和去噪的实现,掩蔽重建每次随机选一个模态,遮掉该模态 20% 的特征维度,再重建完整原始特征,用均方误差做损失。去噪重建的污染更重,每个模态先做特征级混合,混合参数为 0.5,混合系数设为 0.5,再做特征掩蔽并加方差 0.05 的高斯噪声,同样用均方误差恢复干净特征。论文解释分工时说,高斯噪声练局部鲁棒,掩蔽迫使跨模态恢复,混合通过插值平滑决策边界并让模型看到过渡态。

融合侧采用 9 嵌入设计,包括 3 个单模态嵌入和 6 个交叉注意力嵌入,交叉部分显式保留方向性,再用 6 层 8 头多头注意力捕捉交互,用单层变换器编码器做全局融合,前馈维度为投影尺寸的 4 倍并用 GeLU 激活,输出序列经均值池化和线性层得到融合表示,再经投影头映射到 1024 维。对比侧用动量对比,查询编码器和动量更新的键编码器分别编码两个增强视图,动态队列保留 4096 个负样本,用温度 0.06 的 InfoNCE 损失计算,键编码器动量为 0.999。

动量队列的好处是不需要大批量也能有丰富负样本,这对多模态计算贵、批量常受限的场景很关键。

三个损失如何平衡,优化如何组织?

总损失由三项组成,分别是对比损失、掩蔽补全损失和去噪重建损失,各自乘以权重和自适应缩放因子。论文把掩蔽补全损失作为参考尺度,因为它反映模型估计缺失模态的能力,对比和去噪损失相对它动态重缩。自适应缩放基于指数滑动平均,动量系数设为 0.9,缩放指数设为 0.4,热身 10 个周期,裁剪上下界为 0.5 到 2.0。这样做的直接目的是稳定多任务训练,避免某一项损失量级过大主导梯度。

自适应损失缩放 × 多任务联合优化: 多任务联合优化负责同时最小化对比损失、掩蔽补全损失和去噪损失;自适应损失缩放负责以掩蔽补全损失为参考尺度,用指数滑动平均把对比和去噪损失动态重缩放到同一量级。搭配的原因是三项损失量纲和收敛速度不同,直接相加会被某一项主导,组合后训练更稳定。

优化分两个阶段。预训练阶段训练 80 个周期,用 AdamW 优化器,学习率为 1e-4,权重衰减为 1e-5,在 PyTorch 中于单张 NVIDIA RTX 4090 上完成。下游阶段冻结由跨模态注意力得到的编码器,只训练分类器,分类器用 Adam 优化,学习率为 1e-3,权重衰减为 1e-5,训练 10 个周期。数据库按 70% 训练、10% 验证、20% 测试划分。需要指出的缺项是,原文没有给出批量大小、增强视图的具体构造算子、投影头层数和分类器层数,也没有说明验证集在预训练早停或超参选择中的确切用法,这些在复现时需要回到公开代码核对,不能从模型名推定。

论文还报告代码和预训练模型当前可用,资源状态显示代码链接和模型链接均可达,地址为公开仓库,但本次解读不把仓库内容当作已核验事实,复现前仍需自行确认版本一致。

基线是谁,比较条件是否公平?

基线是 MGAFR 框架,论文称其为处理缺失模态的无监督多模态情绪识别先进方法,包括动态近邻补全、跨模态多路图聚合、动态特征精炼和跨模态对比对齐 4 个模块,通过图补全加对比对齐得到一致且可分的表示。公平性处理上,特征抽取与基线保持一致,下游轻量分类器配置也与基线相同,预训练表示冻结后才做监督微调,因此下游增益更可能来自表示质量。此外还与 SURE、CPSPAN、DCP 等方法在 CMU-MOSEI 上对比七分类准确率、二分类准确率和二分类 F1。

为检验统计可靠性,论文在 10 个随机种子上重复并报告 95% 置信区间,MultiEmoVec 的七分类、二分类和二分类 F1 分别为 53.47% 正负 0.75、84.00% 正负 0.17、89.09% 正负 0.12,基线对应为 48.95% 正负 2.15、83.02% 正负 0.81、82.75% 正负 0.93,这支持更高均值且方差更低的判断。

冻结编码器 × 轻量分类器: 冻结编码器负责固定预训练得到的跨模态注意力与变换器参数,只输出固定多模态表示,不再更新;轻量分类器负责在这组固定特征上用有标签数据学七分类或二分类边界。搭配的原因是要检验表示本身的迁移能力而非分类器的拟合能力,冻结后性能差异才能归因于预训练框架。

跨库泛化时,先在 CMU-MOSEI 上无监督预训练,再冻结并到 CMU-MOSI 和 IEMOCAP 上训分类器。CMU-MOSEI 与 CMU-MOSI 都来自 YouTube,分布较接近,IEMOCAP 在记录条件和交互风格上差异更大,因此 IEMOCAP 更能检验分布偏移下的迁移。与全监督方法的对照保持特征抽取管线相同,区别只在学习范式,引用结果为 Lian 等人方法在 IEMOCAP 四分类和六分类加权 F1 为 78.36% 和 58.64%,MultiEmoVec 用 CMU-MOSEI 预训练表示达到 74.54% 和 55.70%。这个对照的适用条件是特征管线一致,但分类器、划分和调参是否完全一致仍需看原文细节,不能直接当成同算力胜负。

主结果测了什么,谁赢了,代价是什么?

主结果要回答的问题是,在相同特征和相同下游分类器配置下,无监督预训练表示能否在 CMU-MOSEI 上超过图基线和聚类对比方法。公平条件是特征抽取沿用基线,下游分类器配置相同,指标越高越好,其中七分类准确率是主要指标。表中同时保留 SURE 和 MGAFR 两个可运行对照,避免只挑一个弱基线。下表按原文写法保留百分比与 2 位小数精度,不做四舍五入。

任务与库指标MGAFR 基线SURE 对照MultiEmoVec
CMU-MOSEI 情感分类七分类准确率52.24%51.77%55.31%
CMU-MOSEI 情感分类二分类准确率83.97%83.75%84.10%
CMU-MOSEI 情感分类二分类 F184.34%83.97%89.08%

表后解释需要同时看到收益与代价。主要收益是七分类从 52.24% 提升到 55.31%,论文正文称比基线高 3%,二分类 F1 从 84.34% 提升到 89.08%,幅度明显,且可训练参数从基线多 6.8M 降到 16.28M,支持更轻且更准的判断。具体代价一是二分类准确率只从 83.97% 到 84.10%,提升很小,说明在粗粒度二分类上优势有限;二是未胜出项依然存在,例如二分类准确率上各方法都在 83% 到 84% 区间挤在一起,单看该指标会低估七分类的差异;三是该表只覆盖 CMU-MOSEI 库内评测,不能推广到跨库,跨库结论需要下一节的迁移表支撑。结合 10 种子区间的低方差,论文的稳健性主张得到支持,但仍受限于单卡单划分下的重复,换划分或换种子范围可能变化。

跨库迁移能否证明通用表示?

跨库问题是 CMU-MOSEI 上学到的无标签表示,能否直接冻结搬到分布不同或规模更小的库。比较条件是预训练库固定为 CMU-MOSEI,下游只训轻量分类器,指标为准确率和加权 F1,越高越好。下表按原文保留四行跨库结果,数值与精度不改。

评测库与任务准确率加权 F1预训练来源监督使用
CMU-MOSEI 七分类55.31%51.98%CMU-MOSEI 无标签预训练下游有标签
CMU-MOSI 七分类38.78%36.57%CMU-MOSEI 无标签预训练下游有标签
IEMOCAP 四分类74.78%74.54%CMU-MOSEI 无标签预训练下游有标签
IEMOCAP 六分类55.21%55.70%CMU-MOSEI 无标签预训练下游有标签

表后解释要看到支持与限制。支持点是 CMU-MOSI 上迁移七分类达 38.78%,而基线全量在 CMU-MOSI 上训练为 39.19%,差距仅 1.41 个百分点,说明 YouTube 分布接近时迁移几乎不掉点。更严格的是 IEMOCAP,四分类加权 F1 为 74.54%,六分类为 55.70%,而相同特征管线下全监督方法为 78.36% 和 58.64%,六分类差距在 3 个百分点以内,且预训练未用任何情绪标签,这支持强迁移的主张。限制是 CMU-MOSI 与 CMU-MOSEI 同源,强结果可能来自分布相似而非真正通用;IEMOCAP 虽有分布偏移,但仍有约 3 到 4 个点的差距,且论文未报告跨库多次种子的方差,也未评测缺模态比例变化时的跨库衰减,因此不能把通用性推广到任意采集条件。

拿掉某个模态或模块会发生什么?

消融要回答两个问题:哪个模态最重要,哪个训练目标不可少。模态消融在 CMU-MOSEI 上比较 3 模态与双模态,条件是指标相同、预训练加下游流程相同。论文报告 3 模态为 55.31%、84.10%、89.08%,视频加文本为 52.14%、83.86%、88.92%,语音加文本为 52.33%、83.97%、88.87%,视频加语音骤降到 42.86%、72.01%、83.27%。这支持文本贡献最大、视频最弱的解释,论文给出的有限解释是文本语义与情绪类别高度相关,而 YouTube 视频受姿态角度光照影响大,但这只是可能原因之一,未做因果验证。模块消融比较只训监督分类器、只用动量对比、动量对比加掩蔽、动量对比加去噪和完整模型。下表保留原文三列指标与精度,不添加自行计算的提升值。

预训练配置七分类准确率二分类准确率二分类 F1
仅监督分类器42.91%71.02%83.05%
仅动量对比51.68%81.84%83.06%
完整模型55.31%84.10%89.08%

表后解释要区分直接报告与推测。直接报告是完整模型七分类为 55.31%,仅监督为 42.91%,仅动量对比为 51.68%,说明对比表示本身有效;再加掩蔽进一步提高可分性,加去噪则拿到二分类 F1 为 89.16%,完整三目标组合最优。未胜出项是只用动量对比时二分类 F1 仅 83.06%,与仅监督的 83.05% 几乎持平,说明单靠对比对二分类 F1 帮助很小,必须靠重建补全。超参敏感性方面,掩蔽率从 10% 到 50% 平均七分类、二分类、二分类 F1 为 54.44%、83.90%、89.06%,混合系数在 0.1 到 0.5 内波动在 0.8% 以内,高斯噪声方差从 0.05 到 0.5 影响不超过 1.22%,这支持对这些超参相对不敏感,但原文只给区间与最大波动,没有给出每档完整曲线,不能说每一步都单调。

哪些结论还不能下,边界在哪里?

首先,未测量误判率、延迟、推理开销和输出帧率,参数量减少 6.8M 是训练参数规模的直接报告,不能等同于推理更快或更省显存,实际延迟需要单独计时。其次,特征抽取器固定且沿用基线,若换 Wav2Vec、MA-Net、DeBERTa 版本或维度,掩蔽率、混合系数、噪声方差和自适应缩放的结论可能变化,本文没有覆盖这种联合变化。第三,文本最重要、视频最弱的结论基于 CMU-MOSEI 的 YouTube 分布,在 IEMOCAP 这类实验室交互数据上是否成立,原文没有给出分模态跨库消融,属于待验证推测。

第四,二分类准确率在多个方法间差异很小,单用该指标容易得出都不差的错觉,必须以七分类和 F1 为主。第五,统计上虽有 10 种子和 95% 区间,但划分固定为 70%、10%、20%,没有报告换划分或交叉验证的结果。最后,图结构难建、计算贵是论文对图方法的定性判断,没有在同一硬件上给出端到端训练时长和显存的并排数字,因此只能当作动机陈述,不能当作已测量的效率胜负。

要复现先做什么,需要哪些信息条件?

先按依赖顺序准备三件事。第一是数据与划分,下载 CMU-MOSEI、CMU-MOSI 和 IEMOCAP,按 70% 训练、10% 验证、20% 测试划分,IEMOCAP 按原文取 4 类和 6 类并保证说话人无关,记录所选类别名单,否则无法对齐 55.21% 和 74.78% 这类数字。第二是特征,先用 Wav2Vec 基础模型抽 512 维语音、MA-Net 抽 1024 维视频、DeBERTa 大模型抽 1024 维文本,再经两层多层感知机投影到 512 维,保存为 NumPy 格式,任何抽取器替换都要单独注明。

第三是预训练与下游,预训练设掩蔽 20% 单模态维度、混合参数 0.5、混合系数 0.5、高斯方差 0.05、均方误差重建、6 层 8 头注意力、变换器前馈 4 倍、投影到 1024 维、队列 4096、温度 0.06、键动量 0.999、自适应缩放动量 0.9、指数 0.4、热身 10 周期、裁剪 0.5 到 2.0、AdamW 学习率 1e-4 权重衰减 1e-5 训练 80 周期;下游冻结编码器,用 Adam 学习率 1e-3 权重衰减 1e-5 训练 10 周期。代码与模型资源状态为可用,链接当前可达,但复现时要锁定提交版本并核对缺失的批量大小、增强算子和分类器结构。

若先做最小验证,建议先跑通 3 模态主结果,再跑仅动量对比和仅监督两个锚点,确认 12.4 和 8 个百分点量级的差距复现后,再做跨库迁移。

何时值得尝试,还需补哪项验证?

当你的情绪数据标注少、常有模态缺失或噪声大,且已有较好的单模态抽取器时,这套先无监督学表示再冻结迁移的路线值得尝试,因为它不依赖情绪标签就能得到可分且可补全的表示,并在 CMU-MOSEI 七分类和 IEMOCAP 六分类上接近或超过基线。但当文本缺失严重或视频质量极差时,是否仍有效需要先做双模态试点,因为原文视频加语音已掉到 42.86%。当算力只允许小批量时,动量队列的设计是加分项,但仍需实测显存和时长。

还需补的验证包括缺失比例曲线、不同噪声强度下的跨库衰减、换特征抽取器后的敏感性,以及推理延迟与显存的并排测量。记住本文的因果链条是双重建补鲁棒、动量对比给可分性、自适应缩放保稳定、注意力融合保互补,任一环节的超参改动都应回到七分类准确率和加权 F1 上检验,而不是只看二分类准确率。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总