英文题目:TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis with Missing and Noisy Modalities

会议身份:conference:aaai:2026:conference-paper-id:37212

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#多模态学习 #鲁棒性 #音视频 #语音情感识别

评分:7.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Yan Zhuang:机构信息未能从会议 PDF 纯文本可靠映射
  • Minhao Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Yanru Zhang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jiawen Deng:机构信息未能从会议 PDF 纯文本可靠映射
  • Fuji Ren:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多模态情感分析(Multimodal Sentiment Analysis, MSA)以文本、音频、视频为输入预测情感极性或类别,现实中缺失模态与传感器噪声常同时出现并相互放大误差。所提两阶段模态去噪与补全框架(Two-stage Modality Denoising and Complementation, TMDC)先在完备数据上并行学习去噪后的模态特有表示与模态共享表示,再在缺失场景下以可用模态的双类表示为查询与键值做融合补全,最终拼接补偿特征与精炼单模态特征送入全连接层预测。该设计与仅重建缺失信号的方法差异在于把变分信息瓶颈(Variational Information Bottleneck, VIB)去噪置于补全之前,避免噪声污染跨模态重建。在 MOSEI 七种缺失组合平均上 TMDC 达到 81.22 准确率与 80.76 F1 值,超出最强基线 MoMKE 约 0.78 个点;在 MOSEI 高斯噪声强度 10 下达到 71.2 准确率,领先 MoMKE 约 10.0 个点。结论限于 MOSI、MOSEI 与 IEMOCAP 三个已对齐特征基准及人工零向量模拟缺失与高斯噪声注入设置,未验证自然缺失、非平稳噪声与跨数据集迁移。原文未披露训练时长、推理延迟或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/YetZzzzzz/TMDC — 链接可访问(HTTP 200) 预印本/扩展版链接未在会议页展示;会议版来源见页首官方记录与 PDF。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,什么信息必须保留?

这篇论文研究的输入是按话语对齐的 3 模态序列,分别记为文本、视频和音频。每个样本的每个模态都是一个序列矩阵,维度由该模态的序列长度与特征维度决定。目标是多模态情感分析,也就是把 3 路信号融合成一个情感判断。

在 MOSI 和 MOSEI 上,情感分数范围是负 3 分到正 3 分,论文按先前工作把分数转成二分类标签并报告准确率与 F1。在 IEMOCAP 上,论文取中性、高兴、悲伤、生气 4 类情绪,用五折交叉验证报告加权准确率与非加权准确率。

必须保留的信息有两类。第一类是各模态独有的判别线索,例如文本的措辞极性、音频的韵律能量、视频的面部动作,这些线索不能被其他模态完全替代。第二类是跨模态共享的情感公共部分,例如同一高兴话语在文字、表情和语气上的一致倾向。

输出是融合可见模态的提纯表示与为缺失模态合成的补偿表示后,由全连接层给出的情感预测。对刚进入语音音乐音频领域的读者,可以把任务想象成合唱评分的例子,这只是教学例子而非论文实验。

例子中歌词文本、演唱声音和舞台表情本应一起打分,但现场可能丢了一路话筒信号,同时剩下的话筒还有电流噪声。此时不能只补齐波形,也不能只降噪,必须先让每路信号变干净,再用干净的剩余信号去推测缺失的那一路。论文的全部设计都围绕这个顺序展开。

已有路线如何分别处理缺失与噪声?

第一条路线假设模态齐全,专注设计更强的融合网络。论文提到的代表包括把每模态拆成共享与特有表示的 MISA 和 FactorCL,用跨模态注意力对齐模态对的 MULT 和 AcFormer。还有用混合专家提取细粒度局部信息的 GLoMo,以及引入讽刺线索或外部无标注视频知识的方法。

这类方法在 3 模态齐全时效果好,但当一个或多个模态缺失时性能明显下降。因为融合层收到了空输入或零向量,原来学到的跨模态对齐关系无法直接套用。

第二条路线专门处理不完整多模态学习,多用外部知识或生成模型做重构。例如 MMIN 先在完整数据预训练再迁移到缺失场景,MPLMM 把跨模态信息蒸馏到可学习提示词中。IMDer 为每个模态训练扩散模型并在推理时重构缺失模态,DiCMoR 按类别训练流模型恢复缺失模态,MoMKE 训练多个模态专家再融合成联合表示。

论文指出这类方法的共同假设是采集到的数据本身是干净的,没有考虑固有噪声和重构引入的误差。第三条路线专门处理噪声,多用信息瓶颈思想压缩掉任务无关信息。论文引用了多模态信息瓶颈和接纳单模态不确定性做鲁棒融合的工作。

TMDC 与它们的区别在于不把去噪与补全孤立处理,而是明确安排先去噪后补全的两个训练阶段。并在两个阶段都保留特有与共享两条表示通路,这是理解后续方法全景的关键。

为什么缺失加噪声会让现有模型同时失效?

论文把现实条件形式化为两件事同时发生。缺失用符号表示为把缺失模态的表示置为零向量,训练时随机置零以模拟真实缺失。评测时按固定缺失组合进行,例如只剩音频、只剩文本加视频等 7 种组合。

噪声则不做显式标注,直接承认每个模态表示中本来就含有噪声。在加噪分析中进一步向训练、验证和测试的已有表示中加入不同强度的高斯噪声。这种定义使实验条件覆盖了干净缺失与带噪缺失两种情况。

在这种定义下,误差有两条放大路径。一是观测噪声会污染可见模态的表示,二是缺失补偿若基于带噪表示去合成缺失模态,会把第一步的误差再传播 1 次。论文用一张对比示意来说明动机,下面先引导阅读该图,图中像素可见具体的文本、视频帧和音频波形底色变化。

看图路径: 1. 先对比上下两行输入框的底色与边框,确认上行仅缺失、下行缺失加噪声的标注差异;2. 再看右侧预测框从 Positive 加绿勾变为 Negative 加红叉的翻转;3. 最后回到左侧文本视频音频三行的具体内容,确认同一句话在不同干扰下结果不同

原论文 Figure 1:The existing model yields correct predictions when the input contains only missing modalities…

论文图 1。原论文 Figure 1:“The existing model yields correct predictions when the input contains only missing modalities (highlighted in green), but fails when both missing (green) and noisy modal- ities…”。

该图上半部分显示当输入仅含缺失模态时模型仍能给出 Positive 正确预测并配绿色对勾,下半部分显示当缺失与用红色底标记的噪声模态同时出现时,同一句文本输入被判为 Negative 并配红色叉号。图中视频帧与音频波形的底色从浅绿变为深红,直观对应了干净可见与受扰可见的区别。

这个例子支持论文的一个判断:只解决缺失的模型在叠加噪声时会失效,因此需要把去噪放在补全之前。后续的 2 阶段设计正是为了切断上述两条误差放大路径。

缺失模态 × 噪声模态: 缺失模态指因隐私或采集不全导致整个音频或视频或文本通道不可用并在训练中被置为零向量,噪声模态指传感器或特征提取引入的与情感无关的扰动且论文不做显式标注,二者搭配讨论的理由是现有补全方法多假设输入干净而去噪方法多假设模态齐全,组合意义是真实部署中两者叠加会使误差在训练和推理中复合,TMDC 因此把去噪放在补全之前。

TMDC 的两阶段全景如何走通一个样本?

TMDC 的全景分为模内去噪阶段和模间补全阶段。先沿一个样本走完全程。假设一条样本本来有文本、视频和音频 3 路完整表示,第一阶段用 1 维时序卷积把 3 路统一到相同的维度与序列长度。

然后分别送入特有去噪分支和共享去噪分支,得到去噪后的特有表示与共享表示,并各自经过注意力交互与分类监督。第二阶段假设音频缺失,输入变为缺失音频加可见文本与视频,模型复用第一阶段学到的注意力参数。

对文本和视频分别做单模态增强与跨模态补偿,再把补偿表示与提纯后的可见表示拼接后送入全连接层得到最终情感预测。下面先引导阅读总体框架图,该图用像素展示了左右两大阶段与上下两套去噪分支的连接方式。

看图路径: 1. 先沿左侧橙色粗箭头看从完整输入到丢弃缺失模态再到两阶段分支的主路径;2. 再对比右上独立分支与共享分支的方块颜色与箭头颜色,确认参数独立与共享的区别;3. 最后看右下补全阶段三路汇入全连接层的汇聚方式

原论文 Figure 2:Illustration of the proposed TMDC. TMDC includes two training stages.

论文图 2。原论文 Figure 2:“Illustration of the proposed TMDC. TMDC includes two training stages.”。

从像素看,左侧上方为带红色噪声底的完整 3 模态输入,经橙色箭头进入右上包含独立变分瓶颈与独立注意力的特有去噪区。以及包含共享变分瓶颈与共享注意力的公共去噪区,分别输出各自的预测与损失流。

左侧下方经丢弃缺失模态操作变为绿色缺失标记与红色噪声并存的输入,经橙色箭头进入右下浅绿底的补全区。可见模态的瓶颈输出与共享瓶颈输出交叉进入注意力块再汇入最终全连接层。该图说明了论文强调的顺序:先在完整数据上学干净表示,再在缺失数据上学如何借用。

这种 2 阶段划分的学习依赖是:没有第一阶段的干净特有与共享表示,第二阶段的借用就没有可靠来源。没有第二阶段的显式补全,第一阶段的干净表示在缺失时无法直接拼接使用。

两个去噪分支各算什么,如何实现?

模态特有去噪分支的目标是过滤本模态噪声同时保留本模态独特性。实现上每个模态有结构相同但参数独立的网络。先用变分信息瓶颈把带噪输入映射为均值与方差,再用重参数化采样得到去噪表示并给出瓶颈层的预测。

然后把去噪表示送入本模态独立的多头注意力与残差全连接层做序列内交互,最后再用全连接层给出交互后表示的预测。每个模态的卷积、瓶颈、注意力与分类器都不跨模态共享,这是与共享分支的关键区别。

模态共享去噪分支的目标是提取跨模态一致的情感公共部分并抑制共性噪声。结构与特有分支相似,但卷积、瓶颈与注意力层的参数在 3 模态之间共享。对每个模态同样先得到去噪的共享隐变量,再做注意力交互并分别给出瓶颈层与交互层的预测。

共享参数使模型被迫抽取 3 模态都能解释的成分,这部分在缺失时最容易被其他模态迁移。

模态特有去噪 × 模态共享去噪: 模态特有去噪负责保留每个模态独有的判别线索并用独立网络过滤本模态噪声,模态共享去噪负责用跨模态共享参数提取 3 模态共同的情感线索并抑制共性噪声,二者搭配的理由是缺失时特有信息无法从他模态推断而共享信息可以迁移,组合意义是第一阶段同时得到可迁移的公共底座和不可替代的私有细节,供第二阶段分别用于增强可见模态和推断缺失模态。

变分信息瓶颈在这里的原始目标是最大化压缩表示与标签的互信息同时最小化压缩表示与原始输入的互信息,系数贝塔控制压缩强度。论文把前者用任务损失实现,把后者用高斯先验下的 KL 散度近似。符号含义是:原始表示为带噪输入,均值方差由全连接层预测,采样噪声服从标准正态,去噪表示用于线性预测。

先解释符号再看计算目标,有助于理解为什么瓶颈损失下降慢可能意味着噪声大。

\[Lm = I(Xm\]

上式是信息瓶颈的互信息形式,下式是论文实际优化的近似形式,包含任务预测项与 KL 约束项。实现上均值方差预测、重参数采样与线性预测共同构成一条可微路径,使去噪表示既能预测情感又不照抄带噪输入。

\[Lm = LT ASK(ym, y) + βKL(p(em s , em ∈Xm, p(em s ∈Xm\]

变分信息瓶颈 × 多头注意力: 变分信息瓶颈负责把带噪输入压缩为保留任务相关信息的高斯隐变量并用 KL 项约束冗余,多头注意力负责在压缩后的表示之间做序列内或跨模态交互以恢复上下文依赖,二者搭配的理由是只压缩会丢失结构关联而只交互会放大噪声,组合意义是先过滤后交互,使后续分类器基于更干净且上下文充分的表示做预测。

补全侧的计算复用上述两类表示。对每个可见模态,把特有表示作为查询、共享表示作为键值做注意力融合得到单模态增强表示。再交换查询与键值的模态来源得到跨模态补偿特征,例如用文本共享表示查视频特有表示得到文本到视频的补偿,反之亦然。

把 2 个方向的补偿相加得到补偿表示,最后拼接补偿表示与各可见模态的增强表示做预测。当仅剩一个模态时,论文用该模态内部的共享与特有表示做自注意力得到近似表示,并重复拼接以保持输入宽度一致。

两阶段各优化什么损失,参数如何组织?

第一阶段在完整数据集上训练,损失包括两部分。一是每个模态在特有与共享两条通路上各自的变分瓶颈损失,含任务项与 KL 项。二是对注意力交互后表示的任务损失,分别记为特有交互损失与共享交互损失。

回归任务用均方误差,分类任务用交叉熵。总损失是对 3 模态与两类表示求和,目的是同时学会干净的私有细节与干净的公共底座。第二阶段在模拟缺失的数据上训练,缺失模态的表示被置为零向量。

训练目标只看最终拼接表示的预测损失,不再对中间瓶颈逐项加权。论文描述中第二阶段利用第一阶段训练好的注意力层做融合,但未明确报告哪些参数冻结、哪些继续更新。也未给出梯度是否截断以及学习率与轮数在 2 阶段之间如何重置,因此复现时应把参数更新范围当作缺项单独记录,而不从模块名称推定为冻结或微调。

下面先引导阅读特有分支的损失曲线,该曲线用像素展示了不同模态损失随轮数的下降差异,横轴覆盖约 90 个训练轮次,纵轴为损失值,图例区分 6 条曲线。

看图路径: 1. 先确认横轴为训练轮数、纵轴为损失值、图例区分音频文本视频的特有与瓶颈损失;2. 再比较文本两条深色曲线与音频粉色曲线的下降速度与最终位置差异;3. 最后观察视频黄色曲线居中的下降轨迹,确认模态间收敛不一致

原论文 Figure 4:Losses in MSD Module

论文图 4。原论文 Figure 4:“Losses in MSD Module”。

从像素看,两条文本深色曲线下降最快且最终最低,音频粉色曲线几乎持平在高位,视频黄色曲线居中缓慢下降。论文正文据此指出损失下降速度与各单模态在 MOSI 上的性能排序一致,文本最好、音频最差、视频居中。

且瓶颈损失略高于交互后损失,可能源于数据固有噪声。这支持优化过程稳定且模态难度不一致的判断,但不能反推每一步都单调改进。

模内去噪阶段 × 模间补全阶段: 模内去噪阶段负责在完整 3 模态数据上训练两套去噪分支并学习稳定的特有与共享表示,模间补全阶段负责在随机置零模拟缺失的条件下复用第一阶段学到的注意力参数来融合可见表示并合成缺失表示,二者搭配的理由是若直接在缺失加噪声数据上训练则重构误差与观测噪声会相互放大,组合意义是把鲁棒表示学习与缺失补偿解耦,先保证表示干净再学习如何借用。

数据、特征、划分与评测条件是什么?

数据集为 3 个基准。MOSI 包含 2199 个视频片段,MOSEI 包含 22856 个片段,两者情感分数范围为负 3 分到正 3 分。论文按先前工作把分数转成二分类标签并报告准确率与 F1。

IEMOCAP 包含 5531 条话语共 5 个会话,论文按常见做法取中性、高兴、悲伤、生气 4 类情绪。用五折交叉验证报告加权准确率与非加权准确率,指标方向均为越高越好。

特征提取沿用先前研究的三件套。文本用预训练 DeBERTa 大模型得到 1024 维表示,音频用预训练 wav2vec 大模型得到 512 维表示。视频先用 MTCNN 做人脸检测再用预训练 MA-Net 得到 1024 维表示。

评测采用固定缺失场景,即训练验证测试全程缺失同一指定模态,共 7 种组合:单模态、双模态与全模态。加噪分析则在两个训练阶段以及验证测试中都向已有模态表示加入不同强度的高斯噪声,以模拟真实采集挑战。

实现条件报告为 PyTorch 在单张 GTX3090 上运行,优化器为 Adam。论文把更多实现细节指向扩展版本,当前可用性依据资源状态判定:代码链接本次返回可用,扩展版本链接本次也返回可用。因此可以写当前已公开可获取,但具体超参数仍需以扩展版本与开源仓库为准,不在此处补写未报告的学习率与批量大小。

主结果在什么条件下比过谁,数字是多少?

要回答的比较问题是:在固定缺失组合下,TMDC 与实际可运行的缺失处理基线相比是否更优。公平条件是所有方法使用相同的 3 数据集特征与相同的 7 种缺失组合,指标方向为准确率与 F1 或加权与非加权准确率越高越好。

基线包括 MCTN、MMIN、GCNet、IMDer、DiCMoR、MPLMM、MoMKE,以及在 IEMOCAP 上的 IF-MMIN 与 MRAN。下表按数据集组织 7 组合平均值,并保留控制变量与代价说明,表中数值为论文报告的平均准确率与 F1 等指标。

缺失评估条件数据集与控制变量指标方向TMDC 报告值解释与代价
7 种缺失组合平均MOSI 固定缺失准确率越高越好77.64超出 0.59 个百分点,需 2 阶段训练
7 种缺失组合平均MOSI 固定缺失F1 越高越好77.35超出 0.89 个百分点,共享表示有冗余
7 种缺失组合平均MOSEI 固定缺失准确率越高越好81.22高出 0.78 个百分点,文本参与组合更稳
7 种缺失组合平均MOSEI 固定缺失F1 越高越好80.76高出 0.78 个百分点,未含推理延迟
7 种缺失组合平均IEMOCAP 五折交叉验证加权准确率越高越好73.77高出 0.42 个百分点,平均掩盖组间方差
7 种缺失组合平均IEMOCAP 五折交叉验证非加权准确率越高越好73.64高出 0.86 个百分点,仅剩音频时不占优

表后解释需要同时说明收益与代价。论文报告 TMDC 在 MOSI 平均准确率 77.64 与 F1 分数 77.35,分别超过次优 MoMKE 0.59 和 0.89 个百分点。在 MOSEI 上达到 81.22 与 80.76,两项均高出 0.78 个百分点。

在 IEMOCAP 上达到加权 73.77 与非加权 73.64,分别高出 0.42 和 0.86 个百分点。主要收益集中在文本参与的组合与双模态组合,未胜出项是 MOSI 仅剩音频的单模态条件,论文明确承认该格不如基线。代价是 2 阶段流程与双分支参数带来的训练与维护成本,且平均值掩盖了各组合的方差,总体趋势不等于每组都最优。

拿掉哪一部分会怎样,噪声下表现如何?

要回答的第二个问题是:2 阶段与 2 分支是否都必要,以及在可控噪声下优势是否保持。公平条件是消融与加噪都按 7 种缺失场景取平均,噪声强度在训练验证测试全程一致施加。消融的 4 个变体为去掉模内去噪阶段、去掉模间补全直接拼接、去掉共享去噪分支、去掉特有去噪分支。

下表把消融条件、噪声强度、数据集、对照值与解释放在同一行,避免只列方法与数值两列,表中平均值均为 7 条件平均,噪声为加在特征表示上的高斯噪声。

消融与噪声条件数据集与控制变量指标方向对照变体或基线TMDC 报告值解释与代价
去掉模间补全直接拼接MOSI 7 组合平均准确率越高越好74.1777.64补全缺失代价最大,需保留补偿分支
去掉模内去噪预训练MOSEI 7 组合平均准确率越高越好79.7681.222 阶段均必要,单阶段误差放大
去掉模间补全直接拼接IEMOCAP 7 组合平均加权准确率越高越好66.0573.77缺失无补偿跌幅显著,拼接无法衔接
去掉模间补全直接拼接IEMOCAP 7 组合平均非加权准确率越高越好65.9473.64同上,特有信息丢失影响更大
高斯噪声强度 103 数据集 7 组合平均准确率越高越好MoMKE 落后约 10 个点TMDC 领先加噪下保持相对鲁棒,非绝对解决
高斯噪声强度 20IEMOCAP 与 MOSEI准确率越高越好31.1 与 59.4 左右37.1 与 66.3 左右强噪声下绝对值大跌,仅相对占优

表后解释需结合机制。论文报告去掉补全的变体在 3 数据集上跌幅最大,在 IEMOCAP 上从 73.77 跌至 66.05。说明第一阶段虽见过全模态,但第二阶段若无补偿而直接面对缺失则无法衔接。

去掉特有分支的影响大于去掉共享分支,论文的解释是特有信息更具判别性且无法从他模态推断,而共享信息可被迁移。因此丢失前者代价更大,这属于论文的有限解释而非因果证明。下面先引导阅读表示相似度面板,该面板用像素展示了特有与共享表示在 4 种条件下的余弦相似结构。

看图路径: 1. 先确认横纵轴均为音频文本视频的特有与共享共六种表示的余弦相似度矩阵;2. 再对比对角线为 1 的亮块与非对角块的深浅,判断特有与共享表示的分离程度;3. 最后从左到右比较四种缺失条件下面板整体亮度的变化趋势

原论文 Figure 3:Visualization of cosine similarity of representations on IEMOCAP dataset.

论文图 3。原论文 Figure 3:“Visualization of cosine similarity of representations on IEMOCAP dataset.”。

从像素看,每个面板为 6 乘 6 矩阵,对角线为 1 的浅色块,非对角块颜色更深。论文指出特有表示之间彼此更相似而与共享表示差异更大,且随着可用模态增多相似度整体下降,说明输入越丰富表示越分化。

当仅剩音频时,为缺失文本与视频合成的表示与音频本身并不相同,支持补全模块生成了有区分度的近似而非简单复制。该观察支持表示鲁棒的判断,但相似度低不直接等于分类性能高,仍需结合主结果理解。

加噪结果显示 IEMOCAP 从 73.8 左右跌至 37.1 左右,MOSEI 从 81.2 左右跌至 66.3 左右,说明强噪声下绝对性能大幅下降。TMDC 在各噪声强度下仍高于 MoMKE,尤其在强度为 10 时平均领先约 10 个点,但这不意味着噪声问题已解决,只是相对鲁棒性更好。

单模态增强 × 跨模态补偿: 单模态增强负责把同一可见模态的特有表示作为查询、共享表示作为键值做注意力融合以提纯本模态,跨模态补偿负责交换查询与键值的模态来源以抽取另一可见模态可借用的信息,二者搭配的理由是仅增强本模态无法凭空产生缺失模态的线索而仅做跨模态交换又会弱化本模态主体性,组合意义是最终拼接增强后的可见表示与跨模态合成的补偿表示再做情感预测。

哪些边界没有测,什么结论不能下?

论文明确承认的局限是共享表示存在冗余,未来工作希望减少冗余以提高效率。这意味着双分支在带来迁移能力的同时也增加了参数与计算开销。但原文未报告训练时长、推理延迟、显存占用或输出帧率,因此不能承诺该方法更快或更省,只能说在报告的准确率指标上占优。

未评测的边界包括缺失模式是否为固定缺失而非随机帧级丢失,噪声是否为人工高斯噪声而非真实混响、遮挡或压缩失真。以及特征提取器固定为 DeBERTa 加 wav2vec 加 MA-Net 时结论是否迁移到其他前端。这些边界未测量误判率分布与统计显著性,相关性不等于因果,平均领先不等于每个话语或每种口音都更好。

还有一个易误解点是零向量置零只是模拟缺失的训练技巧,不代表真实缺失的语义就是零。模型学到的是在零输入下如何依赖可见模态的注意力路径,而不应对零向量本身做语义解释。同样,变分瓶颈的 KL 项只能约束表示冗余,不能保证完全去除与情感无关的全部噪声。

复现应先做什么,需要哪些信息条件?

复现的第一步是按论文条件准备 3 数据集的话语级特征,而不是重新训练前端。文本取 DeBERTa 大模型的 1024 维输出,音频取 wav2vec 大模型的 512 维输出,视频经 MTCNN 检出人脸后再取 MA-Net 的 1024 维输出。

并用核大小为 3 的 1 维时序卷积统一到相同的维度与序列长度。划分上 MOSI 与 MOSEI 按原基准的二分类转换,IEMOCAP 按 4 类情绪做五折交叉验证,缺失评测固定为 7 种组合全程缺失。

第二步是按顺序实现 2 个阶段。先在完整数据上训练特有与共享两套瓶颈加注意力分支,监督包括瓶颈预测损失与交互后预测损失,回归用均方误差、分类用交叉熵。再在随机置零模拟缺失的数据上训练补全融合,监督仅为最终拼接表示的预测损失,并复用第一阶段的注意力参数。

需要保留的关键超参数是瓶颈权重贝塔、卷积输出维度与序列长度、注意力头数与全连接宽度。但这些数值在当前证据中未完整给出,必须回到扩展版本与开源仓库核对,不可猜测。

资源状态是唯一依据:代码仓库本次返回可用,扩展版本链接本次也返回可用,因此可以写当前已公开可获取。但代码可用不等于权重可下载或一键可运行,实际部署还需核对依赖版本、GPU 显存与缺失模拟代码是否与论文一致。若复现加噪实验,需确认高斯噪声是加在特征表示上而非原始波形或像素上,且强度参数与论文的 5、10、20 完全对齐。

何时值得尝试,还需补哪项验证?

当部署中确实同时存在模态缺失与输入噪声,且文本或视频至少其一经常可用时,TMDC 的 2 阶段思路值得尝试。它的可借鉴点是先用独立与共享两条瓶颈把表示洗干净,再学如何借用,而不是在带噪表示上直接重构。

对于语音音乐音频方向的学生,这个顺序比具体网络形状更重要:前端越强,瓶颈的压缩强度与融合方式越需要重新调参。还需补的验证有三项。一是报告每次运行的方差与显著性,避免把零点几个百分点的平均领先误读为稳定胜出。

二是补测真实噪声与随机缺失下的表现,以确认人工高斯加固定缺失的结论可以外推。三是补测训练与推理开销,以及减少共享冗余后的性能变化,以回答多出来的分支是否值得。做完这三项,才能把论文报告的优越性转化为可部署的收益判断。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总