英文题目:A Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis

会议身份:conference:aaai:2026:conference-paper-id:40559

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#混合专家模型 #多模态学习 #音视频 #语音情感识别

评分:7.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Dongning Rao:机构信息未能从会议 PDF 纯文本可靠映射
  • Yunbiao Zeng:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhihua Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Jujian Lv:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多模态情感分析以文本、音频、视频为输入,预测情感极性与连续情感分值,难点在于音频与视频常误导极性且短视频情感随时间变化。TEXT先以在EMER-fine上微调的VideoLLaMA 3按音频、视频与评论生成原始解释,再经Qwen 3检查精炼,并以BERT编码字幕与解释、Librosa编码音频、OpenFace编码视频。随后解释对齐块以交叉注意力将解释与音视频表示对齐得到Et、Ea与Ev,再由融合Mamba与时序交叉注意力的时序对齐块经一维卷积与Sigmoid Linear Unit门控融合Ea与Ev得到Eav。最后以文本为路由键的稀疏混合专家建模跨模态交互,并经门控多层感知机回归输出分值,前一步的对齐表示直接作为路由与分类输入。与ALMT、KuDA、DEVA平等融合或渐进融合不同,TEXT把文本解释作为对齐锚点并仅以文本路由专家,突出主导模态并抑制冲突模态干扰。在CH-SIMS基准下,TEXT的MAE为0.353,低于ALMT的0.449。结论适用边界限于MOSI、MOSEI、CH-SIMS与CH-SIMSv2四个短视频语料与给定特征流水线,尚未验证长视频、噪声与跨语言泛化。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/fip-lab/TEXT — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么、要输出什么、为什么音视频会误导?

这篇论文研究的是多模态情感分析。输入是一个短视频的 3 路信号:字幕文本、语音音频、人脸与动作视频。输出有两个层面:一是情感极性,分数大于零为正、等于零为中性、小于零为负;二是情感强度分数,在英文数据上范围是负 3 到正 3,在中文数据上是负 1 到正 1。优化目标按回归处理,基本目标是均方误差。

研究生刚进入语音与音乐音频领域时容易把任务理解为给整段音频打分,但这里的关键是 3 模态不一致时如何决策。论文用一个来自 MOSI 的例子说明矛盾:字幕是期待点赞的正面表达,视频中人物表情平淡、音频语气也不明显,若只看画面或只听语气,模型会判为负。原文报告该样本人工标注为 1.400,而此前方法的估计为 1.080,偏差为 0.320。也就是说,融合不是简单投票,文本往往是主导模态,而音视频需要被对齐与解释后才能参与融合。

以下示例图展示了该样本左右两侧的对比,左侧为原始 3 模态,右侧为带解释的 3 模态,是理解全文动机的起点。

看图路径: 1. 先看左侧三行原始模态的极性标记,确认只有文本为正而视觉与音频为负;2. 再看右侧解释框中对嘴角上扬与竖起大拇指的文字描述;3. 对比下方两处预测分数 2.500 与 1.390 与标注 1.400 的距离;4. 观察音频波形上红色虚线框标出的语气增强片段位置

原论文 Figure 1:An example of MSA from MOSI.

论文图 1。原论文 Figure 1:“An example of MSA from MOSI. On the left side, from top to bottom, are the textual, visual, and audio modalities of the short video.”。

图中左侧从上到下依次为文本、连续人脸帧与语音波形,文本标为正且带对勾,视觉与音频标为负且带叉号,下方给出该基线分数为 2.500。右侧对应位置增加了灰色字幕总结框、黄色视觉解释框与蓝色音频解释框,视觉框中写明嘴角轻微上扬与竖起大拇指表示赞同,音频框中写明语气积极热情,波形与人脸关键帧上用红色虚线标出证据位置。下方给出 TEXT 分数为 1.390,更接近标注 1.400。读图时不要把左右当成两个样本,它是同一视频在无解释与有解释两种条件下的判断变化,后文所有对齐模块都是为复现这种变化而设计。

已有路线如何做表示学习与融合、缺了哪一环?

论文把已有方法分为两类。第一类以表示学习为中心,例如 ALMT 学习抑制视觉与音频中无关与冲突的表示,先用带初始化标记的变换器把各模态转为统一形式;KuDA 主张总存在主导模态,用情感知识增强该模态。第二类以多模态融合为中心,例如 DEVA 做文本引导的渐进融合,并带有一个情绪描述生成器。按同输入同目标对照,这三者都处理文本、音频、视频三输入并预测极性与分数,与 TEXT 可比。

另一条线是时间融合:时间交叉注意力面向短视频情绪,用卷积加交叉注意力做模态间对齐;Mamba 面向长视频,用线性时间的状态空间模型做序列建模。论文指出两者都不是为多模态情感分析的短视频情绪跳变设计。与之相关的还有稀疏混合专家与门融合,前者按需激活专家以省计算,后者按门控加权融合多路特征,但此前在该任务中未得到充分关注。TEXT 的定位是补上对齐这一环:先用解释把音视频语义化,再做时间同步,最后用文本路由做选择性融合。

问题如何形式化、评测沿用哪些口径?

形式化上,记单模态表示为文本、视频、音频 3 路,目标是融合后同时给出极性与分数。分类侧指标包括加权 F1、二分类准确率、三分类、五分类、七分类准确率;回归侧包括平均绝对误差与皮尔逊相关系数。除平均绝对误差越小越好外,其余越高越好。在 MOSI 与 MOSEI 上,二分类与 F1 按两种口径计算:包含零的负对非负,以及排除零的负对正。

在中文 CH-SIMS 与 CH-SIMSv2 上则计算三分类与五分类。教学例子:若把七分类理解为把连续分数切成七档,那么它比二分类更考验细粒度区分能力。论文明确沿用前人指标口径,这是后文比较公平性的前提。需要保留的信息是数据集规模与标注方式:MOSI 含 2199 个主观片段并标注连续观点分数,MOSEI 扩展到 22856 个独白片段覆盖 250 个主题与 1000 个说话人,CH-SIMS 含 2281 个中文视频片段并带模态细粒度标注,CH-SIMSv2 为其更新版。

TEXT 的六个模块如何串成一条流水线?

从整体看,TEXT 自下而上由 6 个功能模块组成。底部是 3 个并行的单模态特征抽取模块:文本编码、音频特征抽取、视频特征抽取,其中音频与视频支路各带一个解释对齐块。中间是时间对齐模块,负责同步对齐后的音频与视频表示。再往上是文本路由稀疏混合专家模块,负责建模跨模态交互。顶部是门融合分类器,负责最终决策。

按一个样本走完全程:字幕与 3 类解释先经预训练编码器得到向量,音频波形经音频工具得到声学特征,视频帧经人脸工具得到视觉特征;音频与视频特征各自与对应解释做交叉注意力对齐;对齐后的音视频再做时间对齐得到联合表示;该联合表示与文本表示一起进入以文本为路由的专家层;最后只取聚合标记经门融合与多层感知机输出分数。 下图为论文给出的总体结构,是后文每个组件的位置参照。

看图路径: 1. 沿底部输入向上追踪文本、音频、视频三条编码支路;2. 确认⑤⑥两个解释对齐块分别汇入中间的时间对齐块;3. 再看②文本路由稀疏专家如何同时接收文本与音视频融合表示;4. 最后看①门融合分类器顶部的表情输出与多层感知机

原论文 Figure 3:The architecture of TEXT. From top to bottom, TEXT comprises six functional modules (1∼6).

论文图 3。原论文 Figure 3:“The architecture of TEXT. From top to bottom, TEXT comprises six functional modules (1∼6).”。

图中底部虚线下方为 4 类输入:字幕文本、音频波形、视频人脸帧与两类解释文本。向上分别经过 BERT、Librosa、OpenFace 与 BERT 编码,其中音频与视频支路进入蓝色与黄色的解释对齐块。绿色横条为时间对齐块,再上为文本路由稀疏专家乘 N 层,顶部蓝色虚线框为门融合与多层感知机,输出笑脸与哭脸符号。颜色分支不是装饰,而是模态身份:灰色为文本,蓝色为音频,黄色为视频,绿色为跨音视频的同步与融合。理解该图后,再看公式才知道每一步算什么。

解释从哪里来、单模态编码如何统一长度?

解释生成分 2 个阶段。第一阶段用 VideoLLaMA 3 生成原始解释,该模型已在 EMER-fine 数据集上微调,提示词把音频解释、视频解释与评论分开生成。第二阶段用 Qwen 3 做检查与精炼,分别对应推理提示与检查提示,得到精炼解释。单模态编码上,字幕与解释用 BERT 编码,音频用 Librosa 编码,视频用 OpenFace 编码。为解决 3 路长度不一致,论文统一取 50 个标记并加一个可学习的聚合标记,最终每路为 51 维嵌入。记音频解释、视频解释与评论的 BERT 编码与其他特征区分,后文对齐时音频特征对音频解释、视频特征对视频解释、字幕对评论,身份不可混淆。

解释 × 交叉注意力对齐: 解释负责把视频画面和语音语气转写为可读的文本描述,交叉注意力对齐负责让原始音视频特征向这些文本描述靠拢,二者搭配的理由是音视频特征维度与文本语义不对齐而难以直接比较,组合后音视频表示被语义锚定,误判的负极性得以纠正。

对齐计算采用交叉注意力形式,特征为值与键的来源,解释为查询的来源,经权重矩阵投影后做缩放点积与归一化。该设计的教学要点是:查询来自文本解释意味着用语义去检索声学与视觉中的对应证据,而不是让音视频自说自话。这为图 1 中音频与视频由负转正提供了机制基础。

时间对齐块比 Mamba 与时间交叉注意力简单在哪里?

时间对齐的输入是已与解释对齐的音频表示与视频表示,输出是二者的拼接联合表示。论文强调该块只含一个 1 维卷积与 2 次线性操作,不含交叉注意力也不含状态空间模型,因此比 Mamba 与时间交叉注意力更简单。直观结构如图 2 所示,左侧时间交叉注意力对视觉与音频各做卷积加交叉注意力再残差相加,右侧 Mamba 为线性层、卷积、激活、状态空间模型与门控乘法的深堆叠。

TEXT 的做法是双分支对称门控:左分支以音频为主干,用视频经归一化与激活后的门控去调制音频经归一化与卷积后的时序特征,再与原始音频相加;右分支交换角色。最后拼接左右分支得到音视频联合表示。 下图为两种对照结构,理解它才能体会 TEXT 为何自称结合并简化了二者。

看图路径: 1. 先看左图时间交叉注意力中 Fv 与 Fa 经卷积与交叉注意力再残差相加的闭环;2. 再看右图 Mamba 中线性层、卷积、激活与状态空间模型的串行堆叠;3. 对照顶部图例确认卷积、线性、加法与交叉注意力的符号含义

原论文 Figure 2:Two temporal alignment block designs: (a) TCA, and (b) Mamba.

论文图 2。原论文 Figure 2:“Two temporal alignment block designs: (a) TCA, and (b) Mamba.”。

左图标注为时间交叉注意力,绿色为视觉支路,蓝色为音频支路,可见 Fv 与 Fa 经卷积进入交叉注意力节点再与原始输入相加得到新表示。右图标注为 Mamba,底部两个线性分支分别走卷积激活状态空间路径与激活门控路径,在乘法节点汇合后再经线性层输出。顶部图例明确了卷积、线性、逐元素加法、交叉注意力与激活符号。TEXT 的时间块正是去掉交叉注意力节点与状态空间模块,只保留卷积加激活门控与残差加法,因此参数路径更短。 具体计算分左右两路,符号含义需先交代:圆圈加号为逐元素相加,圆圈乘为逐元素相乘,c 为拼接,L 为线性层,N 为归一化,LN 为先归一化后线性,激活为 S 型线性单元。

\[left = Ea ⊕L(Conv1d(LN(Ea)) ⊗σ (LN(Ev))) (2)\]

上式为左分支:音频表示为主干,视频表示经归一化与激活后作为门控,音频经归一化与 1 维卷积后被门控调制,再经线性映射后与原始音频相加。该式的目标是让视频的情绪时序去选择音频中对应的时间证据。

\[right = Ev ⊕L(Conv1d(LN(Ev)) ⊗σ (LN(Ea))) (3) Eav = c (left\]

上式为右分支,与左分支对称,视频为主干而音频为门控。两路拼接后即为时间对齐结果。原文未给出归一化类型与卷积核等超参数细节,这是复现时需要补查的缺项,不应从名称推定实现。

文本路由稀疏专家与门融合分类器如何分工?

稀疏混合专家的路由键为文本表示,输入为文本与音视频联合表示。结构上先将两路拼接,再经多头注意力与加和归一化,随后路由函数根据文本决定激活哪些专家分支,各专家为线性映射,最后加权输出。论文称其关键词敏感:特定主题的文本会触发对应专家,从而促进跨模态一致性。分类器为带门融合的多层感知机,只取各路的聚合标记做最终决策,形式为先经稀疏专家,再经门控激活,最后经线性层输出。

时间对齐 × Mamba: 时间对齐负责同步音频与视频在短视频时间轴上的情绪变化,Mamba 负责以状态空间模型做长序列建模,二者搭配的原因是 Mamba 为长视频设计而多模态情感分析多为情绪跳变的短视频,TEXT 保留卷积加门控的时序思想但去掉状态空间与交叉注意力,形成更简单的双分支门控融合。

文本路由 × 稀疏混合专家: 文本路由负责根据文本表示决定激活哪些专家,稀疏混合专家负责只计算被选中的少量专家分支以建模跨模态交互,二者搭配的理由是文本在情感判断中最可靠,组合后关键词敏感的专家被文本触发,既省计算又保持跨模态一致性。

门融合 × 多层感知机分类器: 门融合负责学习 3 个模态聚合标记的加权组合,多层感知机分类器负责把融合向量映射为极性与情感分数,二者搭配的原因是不同样本依赖的模态权重不同,组合后模型先做自适应加权再做回归分类,支持二分类与分数回归两种目标。

3 组桥接放在此节是因为它们共享同一数据流:时间同步解决何时对齐,文本路由解决听谁指挥,门融合解决各听多少。若把时间对齐比作把两条音轨对准节拍,文本路由就是指定挥者只让相关乐手演奏,门融合则是调音台决定每路音量。比喻之后仍要回到真实信号:节拍对应帧级情绪变化,指挥对应文本语义,音量对应门控权重。

解释如何构造、模型如何训练与推理?

该节需区分构造流程与模型训练。构造侧,解释不是人工标注,而是模型生成加模型检查的两步产物。先在情感理解数据上微调视频大模型,再在目标数据集上生成分模态原始解释,最后用另一大模型按检查提示精炼。原文未报告微调的学习率、轮数与冻结策略,也未说明生成温度与过滤规则,这是复现解释质量时的重要缺项。

训练侧,论文只说明基本优化目标为均方误差回归损失,未报告优化器、批量、学习率、早停与划分细节,也未说明 BERT、Librosa、OpenFace 参数是否冻结,以及梯度是否回传到编码器。因此不能从模型名称推定端到端微调,只能说对齐、时间、专家与分类部分按回归目标学习。推理时,对每个测试视频先离线生成解释并编码,再走对齐与融合得到分数。超参数讨论中仅报告稀疏专家层数在 CH-SIMS 上 3 层最优,其余超参数未展开。 下图为解释生成流程,展示了数据与模型之间的依赖。

看图路径: 1. 沿箭头看从原始模型经微调到微调后模型的演进;2. 确认目标数据集驱动微调而推理提示驱动原始解释生成;3. 再看检查提示如何经另一大模型把原始解释变为精炼解释

原论文 Figure 4:The procedure of explanation generation.

论文图 4。原论文 Figure 4:“The procedure of explanation generation.”。

图中从左到右为原始视频大模型经微调得到微调后模型,下方椭圆分别为情感数据集与目标数据集,上方箭头标注微调与推理提示。右侧原始解释经检查提示进入另一大模型得到精炼解释,下方图例区分数据集、大模型与文本。复现时应先复现该链路再训练融合部分,否则无法分离解释增益与融合增益。

在哪些数据与基线上测、指标方向是什么?

评测覆盖 4 个数据集:MOSI、MOSEI、CH-SIMS、CH-SIMSv2,中英文各两套,兼顾主观独白与中文细粒度标注。对比如三加三结构:3 个近期模型为 ALMT、KuDA、DEVA,3 个多模态大模型为 Qwen2.5-VL、GPT-4o、VideoLLaMA3-7B。指标方向已在问题节交代:分类准确率与 F1 及相关系数越高越好,平均绝对误差越小越好。论文声明所有结果经 T 检验显著,阈值为小于 0.05。需要提醒的是,大模型基线可能存在数据记忆问题,论文在讨论中承认 GPT-4o 在中文数据集上优势减弱,并提示部分数据集可能被大模型记忆过,因此跨语言比较时需谨慎。

硬件与耗时、划分与聚合口径在证据中未报告,不能把总体趋势推广到每组都成立。代码方面,资源状态显示当前可用,地址为官方仓库,可作为复现起点,但权重与解释文件是否包含需以仓库实际内容为准。

主结果测了什么、赢在哪里、哪里没赢?

要回答的核心问题是:在相同指标口径下,TEXT 是否同时降低分数误差并保持分类准确。公平条件是沿用前人二分类双口径与多分类档位,比较对象包括可运行的近期模型与 3 个大模型。指标方向为误差越小越好、准确率与相关越高越好。下表整理论文用完整原句报告的关键数字,保留原始精度与百分比写法,不做四舍五入。

条件指标基线本方法比较对象
CH-SIMS平均绝对误差0.449,0.408,0.4240.353ALMT,KuDA,DEVA
MOSI二分类准确率86.74%88.72%GPT-4o
MOSIF1 分数86.68%88.76%GPT-4o
CH-SIMS五分类准确率43.54%50.15%KuDA
CH-SIMSF1 分数80.71%86.75%KuDA

表前已提出比较问题与公平条件,此表用于核对主收益是否同时覆盖回归与分类。 表中第一行显示 TEXT 在 CH-SIMS 上把平均绝对误差降至 0.353,相对近期模型下降 13.5%,这是摘要强调的最强回归证据。第二至三行显示在 MOSI 上二分类与 F1 均超过 GPT-4o 约 2 个百分点,说明在英文数据上未被大模型压制。第四至五行显示在中文数据上五分类与 F1 领先 KuDA 约 6 个百分点,表明解释对细粒度中文情绪也有帮助。

代价与反例必须同时说明:论文承认 KuDA 在 MOSI 与 MOSEI 的七分类上最优,并在 CH-SIMSv2 的五分类上保持优势;DEVA 在 MOSEI 的五分类上占优。论文推测细粒度打分需要额外的情感甚至领域知识,这属于有限解释而非已验证因果。

平均绝对误差 × 皮尔逊相关系数: 平均绝对误差负责度量预测分数与人工标注分数的平均偏离,越小越好,皮尔逊相关系数负责度量预测序列与标注序列的线性一致趋势,越大越好,二者搭配的原因是只看误差会忽略趋势,只看相关会忽略偏置,组合后才能同时判断分数准不准与走势对不对。

该桥接放在结果节是因为只有同时看误差与相关,才能避免被单一指标误导,例如误差小但趋势错仍不可用。

拿掉解释、时间对齐与专家后发生什么?

消融要回答 3 个操作问题:只用单模态会怎样,去掉解释会怎样,把时间块换成拼接、Mamba 或时间交叉注意力会怎样。论文在 MOSEI 与中文数据上均报告消融,条件包括单模态、双模态组合与组件替换。下表用论文原句中的数字整理关键反证,同样保留原始精度。

条件指标有解释无解释或替换变化含义
MOSEI 七分类准确率52.84%,52.29%未报告单文本超完整模型
MOSEI 回归平均绝对误差未报告0.580时间换拼接后变差
多数指标准确率未报告下降约 2%去解释或换时间块
单样本偏差0.010,0.3801.440,1.100解释补偿音频

表前的问题是各组件是否必要,公平条件是同一数据集与同一指标口径,指标方向同主结果。 表后解释需逐项对应。第一,文本为单模态中最强,用带解释的文本在 MOSEI 七分类上达 52.84%,反而高于完整 TEXT 的 52.29%,支持文本主导判断,但不能推出其他样本都如此。

第二,音频与视频与文本结合时提升相近,说明二者提供互补但价值相当的线索,如韵律与视觉信号。第三,去掉解释导致多数指标下降约 2%,支持解释在整合中的作用。第四,把时间块换成拼接时平均绝对误差为 0.580,换成 Mamba 或时间交叉注意力也下降约 2%,支持时间对齐对回归最关键。单样本层面,带解释的音频偏差为 0.380,去掉解释升至 1.440,而 TEXT 完整偏差仅 0.010,进一步说明解释补偿了音频短板。

论文还称稀疏专家的价值与解释相当,源于关键词触发机制,但该机制未做专家激活统计,属于待验证推测。

个案分数如何随模态与组件变化?

为复述方法,沿图 1 样本走完输入到输出。人工标注为 1.400。完整 TEXT 输出 1.390,偏差 0.010。Qwen2.5-VL 输出 2.500,偏差 1.100。ALMT 输出 1.080,偏差 0.320。

单模态层面,文本输出 1.060 偏差 0.340,音频 1.780 偏差 0.380,视频 0.870 偏差 0.530,均能判对正负但分数有偏。双模态层面,文本加音频为 1.350 偏差 0.050,文本加视频为 1.330 偏差 0.070,音频加视频为 1.510 偏差 0.110,说明有文本参与即大幅接近标注。去掉解释后,文本仍为 1.010 偏差 0.390,但音频变为负 0.040 偏差 1.440,视频变为负 0.380 偏差 1.780,音频视频双模态仅 0.070 偏差 1.330, polarity 会翻转。组件替换层面,去掉解释整体为 0.550 偏差 0.850,解释对齐换线性为 1.270 偏差 0.130,时间换拼接为 1.420 偏差 0.200,换 Mamba 为 1.220 偏差 0.180,换时间交叉注意力为 1.080 偏差 0.320,专家换变换器为 1.320 偏差 0.080,去门控为 1.350 偏差 0.050。

在该个案中门控与专家影响仅 0.050,不宜推广为全局不重要。

条件指标基线分数本方法分数偏差含义
同一样本情感分数2.500,1.080,0.8001.390标注 1.400,偏差 0.010 最小
单模态有解释情感分数1.060,1.780,0.8701.390音视频被解释纠正
单模态无解释情感分数1.010,-0.040,-0.3801.390音视频翻转为负
组件替换情感分数0.550,1.270,1.4201.390时间替换偏差最大

表前问题是个案是否支持全局结论,条件是同一 MOSI 样本与同一标注,指标为分数偏差越小越好。 表后结论是该个案支持三点:TEXT 最贴近人工判断,文本为信息主通道,解释对音频补偿最大。

但个案不能证明方法在所有样本有效,主表的统计显著性才是全局证据,个案仅用于机制教学。

哪些结论尚未验证、哪些边界没有测?

论文直接报告的是 4 数据集六指标上的最优覆盖与显著性,支持 TEXT 整体有效。有限解释包括细粒度分类需额外情感知识、稀疏专家靠关键词触发、时间对齐关键在音视频时序匹配,这些均未做因果干预实验,应表述为可能而非证实。未验证的推测包括大模型记忆污染程度、中文增益是否来自翻译质量、专家是否真正分工到主题。未评测的边界包括中英文之外的多语言、长视频、噪声与缺失模态、推理延迟与显存开销、误判率的人工评估。

原文明确的未来工作是消除多模型累积误差,例如来自 VideoLLaMA 的误差。复现时不应承诺延迟或成本改善,因为原文未测量这些量。相关性不等于因果,去掉某模块下降 2% 只能说明该配置下相关,不能推出该模块在任何数据必然如此。

复现先做什么、需要保留哪些信息条件?

若要复述与复现,建议按学习依赖顺序执行。第一步准备数据与口径:下载 MOSI、MOSEI、CH-SIMS、CH-SIMSv2 并确认二分类双口径与多分类档位,避免把包含零与排除零的口径混用。第二步复现解释链路:用微调后的 VideoLLaMA 3 按分模态提示生成原始解释,再用 Qwen 类模型按检查提示精炼,保存音频解释、视频解释与评论三份文本。第三步统一编码:文本与解释用 BERT,音频用 Librosa,视频用 OpenFace,截断或补齐到 50 标记加 1 聚合标记。

第四步实现对齐:先做解释交叉注意力得到文本、音频、视频 3 路对齐表示,再实现双分支门控时间块得到拼接表示,注意左右分支的门控方向不可写反。第五步实现文本路由专家与门融合分类器,训练目标为均方误差,专家层数可先试 3 层。第六步按原文基线复测 ALMT、KuDA、DEVA 与 3 个大模型,核对平均绝对误差、准确率、F1 与相关系数。

代码当前可用是正文开源声明的唯一依据,本次资源状态为可用,可从官方仓库获取,但需核对仓库是否包含解释文件、权重与划分脚本,缺项应明确记录而不猜测。

何时值得尝试 TEXT、何时不必照搬?

当你的任务也是短视频情感分析,且观察到文本准而音视频经常带偏时,TEXT 值得尝试:先用大模型把音视频转写为可检索的文本证据,再用轻量门控做时间同步,最后让文本决定专家激活,这种安排与文本主导的先验一致。当细粒度七分类是核心目标且有领域情感词典时,不必照搬全文,可优先补情感知识或在 KuDA 方向上改进,因为 TEXT 在该档位并未全胜。

当部署受限或无法调用大模型生成解释时,也不宜直接照搬,因为解释缺失会导致约 2% 的下降与个案极性翻转,此时应先评估离线生成成本与累积误差。记住可核对的锚点:CH-SIMS 平均绝对误差 0.353、MOSI 二分类 88.72% 与 F1 88.76%、时间换拼接后误差 0.580、单样本偏差 0.010,这些数字的成立条件是原文的数据划分、指标口径与解释质量,换条件需重测。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总