英文题目:PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis

会议身份:conference:aaai:2026:conference-paper-id:37202

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#对比学习 #多模态学习 #音视频 #语音情感识别

评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Heng Xie:机构信息未能从会议 PDF 纯文本可靠映射
  • Kang Zhu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhengqi Wen:机构信息未能从会议 PDF 纯文本可靠映射
  • Jianhua Tao:机构信息未能从会议 PDF 纯文本可靠映射
  • Xuefei Liu:机构信息未能从会议 PDF 纯文本可靠映射
  • Ruibo Fu:机构信息未能从会议 PDF 纯文本可靠映射
  • Changsheng Li:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

多模态情感分析以文本、视觉与音频为输入,输出连续情感强度与离散情感类别,难点在于不同人格表达差异大且三模态异构鸿沟深。该方法先用微调情感编码器与人格预训练编码器分别提取文本情感与人格嵌入,再经对比学习与个性化约束映射为个性化情感表示。随后以文本深层编码器为多模态预融合器拼接三模态做初步对齐,输出再作为查询向量经跨模态注意力重构视觉与音频特征。最后经串行线性融合与并行卷积融合协同得到最终预测,兼顾全局一致与局部互补。与仅做模态解耦或优先级融合的已有方法不同,其把人格显式引入文本端并逐级传递至视听端,从而实现个性化情感理解。在CMU-MOSI评测任务下,PSA-MF的MAE为0.686,低于ULMD的0.700。该结论适用边界受限于英语YouTube评论类语料与Facet加COVAREP预提取特征,尚未验证跨语言跨场景与端到端原始信号外推,硬件为NVIDIA RTX 3090 GPU上训练,推理开销在证据中未报告。

🔗 开源与复现资源

🧭 深度解读

输入是什么?目标是什么?这篇解读要保留什么?

本文解读的对象是会议论文 PSA-MF,任务是多模态情感分析。输入是同一视频片段的 3 路信号:文本转录、面部动作相关的视觉特征、语音声学特征。目标是对该片段输出情感得分,范围在负 3 到正 3 之间,既可做回归也可按阈值做二分类和七分类。初学者容易误以为把 3 路特征拼接后分类就够了,但原文指出两个真实障碍:第一,不同个性的人用词和表情强度不同,同一句话的情感含义会漂移。

第二,文本表示的信息密度远高于预提取的视听特征,直接同层融合难以协调语义深度。本文的输出是一套可复述的方法流程、训练监督来源、实验条件与可核对的结果边界。解读中所有数字只采用原文报告的写法,不做四舍五入或单位补写。教学用的举例会明确标为例子,不作为论文证据。后续先讲相关路线,再沿一个样本走完输入到输出,然后展开训练、实验与反证,最后给出复现清单。

已有路线做了什么?为什么还剩个性与层级问题?

从输入、目标和监督看,已有工作可分为两类。第一类是解耦融合,例如用多个编码器解码器把特征映射到同质与异质空间,再对异质特征加约束,最后只用同质特征分类。这类方法需要设计多个损失,模型相对复杂。第二类是直接融合,更关注融合框架本身,例如用掩码多模态注意力融合词级对齐后的文本与音频,或用交叉模态注意力与特定模态编码改进交互。原文还回顾了更广的多模态范式演变:早期视觉编码器重、交互简单。

后来文本与视觉编码器同等规模并用对比学习对齐;再后来用变换器块替代拼接点积做交互,或把文本编码器深层复用为多模态编码器。在情感与个性关系上,原文引用了从游戏心理模块、大 5 人格视频数据集到多任务联合分析的工作,说明个性影响情感产生与感知。已有路线的缺口是:在特征提取阶段只做浅层编码,没有把个性差异带入情感表示;在融合阶段直接合并各模态,没有考虑特征层级差异。

于是文本与视听之间的语义鸿沟仍在,复杂情感状态难以被充分理解。这正是 PSA-MF 要补的位置:在提取阶段引入个性,在融合阶段做渐进式多级交互。

问题如何形式化?评测按什么口径判断好坏?

设一个样本包含文本输入、视觉输入和音频输入,以及一个人工标注的情感真值。模型需要输出预测值,越接近真值越好。回归口径用平均绝对误差和皮尔逊相关系数,误差越小越好,相关越大越好。分类口径用二分类准确率、七分类准确率和 F1 分数,越大越好。原文在两个公开数据集上评测:MOSI 包含 93 个视频切成的 2199 个片段,MOSEI 包含 1000 个说话人、250 个主题下的 23453 个片段。

2 个数据集的情感分数都在负 3 到正 3 之间。举例来说,如果某片段文本是礼貌性抱怨但语气平淡,单看文本可能判为轻微负向,结合视觉与音频才能稳定判断,这就是例子,不是论文原句。问题的难点在于个性标注缺失:情感数据集只有情感标签,没有个性标签,模型不能靠个性监督直接学习个性分类,只能把外部个性先验迁移进来并约束在情感空间内。

另一个难点是模态异构:文本来自预训练语言模型的高密度表示,视听来自预提取特征加时序编码,分布与深度不一致。因此评测不仅看总体指标,还要看去掉个性、去掉预融合、去掉增强融合后指标如何变化,以及对齐放在不同层时曲线的走向。

PSA-MF 的全景分几步?一个样本如何走完?

PSA-MF 的全景可分为 4 步。第一步是单模态提取:文本同时走情感编码器与个性编码器,音频与视觉各自走特征提取加长短期记忆网络得到时序表示。第二步是个性情感对齐:把情感与个性映射到公共低维空间,做对比学习并加个性化情感约束,得到个性化情感嵌入。第三步是多模态预融合:先做文本与视听的跨模态对比,再把 3 路特征拼接送入微调 BERT 的后段层做初步融合。

第 4 步是跨模态交互与增强融合:以预融合特征为查询引导视听重建,再经串行与并行双路融合后送入子网预测。沿一个样本走就是:输入一句话文本、一声音频和一段人脸视频,先得到文本的情感向量与个性向量以及视听时序向量,然后对齐个性与情感,再把 3 路初步混在一起,接着用混好的表示回头挑选视听细节,最后从全局与局部两个角度汇总并输出情感分。下面的模型总览图把这条主路径与 3 个子模块对应起来,阅读时先看主干再看分支。

本段为图 1 的导读,图中左下为输入与编码、中下为对齐与预融合细节、左上为跨模态交互、右上为增强融合,箭头表示从输入到预测的前向路径,拼接符号表示特征合并,阅读顺序建议按输入到输出追踪后再对比左右支路。

看图路径: 1. 先从底部文本、音频波形、视频帧三路输入向上追踪到中间编码层;2. 再看中间粉色块如何分成个性编码器与情感编码器并向上汇入预融合;3. 然后观察左右两路跨模态注意力中查询与键值的箭头来源;4. 最后看右上增强融合中拼接符号与卷积支路如何汇入预测

原论文 Figure 1:The proposed personality-sentiment aligned multi-level fusion model (PSA-MF): In the top left…

论文图 1。原论文 Figure 1:“The proposed personality-sentiment aligned multi-level fusion model (PSA-MF): In the top left corner of the dia- gram is the main framework of the model, which includes feature…”。

图 1 显示的像素内容支持上述走向:底部可见音频波形、文本示例与视频帧分别进入音频提取器、个性与情感编码器、视觉提取器;中间粉色块标注个性情感对齐与多模态预融合;上部两路跨模态注意力分别以预融合特征为查询与左右视听键值交互;右上增强融合同时出现拼接与卷积两条通路并向上输出预测。子图 a 对应对比矩阵与约束损失,子图标出冻结与可训练、拼接后经对比损失再进入多模态编码器,子图 c 对应串行拼接投影与并行卷积压缩的汇合。这些可见元素共同说明模型不是 1 次拼接,而是先对齐个性、再预融合、再引导重建、最后双路汇总。

个性与情感如何从同一句话中分开又对齐?

文本分支用两个预训练模型分别提取情感嵌入与个性嵌入。白话说,情感嵌入回答这句话有多正多负,个性嵌入回答说话人可能具有的表达风格先验。英文名分别为 sentiment embedding 与 personality embedding。实现上取各自 BERT 的特殊分类标记输出,再经线性映射降到公共空间。对比学习的目标是让同一条样本的情感映射与个性映射更接近,不同样本之间更远离,并乘以余弦相似度构成复合对比损失。个性化情感约束则用真实情感标签监督情感映射经线性变换后的预测,权重为一减去情感与个性的相似度,目的是在融合个性时不偏离情感真值。

个性特征 × 情感特征: 个性特征负责刻画不同说话人表达情感的偏好差异,由冻结的个性预训练模型提取;情感特征负责刻画当前语句的极性与强度,由可微调的情感 BERT 提取;二者搭配的理由是同一句话在不同个性下情感含义不同,组合机制是通过对比学习把二者拉到同一语义空间再用个性化情感约束保持分类正确,从而得到个性化情感嵌入。

符号与计算目标需要先说清:映射后的情感与个性向量是输入,对比损失的温度系数控制分布平滑程度,约束损失中的线性矩阵把情感映射投到标签空间并用一范数计误差。原文明确的实现是先做映射再做对齐,对齐总损失为两项相加。初学者要注意,个性编码器来自外部个性预训练模型,情感编码器是微调 BERT 的前若干层,二者参数更新策略不同,细节在训练节交代。下面的公式是该模块的总损失组合,只表示两项相加,不引入额外权重。

\[LAlign = Lccl + Lps\]

该公式的教学意义是把匹配目标与正确目标分开:前一项管个性与情感是否在同一语义邻域,后一项管个性化后的表示是否还能预测对情感分。缺少后一项时,模型可能过度迎合个性相似而忽视标签,这是消融节要验证的点。

预融合与跨模态交互如何缩小模态差距?

预融合先做文本与视觉、文本与音频的跨模态对比学习,损失形式与文本内部对比类似,只是把文本特殊标记与视听特征配对。然后把 3 路特征拼接后送入微调 BERT 的后段层做双向编码,得到多模态预融合嵌入。白话说,这一步是让高密度的文本表示先带着低密度的视听表示走一段,初步建立跨模态语义关联,并让个性表示逐步传递。

跨模态交互再以预融合特征经线性变换后的表示为查询,以视听时序特征为键和值做多头注意力,得到融合后的视听表示并再做线性变换得到增强表示。原文的安排理由是:预融合特征指导视听向个性化方向生成,同时减少分布差异带来的偏移,实现个性驱动的模态重建。

多模态预融合 × 跨模态交互: 多模态预融合负责用 BERT 深层把文本、视觉、音频先做 1 次初步对齐,缩小信息密度差异;跨模态交互负责以预融合特征为查询去加权视觉和音频,重建个性化视听特征;二者搭配是因为直接用原始视听特征做注意力会被分布差异带偏,组合后先对齐再引导生成,新增作用是逐步消除异构偏移。

下面的公式对应跨模态交互的查询键值安排,左侧以预融合为查询处理视觉,右侧同样处理音频,输入与输出都是向量序列,不改变最终分类头的输入维度,只是让视听特征更贴合个性化语义。

\[Vt = Attv(Ms, hv, hv) At = Atta(Ms, ha, ha)\]

需要区分的是,预融合阶段的对比损失管模态间初步对齐,交互阶段的注意力管个性化权重分配,二者不是重复。原文还用冻结与可训练区分编码器:个性编码器侧标注冻结,情感编码器与多模态编码器侧标注可训练,图中以雪花与火焰符号区分。这意味着个性先验相对固定,情感与融合部分随任务调整,但原文未给出每层学习率与梯度是否截断的完整说明,缺项在训练节指出。

串行与并行如何从两个角度汇总?

增强融合的输入是上一步得到的 3 个增强表示。串行融合把三者拼接后经可学习权重矩阵投影,并做层归一化与全连接,目标是促进个性化情感在模态间传递并做互补学习。并行融合把三者堆叠后用核大小为 3 的卷积压缩,目标是捕捉局部跨模态空间信息。最后把两路结果再拼接送入带两层非线性激活的全连接子网得到预测值。白话说,串行看全局一致,卷积看局部搭配,二者拼接后再决策。

串行融合 × 并行融合: 串行融合负责把增强后的文本、视觉、音频表示拼接后经线性层与归一化做全局语义统一;并行融合负责把 3 路特征堆叠后用卷积捕捉局部跨模态关联;二者搭配是因为只做全局会抹掉模态特异性、只做局部会缺一致性,组合后拼接送入子网预测,兼顾全局一致与局部互补。

下面的约束与融合公式在原文中是分开给出的,这里只强调分工:对比损失只管拉近推远,约束损失只管标签误差,串并两路只管汇总视角。搭配的原因已在桥接段说明,新增作用是既保留模态互补又维持全局情感一致。

对比学习损失 × 个性化情感约束损失: 对比学习损失负责把同一条样本的情感映射与个性映射拉近、把不同样本推远,实现语义级对齐;个性化情感约束损失负责用真实情感标签监督个性化情感映射,防止只顾对齐个性而偏离情感真值;二者搭配是因为前者管匹配、后者管正确,组合成对齐总损失后共同约束个性化过程。

初学者常见误解是把卷积支路当成时序建模,实际上原文明确它是作用于堆叠后的融合特征做压缩,时序建模已由前面的长短期记忆网络完成。另一个误解是把串行拼接当成早期融合的重复,实际上此时的输入已是经过预融合引导与注意力重建的个性化表示,语义层级不同。

监督从哪里来?参数如何更新?总损失如何构成?

训练的监督来自三处:个性情感对齐损失、跨模态对比损失、预测结果与真值之间的一范数误差。总损失是三者直接相加,原文未报告加权系数,可视为等权相加。个性情感对齐损失内部又分为复合对比损失与个性化情感约束损失。跨模态对比损失针对文本与视觉、文本与音频 2 对。预测误差用一范数衡量回归偏差。

优化器、学习率调度与早停等细节原文只报告了初始学习率与批量大小:在 MOSI 与 MOSEI 上初始学习率均为 10 的负 4 次方,批量分别为 128 与 256。实现基于 PyTorch,在单张 RTX 3090 上训练。关于参数冻结,图注与正文一致的表述是:个性编码器侧冻结,情感编码器前若干层与多模态编码器后段层可训练;但具体哪几层冻结、梯度是否在映射矩阵处截断、个性预训练权重是否全程不更新,原文未给出逐层说明,此为具体缺项,不从模型名称推定。

下面的公式是总损失的构成,符号中预测值与真值以下标区分样本,输入是三项损失之和,计算目标是同时优化对齐、模态匹配与最终预测。

\[LT otal = LAlign + Lclm + ∥ˆyi −yi∥1\]

该公式表明训练不是只优化最后的预测误差,而是把对齐与模态匹配也作为显式监督。若去掉其中一项,模型仍可运行,但原文消融显示指标会下降,具体幅度在消融节用数字表呈现。推理时流程是前向 1 次得到预测值,不需要个性标签,因为个性来自预训练模型的隐式先验而非人工标注。

数据、特征与基线条件是否可比?

数据条件按原文交代:MOSI 为 93 个视频的 2199 个片段,MOSEI 为 1000 个说话人、250 个主题的 23453 个片段,情感分数范围均为负 3 到正 3。为与已有工作保持一致,视觉嵌入来自 Facet 提取的 35 个人脸动作单元,音频嵌入来自 COVAREP 提取的特征,文本走 BERT 类模型。指标方向为平均绝对误差越小越好,相关系数、二分类准确率、七分类准确率与 F1 越大越好。基线覆盖张量融合、跨模态注意力与编码、对比学习、优先级融合、多粒度融合与特征解耦等路线,包括 TFN、LMF、MuLT、MISA、MVCL、HyCon、PriSA、FGTI 与 ULMD 等,均为实际可运行的方法,不是事后最优或人工上限。

资源状态方面,原文脚注给出 2 个模型链接,分别对应情感 BERT 与个性 BERT。本次收到的资源状态显示两个链接均为暂时不可达,因此本解读只能写本次未能确认可达,不能写已公开可用或当前可用。这一状态影响复现:若无法下载相同权重,文本分支的起点就不一致,需要在复现节记录替代方案与核对动作。

主结果测了什么?相对谁有多大改进?

主结果要回答的问题是:在相同数据集与相同指标口径下,个性化对齐加多级融合是否优于已有可运行方法。公平条件是各方法都在 MOSI 与 MOSEI 上报告回归与分类指标,特征提取沿用领域常用工具。指标方向如上节所述,误差看下降,准确率与 F1 看上升。下表整理原文正文中明确写出的相对改进句,不引入原表矩阵重排,所有数字保留原文百分写法,比较对象均为原文点名的实际基线。

条件指标基线本方法相对变化比较对象
MOSIAcc2原文基线值上升 4.8%TFN
MOSIF1原文基线值上升 4.6%TFN
MOSEIAcc2原文基线值提升 3.2%MISA
MOSEIF1原文基线值提升 3%MISA
MOSIAcc2原文基线值提升 0.91%PriSA
MOSIF1原文基线值提升 0.74%PriSA
MOSIAcc2原文基线值提升 0.63%FGTI
MOSIF1原文基线值提升 0.39%FGTI
MOSIAcc2原文基线值提升 0.61%ULMD
MOSIF1原文基线值提升 0.48%ULMD

表后解释需要同时给出收益与代价。报告显示,相对传统张量融合与跨模态编码方法提升较明显,相对近年优先融合、多粒度融合与解耦方法的提升幅度收窄到 1 个百分点以内,这支持个性与多级融合在强基线下仍有增益,但不支持大幅领先的判断。原文把原因归于个性信息捕捉个体差异、多级机制实现个性化特征的动态传递与双路汇总。限制是原文未报告显著性检验与多次运行方差,也未测量延迟与参数量,因此不能把准确率提升直接等同于部署更优。

未胜出项方面,原文主表显示七分类等个别指标并非全部最高,解读时应保留这一边界,不只看二分类。论文特有细节是同时使用个性情感对比与跨模态对比两类对比学习,以及把 BERT 深层复用为多模态编码器的做法,这两点是复现时必须保留的信息条件。

拿掉哪一块掉得最多?对齐放在哪一层最好?

消融要回答两个问题:哪个模块或损失对最终分类影响最大,对齐操作放在网络哪一层最合适。条件是均在 MOSI 上、保持其余结构不变、只移除目标组件或损失,指标看 Acc2 与 F1 的变化。下表整理原文明确写出的下降幅度句,数值保留原文写法,下降均指相对完整模型的减少。

条件指标完整模型消融后变化去除对象
MOSIAcc2完整模型值下降 1.83%个性特征提取
MOSIF1完整模型值下降 1.72%个性特征提取
MOSIAcc2完整模型值下降 1.67%BERT 预融合
MOSIF1完整模型值下降 1.75%BERT 预融合
MOSIAcc2完整模型值下降 2.44%个性化约束损失
MOSIF1完整模型值下降 2.27%个性化约束损失
MOSIAcc2完整模型值下降 1.39%多模态对比损失
MOSIF1完整模型值下降 1.27%多模态对比损失

表后解释需指出主要代价与反例。报告显示,去掉个性化情感约束损失的下降最大,去掉个性特征提取次之,这支持约束损失在平衡个性匹配与标签正确中的关键作用。去掉预融合与多模态对比损失也有 1 个百分点以上的下降,支持初步对齐对缓解异构的作用。但消融未报告去掉增强融合双路中单一路的独立影响,也未报告多次随机种子的波动,因此可能与待验证的表述要分开:可以说报告显示某项更重要,不能说该项必然在所有数据上最重要。

层分析方面,原文把 13 层分为 1 至 11 层纯文本对齐、12 层拼接未融合视听对齐、13 层融合后对齐,报告显示 11 层达到峰值、12 层明显下跌、13 层回升但仍低于 11 层。

本段为图 2 的导读,图为折线图,横轴为层编号 1 至 13,纵轴为取值,两条曲线分别为橙色 Acc2 与绿色 F1,观察动作是先确认图例再沿横轴比较升降,最后聚焦峰值与跌落位置。

看图路径: 1. 先确认横轴为层编号 1 到 13、纵轴为取值并区分橙色 Acc2 与绿色 F1;2. 再沿层数从左向右观察两条曲线在 11 层前后的升降趋势;3. 重点比较第 11 层峰值与第 12 层跌落的幅度差异

原论文 Figure 2:Acc2 and F1 for personality-sentiment alignment applied at different layers on the CMU-MOSI.

论文图 2。原论文 Figure 2:“Acc2 and F1 for personality-sentiment alignment applied at different layers on the CMU-MOSI.”。

图 2 可见内容支持原文解释:两条曲线在 1 至 5 层相对平坦,6 层后稳步上升,11 层同时达到最高点,12 层急剧下跌,13 层有所回升但未超过 11 层。原文的有限解释是浅层文本尚未捕获足够情感语义故对齐弱,深层文本语义更丰富故 11 层最好;12 层因未融合视听噪声大而难匹配;13 层因纯文本个性嵌入与多模态联合特征存在语义空间差异而低于 11 层。这些属于支持性解释,不是因果证明,换数据集或换个性模型后峰值位置可能移动,有待验证。

哪些结论不能下?还有什么没有测?

首先区分 3 类表述。直接报告的是:在给定特征与基线集合下,PSA-MF 在 2 数据集多数指标上取得报告最优,以及上述消融下降幅度。有限解释的是:个性捕捉个体差异、预融合缓解异构、双路兼顾全局与局部,这些有消融与层曲线支持,但仍是相关性层面的支持。未验证推测是:把个性化扩展到视听模态或换新融合策略会更好,这只是未来工作方向,没有证据。

未评测的边界包括:没有个性标签数据集上的个性质量本身、跨说话人与跨主题的泛化、推理延迟与显存占用、多次运行的方差与显著性。原文也未给出学习率调度、早停、权重衰减与梯度路径的完整清单,因此不能从冻结字样推定输出确定性,也不能把训练资源等同于推理开销。总体趋势不等于每组都成立,例如七分类与个别相关系数上的优势幅度较小,阅读时应按指标分别判断。相关性不是因果,准确率提升不能直接承诺误判率、延迟或成本同时改善。

要复现先做什么?关键超参数与核对动作是什么?

复现的第一步是固定数据与特征口径:使用 MOSI 的 2199 片段与 MOSEI 的 23453 片段划分,视觉用 35 维人脸动作单元,音频用 COVAREP 特征,文本用与原文一致的分词与截断,不自行更换特征提取器。第二步是固定文本起点:情感分支用可微调的 BERT 前若干层,个性分支用个性预训练模型,记录是否冻结个性分支以及后段多模态编码器的层数分配,原文记为前 N 层与后 12 减 N 层,N 的具体取值需以代码为准,缺项要记录。

第三步是固定监督:同时打开个性情感对比、跨模态对比与一范数预测误差,总损失直接相加,初始学习率设为 10 的负 4 次方,批量 MOSI 设 128、MOSEI 设 256,在 PyTorch 与单卡环境下先跑通前向。核对动作包括:检查映射后维度是否一致、对比损失温度系数取值、卷积核大小是否为 3、子网是否为两层非线性全连接。资源方面,原文脚注的两个权重链接本次未能确认可达,若下载失败应记录替代权重名称与版本,并对比替换前后的指标变化,不能默认等价。

最后按回归与分类两套指标分别记录平均绝对误差、相关系数、二分类准确率、七分类准确率与 F1,并保存随机种子与多次运行结果以补足原文未报告的方差。

何时值得尝试 PSA-MF?一句话如何收束?

当任务同时满足 3 个条件时值得尝试:输入包含文本主导加视听辅助的 3 模态,怀疑同一文本在不同说话人下情感强度不同,且已有直接拼接或单层注意力融合遇到瓶颈。此时可先保留原有特征提取不变,只加入个性分支与对齐损失做增量实验,再加入预融合与双路增强融合,避免 1 次改动多处导致无法归因。若视听质量很差或文本缺失严重,预融合引导的作用会打折,应先检查数据质量再决定是否使用完整多级结构。

论文特有的误解需要澄清:个性嵌入不是个性分类结果,而是外部先验的隐式表示;多模态编码器不是新增大模型,而是复用 BERT 深层;对比损失有两处,分别管个性情感匹配与文本视听匹配,不能只开一处。

收束来说,PSA-MF 的中心判断是把个性差异显式带入情感表示,并用渐进式融合协调模态差距,报告的最强证据是 2 数据集上的综合最优与约束损失消融的最大跌幅,主要代价是更复杂的双分支文本编码与多阶段融合,复现时必须先固定特征、权重可达性与三项监督,再补方差与开销验证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总