模态竞争下如何协作:PaSE 用原型校准与 Shapley 均衡做多模态情感分析
针对文本主导压制音频与视觉的模态竞争问题,PaSE 用模态内原型校准与熵正则最优传输对齐语义,再用双阶段融合与 Shapley 梯度调制平衡优化,在 MOSI、MOSEI 和 IEMOCAP 上报告最优结果,但缺失代码可用性与显著性检验等复现细节。
针对文本主导压制音频与视觉的模态竞争问题,PaSE 用模态内原型校准与熵正则最优传输对齐语义,再用双阶段融合与 Shapley 梯度调制平衡优化,在 MOSI、MOSEI 和 IEMOCAP 上报告最优结果,但缺失代码可用性与显著性检验等复现细节。
针对多模态共有信息与私有信息纠缠且统一监督忽视模态差异的问题,PLUM-Net 采用多级语义对齐加原型单模态标签加双分支解耦加私有精炼的两阶段流程,在 CMU-MOSI 上报告 ACC-2 88.2%/90.3% 与 MAE 0.448,但严重类别不平衡与缺模态时性能可能明显下降。
针对多模态情感分析中忽视个性差异与浅层融合的问题,PSA-MF 用个性-情感对齐提取个性化文本情感再做多级融合,在 MOSI 和 MOSEI 上取得报告的最优结果,代价是依赖双 BERT 文本编码与多阶段融合结构。
MultiMood 针对纯文本情感支持丢失非语言线索且回复不可靠的问题,用视频音频文本三路编码加对话压缩与 PPO 加 GRPO 可信对齐,在 MESC 四任务与 DFEW 表情识别上取得最优平均表现,代价是策略预测仍弱于专用基线且压缩会损失信息。
针对声学与语义分类器后验概率量纲不可比的问题,该工作用训练集留一法分布下的百分位名次代替原始概率做平均,并在高置信度分歧时才允许手工语言特征随机森林覆写,在 ADReSS2020 取得 95.83% 准确率、在 ADReSSo2021 取得 90.14% 准确率,代价是需要保留训练侧分布与多组逻辑回归分支并做前向选择。
SafeLens 针对短视频中仇恨内容只在少数时刻出现而整片标签会引入时间噪声的问题,用先切分语义片段再融合语音转写、屏幕文字和画面描述并由微调策略大模型输出标签加置信度加一句话理由加伤害类别的结构化判断,演示证据显示其能在同一视频内区分出 93% 与 73% 等不同置信度的多个片段,但原文未报告可复算的检出率与对照基线所以只能作为工作流演示而非性能结论。
论文要解决开放课程多模态教育知识图谱难自动构建的问题,用抽取-验证-整合-增强管线加跨模态对齐构造覆盖生物物理化学的 SciMKG,最强证据是概念抽取 F1 达到 0.803 并有多模态对齐的人评与自动评测支撑,代价是依赖前沿大模型推理与多轮校验的开销。
针对级联式说话人日志与识别中误差传递与重叠语音难处理的问题,SpeakerLM 用音频编码器加投影器接入大语言模型的端到端多模态方案,在约 7638.95 小时数据下主指标超越最强级联基线,但小数据与仿真失配时仍明显落后。
针对文本、音频、视频情感分析中模态内结构丢失与跨模态语义错位问题,SSU 用句法与文本引导的模态图加全局语义锚与多视角对比学习统一融合,在 CMU-MOSI/MOSEI 上报告最高精度并以 0.3B 参数、0.015s 构图保持轻量,代价是依赖文本质量与句法解析条件。
针对同一视频中文本、视觉、音频情感倾向不一致的问题,TiCAL 先用高置信锚表生成单模态伪标签并在双曲空间结构化,再用典型性和一致性做三阶段动态融合,在 MOSI 上报告 Acc-2 为 88.10,代价是需要完整三模态和多阶段调参。
针对文本音频视频缺失与传感器噪声并存导致情感预测失效的问题,TMDC 先在完整数据上学习去噪的特有与共享表示再用可见模态补全缺失模态,在 MOSI、MOSEI 和 IEMOCAP 的七种缺失组合及加噪条件下报告了优于所列基线的平均准确率,代价是两阶段训练与共享表示冗余。
针对脑电与语音采样率不对齐且单路编码只看目标相关特征的问题,TIDENet 用可训练转置卷积做脑电重采样、用结构共享双路编码分别建模相关与无关特征,在 Cocktail Party 和 AVED 上取得最高的 SDR、SI-SDR、STOI、ESTOI 和 PESQ,但单加语音双路时增益有限且 ESTOI 最优变体不是全量模型。
论文用 169 人临床确诊的多任务多模态数据比较任务与模态的判别力,并测试大模型精神科推理,报告音频与视频最有效、图片描述最能诱发标记、知识引导可提升约 10 个百分点 Macro-F1,但文本大模型仍落后于监督判别模型。
针对混合声源数未知且用户线索可能缺失或低质的问题,USE 用 EDA 自动估计声源数与吸引子、用多模态线索网生成可替换的线索嵌入并以对齐损失联合训练,在 AudioSet 类 2 混与 3 混上报告了分离与提取的提升,但多声源计数与跨模态对齐精度随声源数增加而下降且大混合数评估仍有限。
针对分类法缺解释、纯文本大模型漏掉表情语调的问题,该研究提出情绪—认知协同多模态描述任务并用双路 BridgeNet 加 LLaMA 生成描述,在 MMDA 上描述指标领先且生成的画像把抑郁焦虑辅助判断的准确率平均提升超 12 个百分点,代价是两阶段训练与自动标注依赖人工清洗。
该研究以六类蚊种图像加 5 秒翅振音频为输入,用 SwinV2 与音频频谱变换器分别输出类别对数再做可学习加权融合,在干净集上融合准确率为 97.8 未超过单模态,而在图像与音频双侧加噪后融合仅下降 4.66 个百分点的代价是需要配对双模态输入与联合微调。
在文本+ 语音输入上用固定编码-时序-融合流水线对比 Transformer 与 Mamba 时序主干,并用二维高斯软目标训练 9×9 Valence-Arousal 联合分布头,在说话人无关 LOSO 协议下主系统达 73.0%±0.3 UA 且分布质心可跟踪连续效价/唤醒,但延迟优势在该句长下未出现。
针对 GMAW 角焊缝中难以实时发现的五类内部缺陷,论文用 16 帧图像与梅尔声谱的 3D 时序融合加跨块注意力将多模态 F1 提升至 0.99,并以 GradCAM 与 t-SNE 定位每类缺陷的图像关键区与更优模态,代价仅增加 0.1 GFLOPs。
针对六声部无伴奏合唱中主唱与伴唱音色高度相似、时域重叠的分离难题,论文在 BS-RoFormer 主干中以帧级主唱音素对齐经 FiLM 逐层调制中间表示,并在 jaCappella 上以理想对齐条件验证其对 Vo 与 Other 两路 SI-SDRi 的提升及随音素重叠度变化的增益边界。
针对全双工语音对话在背景噪声和重叠说话下语义口令损坏的问题,AV-STE 用流式视听编码器加噪声自适应融合在冻结 Moshi 之前恢复第一码本语义口令,同数据集多人干扰下 GPT-4o 连贯性平均从 1.42 提到 1.91,代价是干净语音存在口令失配且依赖可靠唇部视频。