SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits
📄 SHAP-Weighted Cross-Modal Expert Fusion for Emotion and Sentiment Recognition: Evidence and Limits 标签:#多模态模型 #可解释性 #模型集成 4.5/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.3/1.5 📝 4.5/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #多模态模型 | #模型集成 | #可解释性 | arxiv 👥 作者与机构 第一作者:Adis Alihodzic(Department of Mathematical and Computer Sciences, Faculty of Science, University of Sarajevo, Sarajevo, Bosnia and Herzegovina) 第二作者:Selma Skopljakovic Hubljar(论文中未明确标注所属机构) 通讯作者:未明确标注(Adis Alihodzic 的大学邮箱 adis.alihodzic@pmf.unsa.ba 排在首位) 💡 毒舌点评 论文对SHAP归约规则(mean/median/sum-abs)如何影响跨模态专家门控权重的洞察是清晰且有价值的,其系统性消融设计(三种归约 × 三种面部聚合器 × 多种专家池配置)是本文最大的亮点。然而,核心方法sum-abs XGAF在MELD上仅"逼近"朴素早期融合(差0.35个百分点,无统计显著差异),在CMU-MOSEI上仅微弱超越(+0.34个百分点),且缺乏与任何现代神经融合基线(TFN、MulT、MISA等)的直接对比——这意味着我们无法判断"逼近早期融合"这一结论的含金量究竟有多高。更关键的是,诊断分析揭示sum-abs门控实质上退化为跨模态专家(特别是三模态专家)的固定主导,而非论文标题所暗示的"自适应"逐样本路由。整篇论文的核心贡献因此沦为"如何用事后解释工具复现早期融合性能"的方法论实验报告,而非真正具有超越性的融合策略。 ...