MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs
📄 MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs #多模态模型 #大语言模型 5.9/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.4/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 📝 5.9/10 | 前50% | #多模态模型 | #大语言模型 | arxiv 👥 作者与机构 作者:Hangling Xie (谢行凌) 机构:南京邮电大学 (Nanjing University of Posts and Telecommunications) 💡 毒舌点评 论文定位清晰,工作扎实,是一篇典型的“系统整合式”研究。它准确指出了MLLM在情感分析中的痛点(提示敏感性、输出不稳定),并给出了一个工程上合理的解决方案。三个模块(检索、自适应加权、投票)的拼接逻辑顺畅,实验设计也覆盖了足够的数据集和骨干模型,消融实验提供了有力的支撑。然而,这种“模块化拼接”的创新性较为有限,每个组件单独来看都有迹可循(RAG、可学习权重、self-consistency)。技术深度上,将连续权重优化离散化为分类问题是一种实用的妥协,但缺乏理论上的深入讨论;对时序信息的处理(平均池化)也过于简单。最令人诟病的是缺乏对推理效率的量化分析,以及代码和数据的未开源,这严重影响了工作的可复现性和实用价值评估。总体而言,这是一篇合格的、偏向应用的工程性论文,但距离顶级会议的理论或算法创新还有距离。 📌 核心摘要 本文针对多模态大语言模型(MLLMs)在情感分析任务中面临的提示设计敏感、静态演示无法适应多样输入以及模型输出不稳定等问题,提出了一个多模态自适应少样本提示框架(MAF)。该框架不更新MLLM参数,而是通过三个协同工作的核心模块来提升性能:1)多特征混合检索模块:整合面部表情(包含用于定位活跃说话人的唇部运动检测)、场景上下文和文本语义特征,从演示语料库中检索与当前查询最相关的多模态示例。2)自适应系数生成模块:一个轻量级神经网络,根据输入查询的内容,实时预测面部、场景和文本三个模态相似度分数的最优融合权重(从离散的66种权重组合中选择),取代传统的固定权重融合。3)多数投票模块:对MLLM进行多次采样生成候选预测,通过投票机制聚合结果,以提升输出的稳定性和鲁棒性。实验在CMU-MOSEI、CH-SIMS v2.0和MELD三个代表性数据集上,使用Qwen-1.8B、LLaMA2-7B和ChatGLM3-6B三个不同规模的骨干模型进行了验证。结果表明,MAF在各骨干模型上均能稳定提升基线性能(如在ChatGLM3-6B骨干上,MAF在CH-SIMS v2.0的Acc-2上达到86.89%,在MELD的Acc上达到69.94%),并与强基线方法具备竞争力。消融实验证实了检索、自适应加权和投票三个模块各自的贡献及其协同效应。 🔗 开源详情 代码:论文中未提及代码链接。 模型权重:论文中未提及具体模型权重链接。 数据集:论文中提及使用了CMU-MOSEI、CH-SIMS v2.0和MELD三个公开数据集,但未提供具体的下载链接或明确的开源协议信息。 Demo:论文中未提及。 复现材料:论文中提及“所有实验使用了固定种子以确保可复现性”,并说明了硬件环境(NVIDIA GeForce RTX 4090),但未提供完整的训练配置文件、模型检查点或详细复现指南。 论文中引用的开源项目:论文中提及了以下工具/项目,但未提供其具体链接: OpenFace3.0 (用于面部特征提取) PlaceCNN (用于场景特征提取) FAISS (用于构建向量数据库和执行近似最近邻搜索) 🏗️ 方法概述和架构 MAF框架的完整架构如论文图2所示,其目标是在不更新MLLM参数的前提下,通过动态的上下文构建和稳定的推理策略来增强其情感分析能力。整个过程可分为三个主要阶段,分别对应三个核心模块。 ...