Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention
📄 Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention #音频事件检测 #多模态模型 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 🔥 8.2/10 | 前25% | #音频事件检测 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Daniel Shalam(Amazon) 通讯作者:未说明 作者列表:Daniel Shalam(Amazon)、Emanuel Ben Baruch(Amazon)、Avi Ben Cohen(Amazon)、Tal Remez(Amazon) 💡 毒舌点评 这是一篇"简单但有效"的典型工作:两个清晰insight(注意力应聚焦于预测区域、信号应跨token聚合)组合出一个即插即用的Training-free分数,在三个模态四个benchmark上一路吊打SVAR等基线,甚至在COCO上将零样本AP翻倍,实用性拉满。但"注意力质量即置信度"这条路线已有多篇工作在走,MTLA本质上是对SVAR做了"localize + multi-token"的工程优化,创新高度稍欠;且跨模态迁移性依旧依赖MLLM的天花板,并没有从根本上解决MLLM幻觉生成的底层缺陷。 📌 核心摘要 要解决的问题:多模态大语言模型(MLLM)在生成定位输出(检测框、时序窗口)时存在严重幻觉(58%-68%的预测区域不匹配真实目标),且模型自身的token概率无法有效区分幻觉与真实定位,导致MLLM在标准检测/定位评测中可靠性差。 ...