PRIM:Cooperative Dynamic Token Compression for Efficient Large Multimodal Models
📄 PRIM:Cooperative Dynamic Token Compression for Efficient Large Multimodal Models #多模态模型 #音视频理解 3.6/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 0/1.5 📝 3.6/10 | 后50% | #音视频理解 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Song Li(北京邮电大学 网络与交换技术国家重点实验室) 通讯作者:Yongping Xiong(北京邮电大学 网络与交换技术国家重点实验室) 其他作者:无。论文仅列出两位作者。 💡 毒舌点评 本文基于对多模态大模型中注意力的观察,构建了一套无训练的推理阶段令牌压缩流水线。这种“观察-设计-验证”的套路本身并无新意,且每个模块(早期融合、注意力剪枝、频域压缩)均是现有技术的直接借用或微调。更致命的是,论文声称“高效推理”,却完全没有提供任何代码、模型权重或复现配置,这使得所有所谓的效率提升、记忆开销减少和延迟降低都成了无法核实的“纸上谈兵”。在开源已成为顶级会议标配的今天,这种做法严重削弱了论文的可信度和影响力,对于注重实践和复现的语音/音频社区而言,这更是一篇参考价值几乎为零的工作。 📌 核心摘要 这篇论文旨在解决大型多模态模型(LMMs)在推理长音视频内容时,因输入令牌数量巨大而导致的计算和内存开销过高的问题。文章通过对LLM内部注意力分布的分析,做出了两个核心观察:(1)跨模态交互主要集中在LLM的浅层,深层则趋于稀疏和抽象;(2)在所有层中,音频令牌获得的注意力权重始终高于视频令牌,表明音频包含更密集的语义信息,而视频则存在大量冗余。基于这些观察,作者提出了PRIM,一个无需额外训练、即插即用的推理阶段协同压缩框架。该框架包含四个主要模块:多模态交叉融合(MCF)将文本-音视频的早期交互外移至LLM之前;注意力引导的选择(AGS)利用音频显著性动态控制各时间窗口的视频令牌压缩比率;频率感知压缩(FAC)利用2D-DCT保留低频能量分量以压缩视频令牌;任务自适应剪枝(TAA)则根据指令复杂度在LLM内部动态分配令牌预算。实验在Qwen2.5-Omni、LLaVA-OneVision、LLaVA-Video等模型和多个音视频基准(如MVBench、VideoMME、AVUT)上展开,结果表明PRIM在显著降低FLOPs(低至28%)和推理延迟的同时,能保持与全量模型接近甚至更优的准确率。其声称的实际意义在于为多模态模型的部署提供了一种低成本方案。 核心实验数据(基于Qwen2.5-Omni-7B)如下所示: 方法 保留率 FLOPs比 MVBench MLVU LongVideoBench VideoMME Overall 平均分 Qwen2.5-Omni-7B (全量) 100% 100% 59.0 58.5 67.3 60.7 61.4 PRIM (Ours) 65% 54% 58.8 58.3 67.1 60.3 61.1 PRIM (Ours) 50% 41% 57.6 58.4 65.9 59.6 60.4 PRIM (Ours) 35% 28% 54.3 53.2 62.9 56.2 56.7 主要局限包括:方法强依赖于固定时间窗口划分,无法直接处理流式输入;所有评估均基于离线长视频理解基准,缺乏对纯音频任务(如ASR、音频事件检测)的验证,在多任务/多场景下如何自动、泛化地分配压缩比率仍未解决;完全没有提供开源代码或模型,复现和实际应用价值存疑。 ...