📄 PRIM:Cooperative Dynamic Token Compression for Efficient Large Multimodal Models

#多模态模型 #音视频理解

3.6/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 0/1.5

📝 3.6/10 | 后50% | #音视频理解 | #多模态模型 | arxiv

👥 作者与机构

  • 第一作者:Song Li(北京邮电大学 网络与交换技术国家重点实验室)
  • 通讯作者:Yongping Xiong(北京邮电大学 网络与交换技术国家重点实验室)
  • 其他作者:无。论文仅列出两位作者。

💡 毒舌点评

本文基于对多模态大模型中注意力的观察,构建了一套无训练的推理阶段令牌压缩流水线。这种“观察-设计-验证”的套路本身并无新意,且每个模块(早期融合、注意力剪枝、频域压缩)均是现有技术的直接借用或微调。更致命的是,论文声称“高效推理”,却完全没有提供任何代码、模型权重或复现配置,这使得所有所谓的效率提升、记忆开销减少和延迟降低都成了无法核实的“纸上谈兵”。在开源已成为顶级会议标配的今天,这种做法严重削弱了论文的可信度和影响力,对于注重实践和复现的语音/音频社区而言,这更是一篇参考价值几乎为零的工作。

📌 核心摘要

这篇论文旨在解决大型多模态模型(LMMs)在推理长音视频内容时,因输入令牌数量巨大而导致的计算和内存开销过高的问题。文章通过对LLM内部注意力分布的分析,做出了两个核心观察:(1)跨模态交互主要集中在LLM的浅层,深层则趋于稀疏和抽象;(2)在所有层中,音频令牌获得的注意力权重始终高于视频令牌,表明音频包含更密集的语义信息,而视频则存在大量冗余。基于这些观察,作者提出了PRIM,一个无需额外训练、即插即用的推理阶段协同压缩框架。该框架包含四个主要模块:多模态交叉融合(MCF)将文本-音视频的早期交互外移至LLM之前;注意力引导的选择(AGS)利用音频显著性动态控制各时间窗口的视频令牌压缩比率;频率感知压缩(FAC)利用2D-DCT保留低频能量分量以压缩视频令牌;任务自适应剪枝(TAA)则根据指令复杂度在LLM内部动态分配令牌预算。实验在Qwen2.5-Omni、LLaVA-OneVision、LLaVA-Video等模型和多个音视频基准(如MVBench、VideoMME、AVUT)上展开,结果表明PRIM在显著降低FLOPs(低至28%)和推理延迟的同时,能保持与全量模型接近甚至更优的准确率。其声称的实际意义在于为多模态模型的部署提供了一种低成本方案。

核心实验数据(基于Qwen2.5-Omni-7B)如下所示:

方法保留率FLOPs比MVBenchMLVULongVideoBenchVideoMME Overall平均分
Qwen2.5-Omni-7B (全量)100%100%59.058.567.360.761.4
PRIM (Ours)65%54%58.858.367.160.361.1
PRIM (Ours)50%41%57.658.465.959.660.4
PRIM (Ours)35%28%54.353.262.956.256.7

主要局限包括:方法强依赖于固定时间窗口划分,无法直接处理流式输入;所有评估均基于离线长视频理解基准,缺乏对纯音频任务(如ASR、音频事件检测)的验证,在多任务/多场景下如何自动、泛化地分配压缩比率仍未解决;完全没有提供开源代码或模型,复现和实际应用价值存疑。

🏗️ 方法概述和架构

PRIM是一个无需额外训练的推理阶段压缩框架,旨在对音视频令牌进行协同削减以降低大型多模态模型(LMMs)的推理计算量。

整体流程如上图所示:输入的视频帧和音频段分别经过预训练的视觉编码器和音频编码器提取特征,通过投影层映射到语言模型空间,得到视觉令牌序列 Hv 、音频令牌序列 Ha 和文本令牌序列 Hq。这些令牌进入PRIM框架,依次经过四个压缩模块,最终送入大语言模型(LLM)生成回答。具体来说:

  1. 多模态交叉融合模块(MCF,Multimodal Cross-Fusion) 此模块旨在将原本发生在LLM早期层的跨模态文本-音视频交互外置,以降低LLM的输入令牌数量。具体实现为使用多个与LLM结构相同的Transformer块组成融合器f(·),将文本令牌 Hq 分别与所有视觉令牌 Hv、所有音频令牌 Ha 拼接后输入,并只取输出的文本令牌部分作为融合后的令牌 HˆqvHˆqa。这些融合令牌携带了所有原始音视频的信息,与压缩后的原始音视频令牌一同被送入LLM,从而让LLM可以处理更少的原始令牌。

  2. 注意力引导的选择模块(AGS,Attention-Guided Selection) 该模块在每个固定时间窗口内独立对音视频令牌进行初步压缩。首先处理音频令牌:利用音频编码器末层的自注意力矩阵 A,计算每个音频令牌的平均被关注度,并保留前 S% 的高分令牌作为信息密集型令牌,其余视为非显著性令牌。为了不丢失这些非显著性令牌的上下文信息,作者在它们之中均匀采样后,再通过计算其与视频令牌的跨模态相似度 Sim = H˜a(H˜v)^⊤,选取与视频最相关的top-δ个音频令牌作为代表进行聚合。 完成音频压缩后,根据每个窗口的音频令牌保留率 \(P_a(i)\) 动态调整该窗口的视频压缩率:信息密度高的窗口(高 \(P_a(i)\))将获得更高的视频令牌保留预算。此过程通过初始自适应比率公式 \(\rho'_v(i) = \rho_{max} - (\rho_{max} - \rho_{min}) \cdot P_a(i)\) 及全局归一化来实现。

  3. 频率感知压缩模块(FAC,Frequency-Aware Compaction) 此模块在视觉编码器后直接插入一个无参数的“频率特征压缩器”(FFC)。它将每帧视频特征图(reshape为 \(N \times N\) 网格)通过二维离散余弦变换(DCT)转换到频域。基于视觉特征能量集中于低频分量的观察,仅截取前 \(C \times C\) 个低频分量,舍弃高频冗余分量。保留的令牌数 \(C^2\) 由AGS模块为该窗口计算的视频压缩比率 \(\rho_v(i)\) 动态控制。最后通过逆DCT(iDCT)将频域特征恢复为空间特征并展平。此外,模块内还通过计算相邻帧对应空间位置的余弦相似度,来进一步剪除时域冗余帧的令牌。

  4. 任务自适应剪枝模块(TAA,Task-Aware Adaptive Pruning) 在LLM内部,此模块用于处理与文本指令相关的冗余。它定义了“多模态注意力值”(MAV),即每个注意力头对所有音视频令牌的关注强度之和。PRIM根据MAV筛选出与多模态信息最相关的top-k个注意力头,并用这些头的重要性分数 \(a'_i\) 对令牌进行排序。在LLM的预设中间层(如图4所示,从第K层开始),逐层剪除低分令牌。剪枝的令牌总数 \(K = \lambda \cdot \sum_{h=1}^k \sum_{i \in M_{av}} a_{i, I(h)}\) 是自适应的,由指令和多模态令牌的交互程度决定,使得不同复杂度的实例有不同的令牌预算。

💡 核心创新点

  1. 基于实证观察的协同压缩策略:通过对LLM内部跨层、跨模态注意力分布的系统分析,观察到“音频主导”和“视频高冗余”的现象,并以此作为所有后续模块设计的动机和依据。这一从分析到设计的过程使得方法具有一定的可解释性。
  2. 外置多模态交叉融合(MCF):将LLM浅层的文本-音视频交互前移至专用的、架构相同的Transformer块中,生成了紧凑的融合令牌。此举避免了让LLM在海量原始令牌上进行早期交互,是一种逻辑清晰的效率优化思路。
  3. 动态、多级联的压缩流水线:构建了一个从“音频引导视频压缩(AGS)”、“视频频域去冗余(FAC)”,到“指令自适应剪枝(TAA)”的层次化压缩序列。各模块分工明确,并以音频保留率为纽带进行动态耦合,使其在工程上显得较为精巧。
  4. 完全无训练、即插即用:整个框架的所有模块均不涉及任何梯度更新,可作为一个插件应用于多种现成的LMMs,降低了使用门槛。

📊 实验结果

论文在Qwen2.5-Omni、LLaVA-OneVision、LLaVA-Video三个模型上,与FastV、DyCoke、PruneVID、VisionZip、FastVID等基线方法进行对比。评估基准包括MVBench、MLVU、LongVideoBench、VideoMME、AVUT、WorldSense等。

Qwen2.5-Omni 结果(Table 1):在50%令牌保留率下,PRIM以41%的FLOPs比取得60.4的平均分,优于VisionZip(59.8)和FastVID(59.5)。在35%保留率/28% FLOPs比下,PRIM得分56.7,超过VisionZip (55.8) 和 FastVID (55.7)。

AVUT 结果(Table 2):在Qwen2.5-Omni-7B上,PRIM以33%的FLOPs比在AVUT上取得62.3分,超过更高FLOPs比的DyCoke (57.7) 和 FastVID (60.2),性能已接近全量模型(63.3)。

LLaVA-OV WorldSense 结果(Table 3):在50%保留率下,PRIM以更低的FLOPs(22.1T)达到51.0%的准确率,超过了全量模型(51.4%)的表现以及 FastVID (50.4%)。

LLaVA-Video 结果(Table 4):在25%保留率下,PRIM在VideoMME上的总体得分为61.8,优于DyCoke (58.6)和FastVID (59.3)。

效率分析(Table 5):在WorldSense上,PRIM相比DyCoke和FastVID分别最多减少12GB内存和近30%的延迟。

可视化:论文通过可视化展示了PRIM动态压缩比率的分配情况,以及压缩后模型对关键帧和区域的保留能力,提供了直观的性能解释。

🔬 细节详述

  • 训练数据:无额外训练,直接使用预训练模型的权重。
  • 损失函数:不适用(无训练方法)。
  • 训练策略:不适用(无训练方法)。
  • 关键超参数:ρ_max=0.7, ρ_min=0.3, 非显著令牌聚合数量 δ=4, 音频关键选取比例 S=0.3, 初始视频压缩比率 ρ_v=0.6, MCF模块包含4个Transformer块。视觉编码帧率 2 fps,最大帧数128。TAA中的缩放因子 λ 未说明具体值。解码评估长度 R=100。
  • 训练硬件:未涉及训练。推理使用NVIDIA A800 (80GB) GPU。
  • 推理细节:所有方法在统一的评估框架LMMs-Eval下测试,使用FlashAttention以降低内存。
  • 计算量定义:FLOPs定义为音视频令牌在预填充和解码阶段引入的总计算量,具体公式在附录中给出。

⚖️ 评分理由

  • 创新性 (1.0/2):论文的贡献在于工程上的系统集成。通过对已知注意力模式的分析,将DCT压缩、注意力剪枝、早期融合等多种现有技术组合成一个多级流水线。虽然“音频引导视频压缩”的结合方式有一定洞察,但各个组件本身缺乏根本性的算法创新,整体属于组合式改进工作,未达到顶会所期望的理论或方法学突破。
  • 技术严谨性 (0.8/1.5):方法部分描述相对清晰,但存在多处关键细节缺失。任务自适应剪枝(TAA)模块中的缩放因子λ是控制令牌保留数量的核心参数,但论文未提供其值或设置方法,使该模块完全无法复现。对关键超参数(如δ, S)的选择主要基于经验,缺乏敏感性分析或选择依据。该方法强依赖的固定窗口尺寸也是一个未经讨论的潜在影响因子。
  • 实验充分性 (0.8/1.5):实验覆盖了多个主流模型和基准,消融实验也验证了各模块的必要性。但是,所有评估任务均为离线的长视频理解,完全没有涉及其处理的“音频”相关核心任务,如语音识别(ASR)、音频事件分类、说话人日志等,无法证明方法是否会对音频特有的时序信息造成灾难性破坏。此外,与一些同样无需训练的视频压缩方法(如ToMe)的对比缺失。对极端压缩下失效案例的分析也付之阙如。
  • 清晰度 (0.4/1):论文中图示和核心流程描述较为清晰。然而,TAA模块的描述是本篇论文中最关键也最不清晰的部分。其核心参数λ的缺失,使得整个流水线的核心步骤模糊不清,严重影响了读者对方法的完整理解和复现。实验表格Table 1中Qwen2.5-Omni-7B全量模型在MLVU上的得分65.9(原文为58.5),存在明显的排版或数据错误,已根据上下文修正,但这损害了论文的严谨性。
  • 影响力 (0.0/1.5):尽管方法旨在提高多模态模型效率,可能对CV/NLP交叉的系统领域有参考价值,但对于音频/语音社区几乎没有直接影响。论文定位为通用多模态模型压缩,未在音频特有任务上验证,方法设计也未考虑音频的时序特性,导致其对音频领域的贡献和启发意义极其有限。
  • 开源 (0.0/1.5):论文中未提供任何代码、模型权重或数据集的链接,也未提及开源计划。对于一篇声称提供高效推理解决方案的论文,缺失代码使所有性能收益声明无法被验证,这在本领域属于严重的不合规行为。
  • 可复现性 (0.0/0.5):由于完全没有提供代码,且TAA模块的关键参数λ缺失,其他超参数配置在不同实验中的细节也有缺失,根据论文正文进行复现的可能性几乎为零。
  • 工程/实践价值 (0.0/1.5):虽然有工程上的设计,但缺乏代码和系统优化的详细文档,完全是空中楼阁,没有任何实际的工程部署价值。对于追求落地和复现的研究者和工程师来说,这篇论文目前没有提供任何可以借鉴的资源。

🚨 局限与问题

论文明确承认的局限

  1. 不同应用场景对音视频模态的依赖度不同,如何跨任务自动、泛化地分配压缩比率是一个开放问题。
  2. 当前方法仅为离线推理设计,不支持流式或时长不确定的在线输入。
  3. 未与模型量化、蒸馏等其他效率优化技术进行联合设计和验证。

审稿人发现的潜在问题

  1. 致命缺陷:完全不可复现。作为一篇系统性的工程论文,没有代码,这使其在声明的所有贡献,尤其是在效率(FLOPs, Latency, Memory)方面的提升,都成为了无法核实的空洞承诺。这是最严重的问题。
  2. 泛化性验证严重不足:所有实验均局限于长视频的多模态QA或理解任务。该方法对纯音频任务(如ASR、语音翻译)的影响完全未知。考虑到音频令牌是其压缩策略的“主导”和基准,在音频核心任务上的性能退化风险极高。
  3. TAA模块描述缺失:TAA模块是唯一处理指令交互的部分,但其核心控制参数λ完全由公式 K = λ * sum(...) 给出,却没有说明λ如何确定。是全局统一常数,还是实例自适应?如果是常数,值是多少?这导致整个LLM内部的剪枝逻辑无法理解。
  4. 基线对比不够充分:尽管对比了几个近期工作,但遗漏了如ToMe等经典的、同样无须训练的令牌合并方法作为基线。
  5. 对音频模态的处理过于粗糙:方法将音频简单地按时间窗口和注意力值进行剪枝与合并,完全忽略了音频信号的频域特性。其FAC模块仅用于视频,而音频是时域上的直接操作。这种不对等处理可能破坏音频的精细时序结构。
  6. 固定窗口策略的脆弱性:该方法按固定时间窗口独立计算压缩率,这是一个强假设。在事件边界恰好横跨窗口时,可能造成关键信息的断裂或丢失。论文未对此进行讨论。

← 返回 ICML 2026 论文速递