📄 Allocation Before Ranking: Decoupled Token Compression for OmniLLMs
标签:#音视频理解 #模型剪枝 #音频理解 #Transformer #模型评估
8.1/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5
🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #模型剪枝 | #音频理解 #Transformer | arxiv
👥 作者与机构
- 第一作者及通讯作者:Zhenghui Guo(University of Houston, Department of Computer Science)
- 作者列表:Zhenghui Guo(University of Houston, Department of Computer Science)、Yilin Yang(University of Houston, Department of Computer Science)、Yuanbin Man(The University of Texas at Arlington, Department of Computer Science and Engineering)、Miao Yin(The University of Texas at Arlington, Department of Computer Science and Engineering)、Weidong Shi(University of Houston, Department of Computer Science)、Rabimba Karanjai(University of Houston, Department of Computer Science)、Omprakash Gnawali(University of Houston, Department of Computer Science)、Chengming Zhang(University of Houston, Department of Computer Science)
- 通讯作者:论文未单独注明通讯作者,根据惯例及机构信息,第一作者 Zhenghui Guo 通常也是通讯作者。
💡 毒舌点评
这篇文章的洞察力令人印象深刻:敏锐地指出共享注意力中“一次打分,两次决策”的结构性缺陷,将全模态 token 压缩从一个单一的排序问题重新提炼为“先分配容量,后模态内排序”的优化问题,理论分解干净利落。实验也相当扎实,跨 backbone 验证和与 OmniZip 的 Pareto 对比都做得不错。但短板同样明显:方法严重依赖固定的超参(如 α、读层),缺乏针对不同输入分布的在线自适应策略;实验基线虽具代表性,但并未囊括所有近期的训练式压缩方法。这些问题削弱了其实用性闭环论证,离“即插即用”的终极目标还有一步之遥。
📌 核心摘要
本文针对音频-视频全模态大模型(OmniLLMs)在推理时的 token 压缩问题,指出现有方法将全局 Top-K 排序作为统一的显著性(saliency)抽象会引致音频偏好偏差:共享注意力机制同时决定了跨模态容量分配和模态内 token 选择,导致音频 token 不当挤占视频 token 的保留预算。为此,作者提出了一个名为 Macer 的训练无关的推理时压缩器,该方法遵循“分配先行,排序在后”的原则:首先显式地划分音频和视频的保留预算(CCS),然后在各自模态内部进行分配归一化后的注意力得分排序(ANMS),并根据模态特性在特定的浅层分别读取音/视频的重要性并进行剪枝。在 Qwen2.5-Omni-7B/3B 上,25% 的极低保留率下,Macer 分别能保留 98.7% 和 97.3% 的全 token 性能;在 7B 模型上,其 25% 保留率下的 FLOPs 和准确率均优于 OmniZip 的 45% 设置;在 OmniVinci-9B 上,相比共享 Top-K 方法最高提升 12.9 个百分点。该方法不改变模型权重,仅需单次前向传播,为全模态压缩提供了分离分配与选择的通用设计接口。主要局限性在于需要为不同模型尺度手工选定读层与容量份额,且当前的方案是静态的,未探索在线自适应分配策略。
下图直观展示了共享注意力机制中’一次打分,两次决策’的结构性缺陷。

图(a)显示全局Top-K截断将一个显要性分数同时用于跨模态容量分配和模态内token选择;图(b)表明改变视频保留比例会使音频质量份额移动约9.0个百分点,而ToMe与随机丢弃之间的差异仅0.4个百分点;图(c)说明不同的容量分配比例α对任务准确率有直接影响。
🔗 开源详情
- 代码:论文中未提供代码链接。作者声明“Code and calibrated configurations will be released upon publication.”
- 模型权重:论文未提供任何新的模型权重。所使用的 Qwen2.5-Omni-7B/3B 及 OmniVinci-9B 均为第三方公开模型,本文未提供其下载链接。
- 数据集:论文未提供数据集。评估使用的 AVUTBench, DailyOmni, WorldSense, Video-MME 等均为公开基准,但论文未给出获取链接或详细协议。
- Demo:论文未提及。
- 复现材料:论文附录提供了模型规模相关的默认配置表(Table 7)、Macer 算法伪代码(Table 8)及详细的 FLOPs 计算公式。作者承诺与代码一同发布校准配置,但当前未提供用于复现的独立代码包或检查点。
- 论文中引用的开源项目:未明确提及。
🏗️ 方法概述和架构
Macer 严格遵循“分配先行,排序在后”的原则,在不修改模型权重的条件下,实现了解码器内阶段性的 token 剪枝。其工作流程为:在一次解码器 prefill 过程中,先为音频和视频模态设定显式的 token 保留预算,然后分别在各自模态特定的浅层(ℓ_a 和 ℓ_v)读出局部重要性得分,并依据此得分剪枝,最后将保留的 token 送入后续层继续计算。该方法由以下四个子系统构成:
下图展示了Macer的完整推理流水线。

流水线分三步执行:在解码器早期层(ℓ_a)读取音频注意力并剪枝音频token,随后继续至稍深层(ℓ_v)读取视频注意力并剪枝视频token,最终将保留的token按原始序列顺序拼接送入剩余层。
容量协调分割(Capacity-Coordinated Split, CCS):这一步是解决“分配”问题的核心。系统根据用户设定的总保留比例 ρ 计算出多模态 token 总预算 K_mm,再依据一个核心超参数——音频保留份额 α——将总预算显式地拆分为音频预算 K_a 和视频预算 K_v。如果某一模态的原始 token 数不足以填满其名义预算,剩余容量将被重新分配给另一模态。此步骤将跨模态容量分配从一个被共享注意力隐式决定的变量,转变为一个明确、可设置的部署变量。
分配归一化模态记分(Allocation-Normalized Modality Scoring, ANMS):该步骤旨在解决“模态内排序”问题。在各自的剪枝层,Macer 取出问题文本 token(Query)对多模态 token(Key)的注意力概率。对于任一模态 m(音频或视频),首先将每个(query, head)下的注意力在模态 m 内部按行重新归一化,即令其 softmax 质量之和为 1。这一操作消除了共享 softmax 中固有的模态级别质量偏倚,使得计算出的分数纯粹反映 token 在其模态内部的相对重要性。随后,这些分数会跨查询和头取平均,得到最终的模态内排序得分 s_i^(m)。
模态特定浅层读取与剪枝:此设计基于一个诊断发现:音频 token 的重要性在极早的层(如 L3)就已趋于稳定,而视频 token 的重要性则需在稍深的浅层(如 L4-L5)才能获得更好的模态内区分度。因此,Macer 使用独立的读层 ℓ_a 和 ℓ_v。解码器计算至 ℓ_a 层后,Macer 会计算音频得分 s^(a),并按预算 K_a 剪枝,只保留 Top-K 个音频 token。之后,解码器带着保留的音频 token 和全部视频 token 继续运行至 ℓ_v 层,再进行视频侧的得分计算与剪枝。
下图展示了音视频读出层的非对称敏感性诊断结果。

图(a)显示在多数基准测试中视频读出的层敏感性高于音频读出(Δv/Δa > 1);图(b)表明视频读出在L4-L5层附近达到最佳区分度;图(c)显示音频读出在各层间表现相对稳定,二者在可选择性上存在本质差异。
- 视频局部时域覆盖修正:为避免保留的视频 token 在时间上过度集中,Macer 在视频侧的 Top-K 贪婪选择过程中引入了一个覆盖奖励(coverage bonus)。视频序列被粗略地划分为 C 个时间分区,当一个分区的 token 被选中后,该分区内其他 token 的得分会加上一个递减的附加分。此操作仅在已分配的视频预算内部生效,不改变音/视频之间的容量分割。
最终,文本 token 被无条件保留,保留下来的音频和视频 token 按原始序列顺序拼接,送入解码器的剩余层完成计算。整个方法无需训练,不改变模型原始权重,且仅在单次前向传播中完成。
💡 核心创新点
- 问题定义的范式转变:解耦“一次打分,两次决策”:论文首次明确指出,在共享解码器注意力机制下,一个单一的重要性分数同时承担了跨模态容量分配和模态内 token 选择两个不同层面的决策任务。全局 Top-K 压缩必然将模型中固有的音频注意力偏倚,错误地转化为视频容量的损失。Macer 提出的“分配—排序”解耦,从问题定义层面将容量从排序中剥离,为后续设计提供了清晰的指引。
- 分配归一化模态记分(ANMS):通过在模态内对注意力逐行归一化,技术上实现了对 token 得分的“净化”,彻底去除了模态级别的质量(mass)影响。这使得 token 得分不再受制于模态间的注意力竞争,能够纯粹反映其在自身模态内的相对重要性,从而避免了音频 token 因绝对注意力值虚高而挤占视频保留名额。
- 容量协调分割(CCS):将跨模态容量分配从一个被模型隐式决定的“结果”,变为一个用户或系统可以显式控制的“变量”。这使得可以根据下游任务需求,灵活调节音/视频的保留比例,提供了巨大的部署灵活性。
- 模态特定的非对称浅层读取:基于对模型内部机制的定量诊断,发现音频和视频的“可选择性”在不同的浅层深度达到最优。Macer 据此采用了非对称的读层配置,而非一刀切,进一步提升了保留 token 的质量。
- 视频局部覆盖修正:在视频预算内部引入了一个轻量的、基于启发式的时域覆盖奖励项,有效抑制了纯粹按得分排序时可能出现的时空聚集问题。此修正设计精巧,仅在模态内部生效,不干扰核心的容量分配逻辑。
下图揭示了共享注意力中音频偏好的几何成因。

图(a)展示查询向量q在注意力空间中更接近音频质心ca而非视频质心cv,这是音频质量占优的直接几何原因;图(b)表明在不同查询类型下,log(mass_a/mass_v)在各层均为正值,验证了该偏差的普遍性。
📊 实验结果
实验覆盖了音频主导(AVUTBench)、音视频联合(DailyOmni)、视觉主导(WorldSense)和纯视频(Video-MME)四类基准,并在 Qwen2.5-Omni-7B/3B 和 OmniVinci-9B 三个主干模型上进行了验证。
Qwen2.5-Omni-7B 上的主对比实验
| 方法 | 保留率 | AVUTBench | DailyOmni | WorldSense | Video-MME | 归一化平均 |
|---|---|---|---|---|---|---|
| Full Tokens | 100% | 64.5 | 62.1 | 46.8 | 66.0 | 100% |
| OmniZip | 45% | 63.07 | 59.82 | 44.61 | 66.3 | 97.5% |
| Macer | 45% | 64.72 | 63.32 | 44.00 | 66.9 | 99.4% |
| OmniZip | 25% | 59.10 | 57.39 | 38.18 | 66.5 | 91.6% |
| Macer | 25% | 63.67 | 62.07 | 44.80 | 66.2 | 98.7% |
Pareto 效率对比(7B, Macer 25% vs OmniZip 45%)
| 方法 | 保留率 | FLOPs 比例 | AVUTBench | DailyOmni | WorldSense | Avg(3) |
|---|---|---|---|---|---|---|
| OmniZip | 45% | 39.2% | 63.07 | 59.82 | 44.61 | 55.83 |
| Macer | 25% | 34.8% | 63.67 | 62.07 | 44.80 | 56.85 |
消融实验(25% 保留率, Qwen2.5-Omni-7B)
| 变体 | 保留 音/视 比例 | AVUTBench | DailyOmni | WorldSense | Avg. |
|---|---|---|---|---|---|
| 共享 Top-K | 57.6/42.4 | 61.27 | 59.57 | 43.60 | 54.81 |
| Macer 核心 (无 coverage) | 30.0/70.0 | 63.33 | 61.82 | 44.47 | 56.54 |
| Macer 单层读 | 30.0/70.0 | 57.47 | 60.87 | 44.80 | 54.38 |
| Macer 完整 | 30.0/70.0 | 63.67 | 62.07 | 44.80 | 56.85 |
跨 backbone 转移(OmniVinci-9B)
在 45% 保留率下,Macer-B (α=0.40) 相比共享 Top-K 方法的归一化平均得分提升 12.91 个点(DailyOmni 提升 +7.5,WorldSense 提升 +5.74),成功证明了其核心设计在不同模型间的可迁移性。
延迟与内存(WorldSense, Qwen2.5-Omni-7B)
| 方法 | 保留率 | FLOPs | 准确率 | 总延迟 | Prefill 延迟 | Decode 延迟 | 峰值内存 |
|---|---|---|---|---|---|---|---|
| Full Tokens | 100% | 100% | 46.80 | 10.5s | ~3.70s | ~6.8s | 41G |
| OmniZip | 45% | 39.2% | 44.61 | 9.54s | 2.38s | 7.16s | 29G |
| Macer | 25% | 34.8% | 44.80 | 9.17s | 2.53s | 6.64s | 25G |
| 结果显示,Macer 以更低的 token 保留率和计算量,在准确率、延迟和内存占用上均实现了对高保留率 OmniZip 的 Pareto 超越。 |
🔬 细节详述
- 训练数据:无训练过程,不涉及。
- 损失函数:无训练过程,不适用。
- 训练策略:无训练过程,不适用。
- 关键超参数:
- Qwen2.5-Omni-7B:音频读层 ℓ_a=3,视频读层 ℓ_v=5,音频保留份额 α=0.30,视频覆盖强度 λ_c=0.20,视频粗粒度分块数 C=8。
- Qwen2.5-Omni-3B:音频读层 ℓ_a=4,视频读层 ℓ_v=7,音频保留份额 α=0.32,视频覆盖强度 λ_c=0.30,视频粗粒度分块数 C=8。
- OmniVinci-9B:复用了 7B 模型的读层设置 (3, 5),α 在 0.20 和 0.40 两种配置下测试以展示其对性能的影响。
- 以上超参数均在约 100 个样本的 held-out 开发集上选定,并在所有 benchmark 和保留率下冻结使用,证明了配置的稳定性和泛化性。
- 推理细节:采用单次 prefill 推理,文本 token 绝对保留。解码采用 Greedy 策略。启用了 FlashAttention-2 以加速。剪枝后的 token 序列按其原始位置顺序重新排列后输入后续层,而非按模态分组。所有容量指标均基于解码器侧的实际 token 数计算。
- 硬件:评估主要在单张 NVIDIA RTX 6000 Ada 48GB GPU 上进行(FastV 基线因显存不足,在 H100 上评估)。
- 正则化/稳定技巧:在分配归一化的分母中加入小的 ε 以防止除零错误。注意力归一化和分数计算使用 fp32 精度以保证数值稳定性。
⚖️ 评分理由
创新性 (1.5/2):论文将通用 token 压缩重新定义为“先分配容量,后模态内排序”的解耦问题([SCORING_SOURCE_1/36]),提出容量协调分割(CCS)和分配归一化记分(ANMS),从问题定义层面剥离了共享注意力中的跨模态容量偏向,并在不修改模型权重的条件下实现了模态特定的非对称浅层读取([SCORING_SOURCE_9/36])。视频局部覆盖修正为辅助启发式,部分削弱了纯机制的创新高度。
技术严谨性 (1.3/1.5):方法设计严格对应三类诊断观察([SCORING_SOURCE_2/36],[SCORING_SOURCE_7/36]),容量分配、模态内排序和读层选择均从注意力机制中导出,无明显的推导错误或不合理假设。视频覆盖奖励采用平方根形式([SCORING_SOURCE_20/36]),虽具工程直观性但未提供深层理论解释,不过不影响整体逻辑严密性。
实验充分性 (1.0/1.5):实验覆盖四类不同模态偏好的基准和三个骨干模型([SCORING_SOURCE_12/36],[SCORING_SOURCE_14/36]),包含组分消融、Pareto 效率对比及跨 backbone 迁移([SCORING_SOURCE_36/36])。但基线仅聚焦训练无关方法([SCORING_SOURCE_12/36]),未纳入训练式压缩方法的上限讨论;主要准确率结果未提供误差条或假设检验([SCORING_SOURCE_20/36]),统计稳健性证据不足。
清晰度 (0.9/1):主线方法以清晰的四步流程呈现([SCORING_SOURCE_9/36]),附录提供完整的算法伪代码、校准细节和消融热图([SCORING_SOURCE_19/36]-[SCORING_SOURCE_29/36])。文字表述准确,但部分诊断图表(如 PCA)的说明可更精炼。
影响力 (1.2/1.5):针对音视频全模态模型的训练无关压缩问题,提出了可直接嵌入现有解码器的分配-排序接口([SCORING_SOURCE_15/36]),在 Qwen2.5-Omni 和 OmniVinci 上以更低的 token 保留率和 FLOPs 实现了对 OmniZip 等方法的 Pareto 超越([SCORING_SOURCE_14/36])。对音视频理解领域的推理效率提升具有即时参考价值,且音频并非次要模态,符合领域影响力要求。
开源 (0.5/1.5):论文明确承诺未来开放核心产物,但当前尚未发布可用代码、模型权重或数据资源。
可复现性 (0.5/0.5):论文给出了完整的算法伪代码(Table 8)、每模型规模的超参数表格(Table 7)、FLOPs 计算协议([SCORING_SOURCE_34/36])、硬件环境和校准集选定过程([SCORING_SOURCE_18/36]),未依赖训练或随机种子,复现所需信息充分。
工程/实践价值 (1.2/1.5):仅需单次前向传播且不改动模型权重,端到端延迟和峰值内存均低于更高保留率的 OmniZip([SCORING_SOURCE_14/36] Table 3),实用部署价值显著。但容量份额和读层需要针对模型手工校准,缺乏输入自适应机制,限制了‘即插即用’的便捷性。
🚨 局限与问题
论文明确承认的局限:
- 方法专门针对使用共享解码器的音频-视频 OmniLLMs 设计,其在其他多模态融合架构上的表现和适配是未来工作。
- 当前方法使用预先设定的、固定的容量份额和读层,缺乏根据输入复杂度和多模态内容动态调整的机制。
- 其他模态组合(如文本-图像)和更多 backbone 模型族的拓展属于自然延伸,尚未被探索。
审稿人发现的潜在问题:
- 超参数敏感性与泛化风险:虽然论文声称超参数在开发集上选定后可跨 benchmark 冻结,但
α这一核心参数的本质是调整音视频容量分配。在附录 D.4 的α灵敏度分析中,其在 20%-40% 区间内性能相对稳定,但切换到分布差异巨大的数据集(如极长的纯音频或纯视频)时,固定的α值大概率不是最优的。这并非完全的“freeze-and-forget”,部署时需要对此有清晰认知。 - 视频覆盖奖励的工程属性:覆盖奖励的平方根形式(
bonus = λ_c / sqrt(n_c + 1))是一个有效的工程技巧,但其形式和强度(λ_c)的选择缺乏理论支撑和跨数据集的鲁棒性验证,更像是一种基于直觉的超参数。 - 基线比较的广度:实验虽然包含了 OmniZip, FastV, DASH 等代表性方法,但主要聚焦于训练无关的剪枝或合并方法。对于可能达到更高性能的训练式压缩方法(如学习哪些 token 应被丢弃),文中并未将其作为 Upper bound 进行讨论或比较,这使得 “SOTA” 的声称范围不够明确。
- 诊断的深度:论文的机制诊断主要聚焦于注意力质量(mass)的分配偏向,成功地识别并解决了容量分配问题。但这可能并非耦合的全部,更复杂的语义层面耦合(例如,跨模态 token 互为关键上下文,其存在与否会动态改变彼此的相对重要性),在当前框架下并未被深入探讨或解决。