📄 OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
标签:#音视频问答 #模型压缩 #音频理解 #Transformer #模型评估
8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5
🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频问答 | #模型压缩 | #音频理解 #Transformer | arxiv
👥 作者与机构
- 第一作者:Jinsen Su(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院)
- 通讯作者:Xiaowu Zheng(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院)
- 作者列表:Jinsen Su(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院)、Yongdong Luo(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院、阿里巴巴集团)、Yuexiao Ma(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院、厦门大学信息学院)、Yibo Hu(阿里巴巴集团)、Meiguang Jin(阿里巴巴集团)、Xiaowu Zheng(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院)
💡 毒舌点评
这篇论文找到了一个很好的切入点:全模态压缩中不该让一个模态去指导另一个,因为音视频对同一个查询的“高光时刻”往往不同步。Attention可视化加相关性分布统计的Motivation做得扎实,直接命中了OmniZip等现有方法的软肋。不过,架构上对CLIP作为外部视觉评分器的依赖是最大的硬伤——明明音频侧可以复用模型内部表征做查询感知评分,视觉侧却要额外跑一个ViT-L,推理延迟在短生成场景下完全无法忽略。如果能用模型自身的视觉编码器替代CLIP,这篇工作的实用价值会再上一个台阶。
📌 核心摘要
- 要解决什么问题:全模态大语言模型(OmniLLMs)在推理时面临音频和视频token序列过长导致的严重计算与内存开销问题。现有压缩方法依赖一个模态去指导另一个模态的压缩(单向跨模态指导),但音频和视频对同一查询的显著性峰值常常不同步,导致高压缩比下关键信息被错误丢弃。
- 方法核心是什么:提出了OmniScope,一个免训练的模态解耦token压缩框架。它以查询文本作为共享语义锚点,独立评估视频和音频token的查询相关性并分配压缩预算。视觉侧采用Anchor-Delta时空压缩(AD-STC),音频侧采用逐秒token合并。
- 与已有方法相比新在哪里:首次明确识别并量化了跨模态显著性失配现象——在1,197个查询-视频对上,约78.3%的样本中音视频显著性呈弱相关。基于此提出了模态解耦的压缩原则,用独立评分替代了现有方法的单向跨模态指导策略。
- 主要实验结果如何:在4个音视频理解基准(WorldSense、DailyOmni、OmniVideoBench、Video-MME)、2个Qwen2.5-Omni模型尺度(7B和3B)上,OmniScope在所有压缩比下平均准确率最高。45% token保留率下几乎无损(7B模型甚至超过Full基线0.30个点),25%保留率下仅下降0.35个点(7B),同时实现最高3.53倍预填充加速和超15% GPU内存节省。
- 实际意义是什么:为OmniLLM的高效推理提供了一条简单有效的设计原则:跨模态共享查询但不共享显著性估计。方法免训练、即插即用,可直接集成到现有OmniLLM推理管线中。
- 主要局限性是什么:视觉侧依赖外部CLIP模型引入固定一次性延迟,影响短生成场景的端到端速度,且模型内部视觉-文本对齐尚不足以替代;仅适配Qwen2.5-Omni系列,对其他OmniLLM(如VITA-1.5)的泛化性未验证;AD-STC中切换阈值τr的选择虽在附录E中展示了鲁棒性,但缺少理论依据或自适应机制。
🔗 开源详情
- 代码:https://github.com/MAC-AutoML/OmniScope (论文摘要中声明代码已开源)
- 模型权重:论文未提供单独训练的模型权重。实验基于开源的 Qwen2.5-Omni(7B 和 3B)模型,可通过其官方渠道(https://github.com/QwenLM/Qwen2.5-Omni)获取。
- 数据集:论文使用四个公开基准数据集:WorldSense、DailyOmni、OmniVideoBench、Video-MME。论文中未提供上述数据集的独立下载链接,数据集具体获取方式需参见各自原始论文或主页。
- Demo:论文中未提及。
- 复现材料:论文附录B给出了全部超参数配置,所有实验均使用该固定配置。未提供额外的复现配置文件或checkpoint。
- 论文中引用/使用的开源项目:
- CLIP (ViT-L/14@336px):https://github.com/openai/CLIP
- Qwen2.5-Omni:https://github.com/QwenLM/Qwen2.5-Omni
- FlashAttention-2:https://github.com/Dao-AILab/flash-attention
- Token Merging (ToMe):https://github.com/facebookresearch/ToMe
- FastV:https://github.com/PKU-YuanGroup/FastV
- OmniZip:文中为第三方工作,链接指向作者团队GitHub组织(https://github.com/MAC-AutoML/OmniZip)
🏗️ 方法概述和架构
OmniScope是一个免训练、查询感知的全模态token压缩框架。系统按三个串行阶段运行:模态独立的Query-Aware Scoring、Token Budget Allocation、以及模态特化的压缩操作(Vision Pruning与Audio Merging)。核心设计原则是将查询作为共享语义锚点,但让视觉和音频各自独立评估重要性并分配预算,摒弃了现有方法中一个模态指导另一个模态的压缩模式。
第一阶段:Query-Aware Scoring 该阶段为视频和音频模态独立计算每个时间位置的查询相关性得分,是整个框架的基石。视觉侧,系统在OmniLLM推理管线外独立运行CLIP ViT-L/14编码器。对视频帧和查询文本分别提取特征后,通过余弦相似度 \(\frac{f_I^{(t)} \cdot f_Q}{\lVert f_I^{(t)} \rVert_2 \lVert f_Q \rVert_2}\) 计算帧级重要性分数 \(s_v^{(t)}\)。论文中解释了选择外部CLIP而非复用OmniLLM内置视觉编码器的原因:模型内部的视觉-文本对齐尚不足以支持可靠评分(附录D的消融实验证实,3B模型上用内部嵌入替代CLIP导致平均准确率下降约0.93个点)。
音频侧,系统直接复用OmniLLM自身音频编码器的输出嵌入。由于这些嵌入经过投影层后已映射到LLM的嵌入空间,可直接计算音频token与查询文本token的相似度。具体流程为:将LLM嵌入层编码的查询词元嵌入 \(E_Q \in \mathbb{R}^{L \times D}\) 的L2范数作为门控信号——高范数对应信息量大的实词,低范数对应功能词。对每个查询token计算门控值 \(g_j = \frac{\|E_Q^{(j)}\|}{\max_k \|E_Q^{(k)}\|}\),然后计算门控跨模态相似度矩阵 \(S_{ij} = \bar{z}_a^{(i)} \cdot \bar{e}_Q^{(j)}\),经softmax聚合后得到逐token得分 \(s_{audio}^{(i)}\)。得分以每秒为粒度聚合(取每秒内top-k token得分的均值),并对高分秒位周边位置进行衰减增强:以公式 \(\hat{s}_a^{(s)} \leftarrow \hat{s}_a^{(s)} \cdot \max_{s' \in \mathcal{H}, 0<|s-s'|\leq R} \left(1 + (\beta-1) \cdot \gamma^{|s-s'|}\right)\) 将高分秒位的部分得分传播至邻近秒位,以避免音频上下文信息的丢失。
第二阶段:Token Budget Allocation 基于第一阶段得到的帧级视觉得分和秒级音频得分,系统以模态解耦的方式分配压缩预算。给定全局保留率 \(1-\rho\)(视觉和音频的压缩比 \(\rho_v\) 和 \(\rho_a\) 独立配置,如45%保留率对应 \(\rho_v=0.6, \rho_a=0.25\)),各位置的保留token数量按得分占比按比例分配:\(n_{keep}^{(i)} = \lfloor \frac{s^{(i)}}{\sum_j s^{(j)}} \cdot N^{budget} + 0.5 \rfloor\)。这意味着查询相关性高的时间位置将获得更多的token保留预算。
第三阶段:Vision Pruning (AD-STC) 该模块解决视频帧内具体保留哪些token的问题,核心思想是将帧交替定义为Anchor帧(偶数索引)和Delta帧(奇数索引),赋予不同的保留策略。Anchor帧的目标是捕获当前时刻的核心空间语义。采用DPC-KNN方法计算每个token的局部密度 \(d_i = \frac{1}{k} \sum_{h_j \in \text{KNN}(h_i)} \text{sim}(h_i, h_j)\),保留密度最低(即与近邻最不相似、空间上最独特)的token,确保全局空间覆盖。Delta帧的目标是捕获相对前一Anchor帧的信息增量,且根据当前帧的保留率 \(r = n_{keep}^{(t)} / n_{total}\) 自适应切换评分策略。当 \(r \geq \tau_r\)(高预算,\(\tau_r=0.4\))时,使用联合时空不可替代性分数:乘积 \(\text{replaceability}_i = \alpha_i^{\text{intra}} \times \alpha_i^{\text{inter}}\),其中 \(\alpha_i^{\text{intra}} = \max_{j \neq i} \text{sim}(h_i, h_j)\) 度量空间冗余度,\(\alpha_i^{\text{inter}} = \max_l \text{sim}(h_i, h_l^{\text{prev}})\) 度量时间冗余度;仅当token在两个维度上都可被高度替代时才丢弃,确保高预算下时空覆盖的均匀性。当 \(r < \tau_r\)(低预算)时,仅用帧间差分强度(与前一Anchor帧同位置的余弦不相似度)筛选变化最剧烈的局部区域,将有限预算集中于密集的时间增量,避免信息破碎化。
第四阶段:Audio Token Merging 音频侧不丢token,而是融合冗余token。利用音频信号的短时平稳性,在每个一秒段内将token按奇偶索引分为源集和目的集,计算相似度矩阵后进行二分软匹配,将最相似的源token合并到对应目的token中(特征取平均),多次迭代直至达到目标token数。这相比直接丢弃token,既去冗余又保持了完整的时间覆盖。
💡 核心创新点
- 模态解耦压缩范式:通过注意力可视化(图2,压缩后跨窗口注意力显著增强)和相关性分布统计(图7,\(\approx\)78.3%样本中音视频显著性弱相关)首次深入分析并量化了跨模态显著性失配问题,据此提出“查询作为共享锚点但显著性估计独立进行”的设计原则,从机理上解决了现有单向跨模态指导方法在高压缩比下的关键信息丢失问题。
- Anchor-Delta时空视觉压缩(AD-STC):将视频帧交替赋予Anchor和Delta角色,Anchor通过DPC-KNN保留空间上最独特的token以确保全局语义覆盖,Delta专注于捕获时间增量。Delta帧内进一步根据保留率自适应切换评分策略:高预算时用联合时空不可替代性分数(乘积形式,必须空间和时间双重冗余才丢弃),低预算时聚焦帧间差分最强区域。交替机制和自适应切换的结合在消融实验中被充分验证——All Anchor或All Delta均导致\(\geq\)1.1个点的性能下降。
- 免训练查询感知音频评分机制:巧妙利用OmniLLM自身的音频嵌入和LLM词嵌入空间的对齐关系,通过词嵌入范数门控(引用自EMNLP工作的结论:高范数对应高信息量实词)实现查询感知评分,无需引入外部音频-文本模型(如CLAP,因其粒度太粗不适用)。这一设计体现了对OmniLLM内部表征空间的深入理解。
- 逐秒二分软匹配合并的音频压缩:利用音频信号的短时平稳性,在编码器后对时域嵌入以秒为单位进行二分软匹配合并,相比现有方法在更细粒度上融合冗余信息而非直接丢弃,消融实验中显著优于随机丢弃、能量过滤(\(\Delta=-2.75\)点)等方法。
📊 实验结果
论文在四个音视频理解基准上验证了方法有效性。完整实验结果如表1所示:
| Method | Ratio | WorldSense | DailyOmni | OmniVideoBench | Video-MME | Avg. | Δ to Full |
|---|---|---|---|---|---|---|---|
| Qwen2.5-Omni-7B | |||||||
| Full Tokens | 100% | 46.0 | 62.0 | 34.1 | 63.3 | 51.35 | − |
| Random | 45% | 44.7 | 58.7 | 34.2 | 63.3 | 50.23 | −1.12 |
| FastV (A&V) | 45% | 45.8 | 59.5 | 35.8 | 63.4 | 51.13 | −0.22 |
| OmniZip | 45% | 45.7 | 60.0 | 35.6 | 63.3 | 51.15 | −0.20 |
| OmniScope (Ours) | 45% | 46.3 | 60.5 | 35.5 | 64.3 | 51.65 | +0.30 |
| Random | 25% | 44.9 | 56.9 | 34.9 | 62.4 | 49.78 | −1.57 |
| FastV (A&V) | 25% | 44.7 | 58.4 | 35.6 | 63.4 | 50.53 | −0.82 |
| OmniZip | 25% | 44.8 | 57.8 | 33.7 | 62.9 | 49.80 | −1.55 |
| OmniScope (Ours) | 25% | 45.7 | 58.8 | 35.8 | 63.7 | 51.00 | −0.35 |
| Qwen2.5-Omni-3B | |||||||
| Full Tokens | 100% | 46.1 | 60.7 | 32.7 | 61.1 | 50.15 | − |
| Random | 45% | 44.1 | 57.6 | 32.4 | 60.9 | 48.75 | −1.40 |
| FastV (A&V) | 45% | 44.2 | 59.7 | 33.0 | 61.2 | 49.53 | −0.62 |
| OmniZip | 45% | 45.4 | 59.1 | 33.2 | 61.1 | 49.70 | −0.45 |
| OmniScope (Ours) | 45% | 46.1 | 59.3 | 33.2 | 62.1 | 50.18 | +0.03 |
| Random | 25% | 42.5 | 55.7 | 31.7 | 59.8 | 47.43 | −2.72 |
| FastV (A&V) | 25% | 42.9 | 55.8 | 32.8 | 60.4 | 47.98 | −2.17 |
| OmniZip | 25% | 44.0 | 56.6 | 33.1 | 59.4 | 48.28 | −1.87 |
| OmniScope (Ours) | 25% | 44.5 | 56.9 | 33.1 | 60.1 | 48.65 | −1.50 |
此外,论文附录A提供了WorldSense按八个领域细分的完整结果(表6),OmniScope在大多数领域上保持竞争力,且在25%高压缩比下未见OmniZip在特定领域(如Performance、Games)的急剧下降现象。
关键消融实验(Qwen2.5-Omni-3B, \(\rho_v=0.6, \rho_a=0.25\),表3/4/5):
- Query-guided scoring消融:对音视频同时采用均匀压缩导致平均准确率下降1.65点(WorldSense + DailyOmni平均);单独对视觉或音频做均匀压缩也均有明显下降;四种跨模态指导变体(Audio-guide Visual、Visual-guide Audio及它们的逆向版本)性能均不及模态解耦方案(分别下降0.30至1.10点),直接验证了模态解耦的必要性。
- 视觉策略消融:All Anchor或All Delta分别下降1.10和1.65点;Delta帧仅用时间差分或仅用不可替代性分数也均低于自适应切换策略(分别下降0.55和0.75点)。
- 音频策略消融:能量过滤性能最差(下降2.75点),验证了声学响度不等于语义重要性;随机丢弃次之(-0.95点);均匀采样和平均池化优于丢弃方法;逐秒token合并最优。
- 视觉评分策略消融(附录D):用OmniLLM自身视觉嵌入替代CLIP,7B下降约0.47点,3B下降约0.93点,证明大模型内部对齐较好但仍不及CLIP,且小模型的差距更明显,这直接支撑了视觉侧必须依赖CLIP的设计决策。
- AD-STC阈值敏感性(附录E):\(\tau_r\)在0.2-0.6范围内性能曲线呈倒U形,中间区域最优带宽较宽,方法对阈值选择具有鲁棒性。
效率分析(WorldSense,表2):
- 7B模型45%保留率:GPU内存从28.31GB降至25.14GB,预填充时间从6299ms降至2195ms(2.87倍加速)。
- 7B模型25%保留率:GPU内存降至24.00GB,预填充时间降至1784ms(3.53倍加速)。
- 值得注意的是,OmniScope的GPU内存始终低于OmniZip和FastV,且论文解释了原因:OmniScope音频评分复用推理过程中已生成的嵌入,不引入额外内存开销;而OmniZip需提取完整注意力矩阵,其内存开销随音频长度二次增长。
- 端到端延迟方面,OmniScope在45%保留率下为5.284s(7B),高于OmniZip的4.508s和FastV的4.584s,原因是CLIP视觉评分引入了固定一次性开销。但附录C的分析显示,该开销占比从生成1 token时的约13%降至生成100 token时的约7%,在长生成场景下逐渐摊还。
🔬 细节详述
- 训练数据:免训练方法,无训练数据需求。视觉评分器使用预训练CLIP ViT-L/14@336px,音频评分器使用Qwen2.5-Omni内置音频编码器。
- 损失函数:无训练过程,无损失函数。
- 训练策略:无训练,无需学习率、warmup、优化器等配置。
- 关键超参数(固定,未做per-dataset tuning,详见附录B表7):
- 音频评分:温度 \(\tau=0.05\),top-k聚合=5,邻居增强参数 \(\beta=1.5, \gamma=0.5, R=3, P=80\)
- AD-STC:切换阈值 \(\tau_r=0.4\),DPC-KNN近邻数 \(k=5\)
- 压缩配置:45%保留率对应 \(\rho_v=0.6, \rho_a=0.25\);25%保留率对应 \(\rho_v=0.8, \rho_a=0.35\)
- 视频输入统一上限:128帧
- 训练硬件:无需训练硬件。推理硬件:未明确说明型号,所有实验启用FlashAttention-2。
- 推理细节:预填充与解码分离分析;QA任务生成较短,解码开销小。CLIP视觉评分引入固定一次性开销,占比随生成长度增加而递减。OmniScope音频评分复用推理中已生成的嵌入,无额外内存开销。
- 正则化或稳定训练技巧:未说明。
⚖️ 评分理由
创新性 (1.5/2):[A_SUMMARY][A_METHOD] 首次量化了约78.3%的跨模态显著性失配,提出模态解耦压缩范式,并设计了Anchor-Delta时空视觉压缩和查询感知音频评分等组件,新意显著。
技术严谨性 (1.2/1.5):[A_LIMITS] AD-STC的Delta帧仅与前一个Anchor帧比较,可能对缓慢持续变化形成时序盲区,算法假设存在局限性;其他部分设计合理,未发现重大推导错误。
实验充分性 (1.0/1.5):[A_LIMITS] 仅验证Qwen2.5-Omni系列,未跨架构泛化;缺少与DyCoke等视频专用压缩方法的对比;未消融音频评分的范数门控;没有多次运行方差或统计检验;效率分析缺少长视频实测、吞吐量和KV cache数据。
清晰度 (0.8/1):[S_HEAD][S_MIDDLE] 动机、方法和实验流程表达清晰,图表辅助理解;个别术语和模块交互需读者对Qwen底层有一定了解,但不影响整体可读性。
影响力 (0.8/1.5):[A_SUMMARY] 提出的模态解耦原则为OmniLLM高效推理提供了简单有效的设计思想,免训练即插即用;但受限于单一架构,泛化影响尚未证实。
开源 (1.5/1.5):[A_OPEN] 代码已完整开源,实验基于开源的Qwen2.5-Omni模型且可公开获取,论文附录提供了全部固定超参数,核心产物文档完整。
可复现性 (0.3/0.5):[A_RESULTS][A_OPEN] 论文给出了完整的固定超参数、压缩配置和模型设定,但未明确推理硬件型号,复现时需自行推断,属于大部分充分但少量缺失。
工程/实践价值 (1.2/1.5):[A_RESULTS][A_LIMITS] 实现最高3.53倍预填充加速和超15% GPU内存节省,免训练可直接集成;但CLIP视觉评分引入固定延迟,在短生成场景中影响端到端速度。
🚨 局限与问题
论文明确承认的局限:
- CLIP视觉评分引入固定一次性延迟,在短生成场景(如QA)中影响端到端速度。
- OmniLLM内部视觉-文本对齐不足以用于可靠评分,因此视觉侧必须依赖外部模型(附录D验证了内部嵌入替代CLIP在3B模型上导致约0.93点下降)。
审稿人发现的潜在问题:
- 泛化性存疑:整个框架仅在Qwen2.5-Omni的两个尺度上验证。Qwen2.5-Omni采用time-window interleaving机制组织音视频token,该方法在VITA-1.5、GPT-4o风格架构(如果存在开源近似)等其他OmniLLM上是否同样有效?模态解耦原则是否是通用真理,还是特定于某种token组织方式的经验规律?缺少跨架构证据是一大遗憾。
- 音频评分的词嵌入范数门控假设未在本任务上严格验证:方法引用了一篇EMNLP 2023工作(Norm of word embedding encodes information gain)来论证嵌入范数编码信息量,并将此结论直接用于音频-查询的跨模态门控。但该结论是在纯文本LLM上得出的,迁移到音频嵌入(经过声学编码和投影层映射后的表征)空间的适用性缺少本论文内的经验消融证据。例如,可以设计一个消融去掉范数门控(即直接用均匀权重聚合相似度),来验证门控机制的实际贡献。
- AD-STC的交替帧设计存在时序盲区:Delta帧永远只和相邻的前一个Anchor帧求差。如果一个缓慢但持续运动跨越多个delta帧(例如Anchor→Delta1→Delta2→Delta3→Anchor),Delta2和Delta3的帧间差分可能都很小(因为累积变化分摊到了多个帧上),但它们的累积信息增量实际上是显著的。这种架构假设可能导致对缓慢持续变化的系统性低估。
- 对比基线过窄:缺少与视频专用token压缩方法(如DyCoke、PruneVid、HoliToM)的对比。虽然这些方法不处理音频,但可以联合一个独立的音频压缩基线(如ToMe或本文的音频合并模块)进行比较,以解析视觉压缩部分的质量。论文中提及了这些方法(在相关工作中),但未在实验中对标,削弱了视觉压缩策略的说服力。
- 效率分析不完整:仅报告了预填充加速和GPU内存节省,缺少KV cache大小的定量分析、吞吐量(tokens/s)的评估、以及长视频场景下的缩放性测试。论文虽在文字中声称OmniScope的音频评分无额外内存开销、在长视频场景有优势,但并未给出长视频场景的实测数据来支撑这一论断(例如在>10分钟视频上的性能、内存和延迟表现)。
- 45%保留率下7B模型超过Full基线(+0.30点)需审慎解释:论文将此归因于token压缩增强了跨窗口注意力交互、使模型能更好地利用任务相关线索(Fig.2的分析支撑了这一假说),但0.30点的提升处于统计噪声范围内,不宜过度解读为“压缩反而提升了性能”。建议作者提供统计显著性检验或多次运行的方差分析。