📄 OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

#音视频问答 #模型压缩

7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5

7.1/10 | 前50% | #音视频问答 | #模型压缩 | arxiv

👥 作者与机构

  • 第一作者(共一):Yue Ding(中国科学院自动化研究所模式识别国家重点实验室;快手科技Kling团队)与 Yiyan Ji(南京大学)
  • 通讯作者:Qiang Liu(中国科学院自动化研究所模式识别国家重点实验室)
  • 作者列表:Yue Ding(中科院自动化所;快手科技)、Yiyan Ji(南京大学)、Jungang Li(香港科技大学(广州))、Xuyang Liu(四川大学)、Xinlong Chen(中科院自动化所)、Junfei Wu(中科院自动化所)、Bozhou Li(北京大学)、Bohan Zeng(北京大学)、Yang Shi(北京大学)、Yushuo Guan(快手科技)、Yuanxing Zhang(快手科技)、Jiaheng Liu(南京大学)、Qiang Liu(中科院自动化所)、Pengfei Wan(快手科技)、Liang Wang(中科院自动化所)

💡 毒舌点评

这篇论文的“视觉先行、再引导音频”两阶段压缩,直觉干净,实验也漂亮——35% tokens就能战平甚至略超 full-token baseline,效率提升显著。但自信别太早:核心实验全在 Qwen2.5-Omni 上跑,换到 Qwen3-Omni 马上掉点(DailyOmni 70.5 vs. 70.8 full),说明方法的普适性没那么神。STVP 那套“按位置算余弦距离就当时间显著性”的操作,本质上仍在像素级做差分,真正的物体运动、遮挡这些时序动态它根本没建模,却好意思标榜“temporal redundancy”处理。Chunk 级剪枝更是直接摆烂,跨 chunk 长程依赖直接放弃,这可是 long-form 理解的基本盘。想法好、工程值钱,但别急着说自己是范式开创者。

📌 核心摘要

本文瞄准 Omni-LLM 处理音视频时因 token 序列过长导致的计算瓶颈,提出模态非对称压缩框架 OmniSIFT。其核心直觉是:人类感知中视觉主导,音频重要性高度依赖视觉语义锚点——因此应先压缩视频以提取视觉主干,再以此引导音频 token 的筛选。方法分两阶段:(1) 空时视频剪枝模块(STVP)在 2 秒 chunk 内,利用帧内余弦距离(空间显著性)和帧间对应位置余弦距离(时间显著性)分别打分,独立剪除冗余的视觉 patch;(2) 视觉引导音频选择器(VGAS)用单层交叉注意力让压缩后的视觉 token 指导音频 token 的显著性评分,并通过直通估计器(STE)实现离散选择操作的可微优化,从而端到端训练。整个过程仅增加 4.85M 参数。在 Qwen2.5-Omni-7B 上,保留 35% tokens 时,OmniSIFT 在 WorldSense(50.0 vs. full-token 49.7)、DailyOmni(73.2 vs. 72.2)等多个基准上持平或超越 full-token 基线;即使在 25% 极端压缩下,性能依然稳健,远超 OmniZip 等训练免费方案。推理延迟和 GPU 内存也有超 40% 的削减。主要局限是 STVP 仅处理 chunk 内时序,跨 chunk 长程冗余未建模,且实验仅在 Qwen 系列模型上开展。

🔗 开源详情

  • 代码:https://github.com/dingyue772/OmniSIFT(论文声明可用,但未确认仓库内容完整性)
  • 模型权重:论文未提及
  • 数据集:训练基于 AVoCaDO SFT 数据集(参考 Chen et al., 2025b),未提供下载链接或详细统计;评测使用 Video-MME、DailyOmni、WorldSense、OmniVideoBench、video-SALMONN-2 五个公开基准
  • Demo:未提及
  • 复现材料:除代码仓库外,未提供预训练检查点、训练日志或除附录 B 超参之外的附加材料。附录 B 给出了输入采样率、分辨率等配置。

🏗️ 方法概述和架构

OmniSIFT 是一个两阶段、端到端可微的 token 压缩 pipeline,处理粒度对齐 Qwen2.5-Omni 的 2 秒对齐 chunk。它针对“视觉冗余源于帧内结构和帧间重叠,而音频重要性依赖视觉语境”的非对称特性设计,流程如下:

整体数据流(见图 3): 视频/音频输入 → 各自编码器与投影器 → 每个 chunk 内,首先由 STVP 模块压缩视觉 token,输出压缩后的视觉锚点;随后 VGAS 模块以这些视觉锚点为 K/V,以完整音频 token 为 Q,通过交叉注意力对音频 token 评分并 Top-K 选择 → 压缩后的多模态 token 序列送入 LLM 骨干。整个框架通过 STE 绕过 Top-K 的不可微性,从 LLM 损失反向传播梯度。

第一阶段:空时视频剪枝(STVP)

  • 输入:当前 chunk 的两个连续帧的 token 序列,形状 \((n_p, D)\)。
  • 空间显著性估计:对第一帧,先均值池化得全局表征 \(\bar{v}_1\),然后每个 patch token \(v_{1,i}\) 与之计算余弦距离 \(s_{1,i} = 1 - \cos(v_{1,i}, \bar{v}_1)\)。距离越大,表示该 patch 与全局背景差异越大,信息量越高。
  • 时间显著性估计:利用位置编码,将第二帧的每个 patch token \(v_{2,i}\) 与第一帧对应位置 token \(v_{1,i}\) 匹配,直接计算两者间的余弦距离 \(s_{2,i} = 1 - \cos(v_{2,i}, v_{1,i})\)。距离越大,表示该区域发生了运动或变化。
  • Top-K 选择:给定视觉保留率 \(\alpha_v\),每帧独立选出得分最高的 \(\hat{n}_p = \alpha_v n_p\) 个 token,其余丢弃。整个操作在 chunk 内完成,线性复杂度。
  • 设计动机:受 VidCom2(帧内空间冗余)和 TimeChat-Online(帧间时间冗余)启发,认为背景相似区域和静态度变化的 patch 对下游任务贡献甚微。

第二阶段:视觉引导音频选择器(VGAS)

  • 输入:当前 chunk 的完整音频 token 序列 \(Z_a\)(\(n_a \times D\))和 STVP 输出的压缩视觉序列 \(\hat{Z}_v\)(\(\hat{n}_v \times D\))。
  • 视觉上下文化:采用 8 头、内部维度 512 的单层交叉注意力,以音频 token 为 \(Q_a\),视觉 token 为 \(K_v, V_v\),计算 \(H_a = \text{Softmax}(Q_a K_v^T / \sqrt{d}) V_v\)。这使每个音频 token“感知”当前视觉场景的语义锚点,突出与视觉相关的声学特征。
  • 残差连接:\(\tilde{H}_a = H_a + Z_a\),保留原始声学信息避免视觉过度覆盖。
  • 显著性评分:\(\tilde{H}_a\) 经两层 MLP(512维隐藏)和 Sigmoid 激活,为每个音频 token 输出标量得分 \(s_{a,j} \in (0,1)\),表示其在当前视觉语境下的重要性。
  • Top-K 选择与 STE 端到端训练:给定音频保留率 \(\alpha_a\),前向时生成二值 mask 保留 Top-K 音频 token;反向时使用恒等近似梯度 \(\partial m_j / \partial s_{a,j} \approx 1\),使梯度直接流向显著性得分,无需暴露 FlashAttention 内部 attention score。
  • 参数量:所有新增组件合计 4.85M(< 0.1% 的 7B 骨干)。

关键设计权衡:

  1. 模态非对称 vs. 对称:OmniZip(音频引导视频)和 DyCoke(独立压缩)都假设两模态同等重要,而 OmniSIFT 坚持“视觉显著性可独立于音频估计,但音频重要性必须视觉确认”。消融实验显示,音频引导视觉的对称变体在 35% 保留率下性能显著低于 OmniSIFT(DailyOmni 70.5 vs. 73.2)。
  2. 轻量模块 vs. 深度压缩:仅用单层交叉注意力而非多层 LLM 解码器(如 EchoingPixels 的 4 层额外层),保证推理延迟甚至低于训练免费的 OmniZip(2.86s vs. 2.89s),实现可学习压缩的实用化。
  3. Chunk 级 vs. 全局压缩:仅在 2 秒 chunk 内操作,避免平方级复杂度,但牺牲了对跨 chunk 长程时序依赖的建模。

💡 核心创新点

  1. 模态非对称压缩范式:首次在 Omni-LLM token 压缩中明确设计并验证“视频先行、视觉引导音频”的非对称 pipeline。消融实验证实,相比 OmniZip 式的对称训练版本,该设计在所有保留率下均有显著优势(如 25% 时 DailyOmni 72.5 vs. 68.8)。
  2. 双粒度视频空时剪枝:将视频冗余解耦为帧内空间相似性(基于全局背景的余弦距离)和帧间时间不变性(基于对应位置 patch 的余弦距离)两个独立维度,分别打分。消融显示移除任一分均导致性能下降(WorldSense:移除空间 46.9、移除时间 47.1、完整 50.0)。
  3. 视觉引导的音频 SALIENCY 估计器:用单层交叉注意力让压缩视觉 token 指导音频 token 的重要性判断,并以 STE 实现端到端训练。相比纯音频自注意力选择器,DailyOmni 提升 3.9%,WorldSense 提升 2.9%,且不依赖特定算子的 attention score 暴露,兼容性更强。
  4. 超轻量可学习压缩:4.85M 参数即实现可训练压缩,推理延迟低于训练免费的 OmniZip。证明“小容量、位置恰当”的模块远优于“大容量但位置错误”的设计(如增加选择器深度反而掉点)。

📊 实验结果

主实验(Table 1):在 Qwen2.5-Omni-7B 和 3B 上,35% 和 25% 两个 token 保留率下进行全面对比。

方法保留率(%)WorldSense (↑)OmniVideoBench (↑)VideoMME Short (↑)VideoMME Medium (↑)VideoMME Long (↑)VideoMME Avg. (↑)video-SALMONN-2 Miss (↓)video-SALMONN-2 Hal (↓)video-SALMONN-2 Total (↓)DailyOmni (↑)
Full Tokens10049.735.678.966.957.167.629.119.048.172.2
OmniZip3548.935.177.167.056.066.734.120.054.167.7
Random3548.333.477.268.156.667.333.219.953.166.3
DyCoke3548.634.478.768.056.967.932.620.152.767.9
OmniSIFT3550.035.679.067.958.068.330.719.850.573.2
OmniZip2548.134.176.466.155.366.035.821.457.266.2
Random2547.132.677.066.155.166.136.220.756.965.2
DyCoke2548.134.176.466.255.065.935.320.056.364.7
OmniSIFT2549.935.478.667.858.368.230.920.351.272.5
Full Tokens10045.833.576.163.452.964.232.820.853.667.0
OmniZip3544.133.774.763.853.163.536.922.259.164.7
Random3545.533.474.361.652.162.737.021.758.762.9
DyCoke3545.332.873.762.753.763.336.921.658.563.2
OmniSIFT3545.733.776.162.252.863.735.221.856.965.3
OmniZip2543.832.472.761.952.362.339.522.662.164.2
Random2543.333.074.061.950.962.339.322.662.061.2
DyCoke2544.133.073.362.351.962.540.221.761.961.7
OmniSIFT2545.833.175.062.052.163.036.421.958.364.7

细粒度分析(Table 2):在 DailyOmni 的 6 个子类别上,OmniSIFT 在需要精确跨模态时序对齐的困难类别(Event Sequence、AV Event Alignment)上表现稳定,即使在 25% 极端压缩下仍保持或超越 full-token 水平,而 OmniZip 在 Event Sequence 上降至 61.8(7B, 25%)。

方法保留率(%)Event SequenceAV Event AlignmentContext UnderstandingInferenceReasoningComparativeAverage
Full Tokens10066.770.679.276.669.977.172.2
OmniZip3563.763.077.376.659.174.867.7
Random3558.561.877.973.763.274.066.3
DyCoke3561.463.977.975.463.774.867.9
OmniSIFT3566.770.283.178.969.979.473.2
OmniZip2561.859.775.375.460.674.066.2
Random2561.156.778.671.460.173.365.2
DyCoke2557.256.780.074.361.171.064.7
OmniSIFT2566.768.982.577.771.076.372.5
Full Tokens10060.162.278.674.962.274.867.0
OmniZip3560.556.776.672.059.672.564.7
Random3555.954.276.074.360.168.762.9
DyCoke3553.952.579.276.060.172.563.2
OmniSIFT3557.858.877.373.764.869.565.3
OmniZip2557.855.075.370.358.570.064.2
Random2553.354.276.672.055.467.961.2
DyCoke2552.654.674.774.358.069.561.7
OmniSIFT2558.559.775.373.760.670.264.7

效率分析(Table 3):在 WorldSense 上,35% 保留率下,OmniSIFT 的 7B 模型总推理时间从 15097.1s 降至 8756.0s(约 42% 加速),E2E 延迟从 4.94s 降至 2.86s,峰值 GPU 内存从 27.59GB 降至 22.91GB。3B 模型也有类似比例提升。

MethodRetained RatioGPU Mem (GB) ↓Total Time (s) ↓Prefill Lat. (s) ↓E2E Lat. (s) ↓Acc (%) ↑
Full Tokens10027.5915097.14.764.9449.7
OmniZip3522.928886.42.802.8948.9
DyCoke3523.098718.32.752.8547.3
OmniSIFT3522.918756.02.762.8650.0
Full Tokens10018.9111399.43.593.7945.8
OmniZip3514.757750.42.442.5944.1
DyCoke3514.927578.82.392.5343.9
OmniSIFT3514.797596.32.392.5345.7

压缩比率鲁棒性(Figure 4):当音频压缩比 \(\rho_a\) 从 0.3 增至 0.9 时,OmniSIFT 在 WorldSense 上的性能从 ~49.8% 仅微降至 ~49.3%,而 OmniZip 从 48.9% 骤降至 ~44.0%,证实了视觉引导策略对音频压缩的鲁棒性。

消融实验:

  • STVP 结构消融:移除空间分支后 DailyOmni/WorldSense 分别降至 69.4/46.9;移除时间分支降至 69.8/47.1;完整模型 73.2/50.0。
  • VGAS 设计消融:用纯音频自注意力选择器替代后,DailyOmni/WorldSense 分别跌至 69.3/47.1,表明视觉引导是音频选择的核心。
  • 压缩范式消融(Table 4):在所有保留率下,OmniSIFT 的非对称范式均优于 OmniZip 风格的对称训练版本。35% 时 DailyOmni 73.2 vs. 70.5,WorldSense 50.0 vs. 49.7;25% 时差距拉大至 72.5 vs. 68.8。
  • 选择器深度消融:将 VGAS 加深至 3 层交叉注意力反而导致性能下降(VideoMME 68.3→67.2,DailyOmni 73.2→72.3),验证了轻量设计的合理性。
  • 随机剪枝与 SSM 选择器消融(附录 D.4):替换 STVP 为随机视觉剪枝或 VGAS 为随机音频剪枝均大幅掉点;用 SSM 替代交叉注意力选择器亦效果不佳,进一步确认了当前设计的有效性。
  • 自适应预算消融(附录 D.5):采用 VidCom2 风格的自适应视频 token 预算分配并未带来明显收益(DailyOmni 73.2 vs. 71.9),且增加预填延迟,支持了固定预算的实用选择。
  • 替代 VGAS 设计(附录 D.5):直接基于注意力进行音频剪枝或拼接 av token 再打分的方案,性能均不及当前 VGAS 设计。

跨模型迁移实验(附录 D.5):将 OmniSIFT 迁移到 Qwen3-Omni(LoRA 微调),在 DailyOmni 上从 full-token 的 70.8 降至 70.5,WorldSense 从 50.2 降至 48.8,同时带来可观的延迟和内存节省,证明了部分泛化能力但仍有轻微性能退化。

与 FASTAV 对比(附录 D.5):在同等 token 预算下,OmniSIFT 远优于 FASTAV(DailyOmni 73.2 vs. 59.4,WorldSense 50.0 vs. 43.3),凸显了可学习压缩的优势。

🔬 细节详述

  • 训练数据:AVoCaDO SFT 数据集,包含 107K 同步音视频 captioning 对。论文未提供数据集的详细统计(如时长分布、采样策略等)。
  • 损失函数:论文未明确说明。推断为 LLM 骨干的标准 next-token prediction 交叉熵损失,VGAS 模块通过 STE 从该损失接收梯度。
  • 训练策略:
    • 学习率:\(1 \times 10^{-5}\)
    • Batch size:128(总数,未提梯度累积)
    • 优化器:未提及(原文无指定)
    • Warmup 策略、训练轮数、学习率调度:均未提及
    • 微调范围:仅 LLM decoder 和 VGAS 模块,视觉及音频编码器冻结
  • 关键超参数:
    • VGAS:8 头交叉注意力,内部维度 512,2 层 MLP(Sigmoid 输出)
    • Chunk 时长:2 秒(与 Qwen2.5-Omni 对齐)
    • 视频采样:2 FPS,最多 256 帧,空间分辨率最大 320 × 28 × 28
    • 压缩比配置:35% 总保留率下 \(\rho_a = 0.4, \rho_v = 0.67\);25% 下 \(\rho_a = 0.5, \rho_v = 0.77\)。各基线的具体分配见论文 Table 6,均校准以确保实际保留的 token 数一致。
  • 训练硬件:未提及 GPU 型号、数量、训练时长。
  • 推理细节:WorldSense 效率测试的总时间 15097.1s(7B)和 11399.4s(3B)表明批量处理了大量样本,但解码策略(贪心/采样/temperature 等)未说明。QA 任务使用统一的 VideoMME 风格多选题 prompt(见论文 Figure 7);video-SALMONN-2 captioning 采用 GPT-4.1 作为评判器,评估 Miss、Incorrect、Hallucination 事件计数(prompt 见 Figure 9)。
  • 正则化与稳定训练:未提及任何特殊技巧。
  • 评估细节:论文未报告多次运行的均值/标准差。补充材料提供了 attention 稀疏可视化(Figure 10)及长视频效率扩展分析(Figure 11)。

⚖️ 评分理由

  • 创新性 (1.2/2):提出“视觉主导、音频依赖视觉”的非对称压缩范式,与现有对称/独立方法形成清晰对比。STVP 的双粒度剪枝和 VGAS 的轻量交叉注意力设计合情合理,消融实验证实了组件有效性。但核心直觉(视觉引导音频)在跨模态学习中并不全新(如 Look, Listen and Learn),论文对与前驱工作的区分讨论不够深入;chunk 级压缩的理论最优性也缺乏分析。
  • 技术严谨性 (1.0/1.5):方法推导清晰,余弦距离显著性估计与 STE 端到端优化表述规范。然而,STE 仅用恒等近似 \(\partial m / \partial s \approx 1\),未探讨更标准的变体或潜在偏差;压缩比 \(\rho_v, \rho_a\) 的选择依赖“经验评估”,未给出系统搜索或理论指导;STVP 在处理快速场景切换、相机运动时的失败模式也未分析。
  • 实验充分性 (1.2/1.5):覆盖 5 个音视频基准,含长短时序 QA 和 captioning,消融实验维度全面(模块结构、范式、深度、随机替换等),并补充了与 FASTAV 的对比和 Qwen3-Omni 迁移实验。主要扣分点:所有主实验仅在 Qwen2.5-Omni 上进行(3B/7B 为同架构变体),跨架构泛化证据仍较弱——Qwen3-Omni 迁移显示性能微降;未报告多次运行的统计显著性;效率分析中总时间指标含义模糊(可能是批量总时间,但未明确);缺少对静音视频、纯音乐等极端情况的鲁棒性分析。
  • 清晰度 (0.8/1):整体结构清晰,图 2(范式对比)和图 3(架构概览)直观。但训练细节严重缺失:优化器、训练步数、warmup 策略、硬件一概未提,无法复现训练。部分表格指标缩写(如 video-SALMONN-2 的 Miss/Hal/Total)未在正文首次出现时解释,降低了可读性。
  • 影响力 (0.7/1.5):工作在 Omni-LLM 效率优化这一新兴子领域提供了竞争力方案,轻量压缩的理念可能启发后续研究。但 Omni-LLM 生态本身尚处早期,直接受众面有限;方法仅在 Qwen 系列验证,距成为领域标准实践仍有差距;理论贡献深度一般,主要价值在工程方面。
  • 开源 (1.0/1.5):论文提供了可访问的 GitHub 仓库链接(https://github.com/dingyue772/OmniSIFT),承诺开源代码。但仓库实际内容(如训练脚本、推理代码、README)未在论文中详述,作者也未提供模型权重或评估日志。数据集 AVoCaDO 的获取方式未公开。因此,按“代码已提供但其他资源不明”的标准给分。
  • 可复现性 (0.4/0.5):模型架构、计算公式和关键超参数(如学习率、batch size)已经说明,代码开源也大幅降低了实现门槛。但训练复现的关键信息(优化器、训练 epoch、硬件需求)缺失,推理配置(解码策略)也未明确。仅凭当前材料,独立研究者不经联系作者仍无法完整复现。
  • 工程/实践价值 (0.8/1.5):方法工程落地导向明确:极低额外参数、推理延迟低于训练免费基线、即插即用(仅需微调可学习模块)。对资源受限或实时音视频应用有参考意义。不足在于:压缩比率仍需人工设定(自适应预算未带来增益,反而增加复杂度),固定 chunk 级预算不考虑内容密度变化,且仅在理解任务上验证,对需要完整音频信号的生成任务适用性未知。

🚨 局限与问题

论文明确承认的局限:

  1. 极端压缩下,精密的音视频对齐仍具挑战,因其依赖高度局部化证据,易被剪枝破坏。
  2. STVP 仅建模 chunk 内时序冗余,跨 chunk 和长程音视频结构未被探索。
  3. 使用固定、与 query 无关的 token 预算,虽支持更广任务,但牺牲了任务特异的压缩效率。
  4. 未来工作应探索内容密度驱动的自适应预算、query 引导的剪枝,并保留多轮对话语境和音频触发的视觉证据。

审稿人发现的潜在问题:

  1. 跨架构泛化性存疑:主实验局限于 Qwen2.5-Omni 系列,该模型特有的 2 秒 chunk 设计可能有益于 OmniSIFT 的表现。迁移到 Qwen3-Omni 后性能轻微下降(DailyOmni 70.8→70.5),暗示方法对该架构的局部对齐有一定依赖。在 VideoLLaMA、GPT-4o 等不同 tokenization 策略的模型上是否依旧有效,完全未知。
  2. STVP“伪时序”建模:基于两帧对应位置 patch 的余弦距离判断“时间变化”,本质上是不建模运动矢量的逐位置差分。无法区分真正的物体移动(如从左移右,对应位置高距离但语义重要)与噪声或短暂闪烁(同样高距离但应视为冗余)。这使STVP 对动态场景的理解可能退化,且与“检测 temporal redundancy”的声称有隙。
  3. 训练-评估分布不匹配:训练仅用 AVoCaDO captioning 数据,但评估任务包含多选题 QA 和复杂跨模态推理。方法可能过拟合到 captioning 特有的 token 重要性模式,其在 QA 任务上的优越性需更谨慎归因。
  4. 基线对比的公平性:OmniZip 是训练免费方法,而 OmniSIFT 经 107K 样本微调。论文声称“先微调 backbone 再应用压缩基线”,但微调 backbone 带来的性能增益和压缩方法的贡献无法干净解耦。例如,full-token 某些指标异常偏低,可能因微调后 baseline 更强。
  5. 实验报告的完整性:未提供多次运行的均值/方差,无法判断提升是否统计显著。效率数据中总时间 15097s 等数字可能暗示批量评估,但具体设置不清,使加速比的可信度打折扣。此外,所有压缩比配置未给出敏感性分析,就主观确定为“最优”。
  6. 补充实验暴露的局限:自适应视频预算分配并未带来收益(甚至略降),这暗示当前固定压缩率已接近性能天花板,或信息密度变化对 OmniSIFT 不敏感,但论文未深入讨论。加深 VGAS 选择器反而掉点,质疑了更强大交互的潜力。

📷 论文图片


← 返回 ICML 2026 论文速递