📄 OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
#音视频问答 #模型压缩
7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5
✅ 7.1/10 | 前50% | #音视频问答 | #模型压缩 | arxiv
👥 作者与机构
- 第一作者(共一):Yue Ding(中国科学院自动化研究所模式识别国家重点实验室;快手科技Kling团队)与 Yiyan Ji(南京大学)
- 通讯作者:Qiang Liu(中国科学院自动化研究所模式识别国家重点实验室)
- 作者列表:Yue Ding(中科院自动化所;快手科技)、Yiyan Ji(南京大学)、Jungang Li(香港科技大学(广州))、Xuyang Liu(四川大学)、Xinlong Chen(中科院自动化所)、Junfei Wu(中科院自动化所)、Bozhou Li(北京大学)、Bohan Zeng(北京大学)、Yang Shi(北京大学)、Yushuo Guan(快手科技)、Yuanxing Zhang(快手科技)、Jiaheng Liu(南京大学)、Qiang Liu(中科院自动化所)、Pengfei Wan(快手科技)、Liang Wang(中科院自动化所)
💡 毒舌点评
这篇论文的“视觉先行、再引导音频”两阶段压缩,直觉干净,实验也漂亮——35% tokens就能战平甚至略超 full-token baseline,效率提升显著。但自信别太早:核心实验全在 Qwen2.5-Omni 上跑,换到 Qwen3-Omni 马上掉点(DailyOmni 70.5 vs. 70.8 full),说明方法的普适性没那么神。STVP 那套“按位置算余弦距离就当时间显著性”的操作,本质上仍在像素级做差分,真正的物体运动、遮挡这些时序动态它根本没建模,却好意思标榜“temporal redundancy”处理。Chunk 级剪枝更是直接摆烂,跨 chunk 长程依赖直接放弃,这可是 long-form 理解的基本盘。想法好、工程值钱,但别急着说自己是范式开创者。
📌 核心摘要
本文瞄准 Omni-LLM 处理音视频时因 token 序列过长导致的计算瓶颈,提出模态非对称压缩框架 OmniSIFT。其核心直觉是:人类感知中视觉主导,音频重要性高度依赖视觉语义锚点——因此应先压缩视频以提取视觉主干,再以此引导音频 token 的筛选。方法分两阶段:(1) 空时视频剪枝模块(STVP)在 2 秒 chunk 内,利用帧内余弦距离(空间显著性)和帧间对应位置余弦距离(时间显著性)分别打分,独立剪除冗余的视觉 patch;(2) 视觉引导音频选择器(VGAS)用单层交叉注意力让压缩后的视觉 token 指导音频 token 的显著性评分,并通过直通估计器(STE)实现离散选择操作的可微优化,从而端到端训练。整个过程仅增加 4.85M 参数。在 Qwen2.5-Omni-7B 上,保留 35% tokens 时,OmniSIFT 在 WorldSense(50.0 vs. full-token 49.7)、DailyOmni(73.2 vs. 72.2)等多个基准上持平或超越 full-token 基线;即使在 25% 极端压缩下,性能依然稳健,远超 OmniZip 等训练免费方案。推理延迟和 GPU 内存也有超 40% 的削减。主要局限是 STVP 仅处理 chunk 内时序,跨 chunk 长程冗余未建模,且实验仅在 Qwen 系列模型上开展。
🔗 开源详情
- 代码:https://github.com/dingyue772/OmniSIFT(论文声明可用,但未确认仓库内容完整性)
- 模型权重:论文未提及
- 数据集:训练基于 AVoCaDO SFT 数据集(参考 Chen et al., 2025b),未提供下载链接或详细统计;评测使用 Video-MME、DailyOmni、WorldSense、OmniVideoBench、video-SALMONN-2 五个公开基准
- Demo:未提及
- 复现材料:除代码仓库外,未提供预训练检查点、训练日志或除附录 B 超参之外的附加材料。附录 B 给出了输入采样率、分辨率等配置。
🏗️ 方法概述和架构
OmniSIFT 是一个两阶段、端到端可微的 token 压缩 pipeline,处理粒度对齐 Qwen2.5-Omni 的 2 秒对齐 chunk。它针对“视觉冗余源于帧内结构和帧间重叠,而音频重要性依赖视觉语境”的非对称特性设计,流程如下:
整体数据流(见图 3): 视频/音频输入 → 各自编码器与投影器 → 每个 chunk 内,首先由 STVP 模块压缩视觉 token,输出压缩后的视觉锚点;随后 VGAS 模块以这些视觉锚点为 K/V,以完整音频 token 为 Q,通过交叉注意力对音频 token 评分并 Top-K 选择 → 压缩后的多模态 token 序列送入 LLM 骨干。整个框架通过 STE 绕过 Top-K 的不可微性,从 LLM 损失反向传播梯度。
第一阶段:空时视频剪枝(STVP)
- 输入:当前 chunk 的两个连续帧的 token 序列,形状 \((n_p, D)\)。
- 空间显著性估计:对第一帧,先均值池化得全局表征 \(\bar{v}_1\),然后每个 patch token \(v_{1,i}\) 与之计算余弦距离 \(s_{1,i} = 1 - \cos(v_{1,i}, \bar{v}_1)\)。距离越大,表示该 patch 与全局背景差异越大,信息量越高。
- 时间显著性估计:利用位置编码,将第二帧的每个 patch token \(v_{2,i}\) 与第一帧对应位置 token \(v_{1,i}\) 匹配,直接计算两者间的余弦距离 \(s_{2,i} = 1 - \cos(v_{2,i}, v_{1,i})\)。距离越大,表示该区域发生了运动或变化。
- Top-K 选择:给定视觉保留率 \(\alpha_v\),每帧独立选出得分最高的 \(\hat{n}_p = \alpha_v n_p\) 个 token,其余丢弃。整个操作在 chunk 内完成,线性复杂度。
- 设计动机:受 VidCom2(帧内空间冗余)和 TimeChat-Online(帧间时间冗余)启发,认为背景相似区域和静态度变化的 patch 对下游任务贡献甚微。
第二阶段:视觉引导音频选择器(VGAS)
- 输入:当前 chunk 的完整音频 token 序列 \(Z_a\)(\(n_a \times D\))和 STVP 输出的压缩视觉序列 \(\hat{Z}_v\)(\(\hat{n}_v \times D\))。
- 视觉上下文化:采用 8 头、内部维度 512 的单层交叉注意力,以音频 token 为 \(Q_a\),视觉 token 为 \(K_v, V_v\),计算 \(H_a = \text{Softmax}(Q_a K_v^T / \sqrt{d}) V_v\)。这使每个音频 token“感知”当前视觉场景的语义锚点,突出与视觉相关的声学特征。
- 残差连接:\(\tilde{H}_a = H_a + Z_a\),保留原始声学信息避免视觉过度覆盖。
- 显著性评分:\(\tilde{H}_a\) 经两层 MLP(512维隐藏)和 Sigmoid 激活,为每个音频 token 输出标量得分 \(s_{a,j} \in (0,1)\),表示其在当前视觉语境下的重要性。
- Top-K 选择与 STE 端到端训练:给定音频保留率 \(\alpha_a\),前向时生成二值 mask 保留 Top-K 音频 token;反向时使用恒等近似梯度 \(\partial m_j / \partial s_{a,j} \approx 1\),使梯度直接流向显著性得分,无需暴露 FlashAttention 内部 attention score。
- 参数量:所有新增组件合计 4.85M(< 0.1% 的 7B 骨干)。
关键设计权衡:
- 模态非对称 vs. 对称:OmniZip(音频引导视频)和 DyCoke(独立压缩)都假设两模态同等重要,而 OmniSIFT 坚持“视觉显著性可独立于音频估计,但音频重要性必须视觉确认”。消融实验显示,音频引导视觉的对称变体在 35% 保留率下性能显著低于 OmniSIFT(DailyOmni 70.5 vs. 73.2)。
- 轻量模块 vs. 深度压缩:仅用单层交叉注意力而非多层 LLM 解码器(如 EchoingPixels 的 4 层额外层),保证推理延迟甚至低于训练免费的 OmniZip(2.86s vs. 2.89s),实现可学习压缩的实用化。
- Chunk 级 vs. 全局压缩:仅在 2 秒 chunk 内操作,避免平方级复杂度,但牺牲了对跨 chunk 长程时序依赖的建模。
💡 核心创新点
- 模态非对称压缩范式:首次在 Omni-LLM token 压缩中明确设计并验证“视频先行、视觉引导音频”的非对称 pipeline。消融实验证实,相比 OmniZip 式的对称训练版本,该设计在所有保留率下均有显著优势(如 25% 时 DailyOmni 72.5 vs. 68.8)。
- 双粒度视频空时剪枝:将视频冗余解耦为帧内空间相似性(基于全局背景的余弦距离)和帧间时间不变性(基于对应位置 patch 的余弦距离)两个独立维度,分别打分。消融显示移除任一分均导致性能下降(WorldSense:移除空间 46.9、移除时间 47.1、完整 50.0)。
- 视觉引导的音频 SALIENCY 估计器:用单层交叉注意力让压缩视觉 token 指导音频 token 的重要性判断,并以 STE 实现端到端训练。相比纯音频自注意力选择器,DailyOmni 提升 3.9%,WorldSense 提升 2.9%,且不依赖特定算子的 attention score 暴露,兼容性更强。
- 超轻量可学习压缩:4.85M 参数即实现可训练压缩,推理延迟低于训练免费的 OmniZip。证明“小容量、位置恰当”的模块远优于“大容量但位置错误”的设计(如增加选择器深度反而掉点)。
📊 实验结果
主实验(Table 1):在 Qwen2.5-Omni-7B 和 3B 上,35% 和 25% 两个 token 保留率下进行全面对比。
| 方法 | 保留率(%) | WorldSense (↑) | OmniVideoBench (↑) | VideoMME Short (↑) | VideoMME Medium (↑) | VideoMME Long (↑) | VideoMME Avg. (↑) | video-SALMONN-2 Miss (↓) | video-SALMONN-2 Hal (↓) | video-SALMONN-2 Total (↓) | DailyOmni (↑) |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Full Tokens | 100 | 49.7 | 35.6 | 78.9 | 66.9 | 57.1 | 67.6 | 29.1 | 19.0 | 48.1 | 72.2 |
| OmniZip | 35 | 48.9 | 35.1 | 77.1 | 67.0 | 56.0 | 66.7 | 34.1 | 20.0 | 54.1 | 67.7 |
| Random | 35 | 48.3 | 33.4 | 77.2 | 68.1 | 56.6 | 67.3 | 33.2 | 19.9 | 53.1 | 66.3 |
| DyCoke | 35 | 48.6 | 34.4 | 78.7 | 68.0 | 56.9 | 67.9 | 32.6 | 20.1 | 52.7 | 67.9 |
| OmniSIFT | 35 | 50.0 | 35.6 | 79.0 | 67.9 | 58.0 | 68.3 | 30.7 | 19.8 | 50.5 | 73.2 |
| OmniZip | 25 | 48.1 | 34.1 | 76.4 | 66.1 | 55.3 | 66.0 | 35.8 | 21.4 | 57.2 | 66.2 |
| Random | 25 | 47.1 | 32.6 | 77.0 | 66.1 | 55.1 | 66.1 | 36.2 | 20.7 | 56.9 | 65.2 |
| DyCoke | 25 | 48.1 | 34.1 | 76.4 | 66.2 | 55.0 | 65.9 | 35.3 | 20.0 | 56.3 | 64.7 |
| OmniSIFT | 25 | 49.9 | 35.4 | 78.6 | 67.8 | 58.3 | 68.2 | 30.9 | 20.3 | 51.2 | 72.5 |
| Full Tokens | 100 | 45.8 | 33.5 | 76.1 | 63.4 | 52.9 | 64.2 | 32.8 | 20.8 | 53.6 | 67.0 |
| OmniZip | 35 | 44.1 | 33.7 | 74.7 | 63.8 | 53.1 | 63.5 | 36.9 | 22.2 | 59.1 | 64.7 |
| Random | 35 | 45.5 | 33.4 | 74.3 | 61.6 | 52.1 | 62.7 | 37.0 | 21.7 | 58.7 | 62.9 |
| DyCoke | 35 | 45.3 | 32.8 | 73.7 | 62.7 | 53.7 | 63.3 | 36.9 | 21.6 | 58.5 | 63.2 |
| OmniSIFT | 35 | 45.7 | 33.7 | 76.1 | 62.2 | 52.8 | 63.7 | 35.2 | 21.8 | 56.9 | 65.3 |
| OmniZip | 25 | 43.8 | 32.4 | 72.7 | 61.9 | 52.3 | 62.3 | 39.5 | 22.6 | 62.1 | 64.2 |
| Random | 25 | 43.3 | 33.0 | 74.0 | 61.9 | 50.9 | 62.3 | 39.3 | 22.6 | 62.0 | 61.2 |
| DyCoke | 25 | 44.1 | 33.0 | 73.3 | 62.3 | 51.9 | 62.5 | 40.2 | 21.7 | 61.9 | 61.7 |
| OmniSIFT | 25 | 45.8 | 33.1 | 75.0 | 62.0 | 52.1 | 63.0 | 36.4 | 21.9 | 58.3 | 64.7 |
细粒度分析(Table 2):在 DailyOmni 的 6 个子类别上,OmniSIFT 在需要精确跨模态时序对齐的困难类别(Event Sequence、AV Event Alignment)上表现稳定,即使在 25% 极端压缩下仍保持或超越 full-token 水平,而 OmniZip 在 Event Sequence 上降至 61.8(7B, 25%)。
| 方法 | 保留率(%) | Event Sequence | AV Event Alignment | Context Understanding | Inference | Reasoning | Comparative | Average |
|---|---|---|---|---|---|---|---|---|
| Full Tokens | 100 | 66.7 | 70.6 | 79.2 | 76.6 | 69.9 | 77.1 | 72.2 |
| OmniZip | 35 | 63.7 | 63.0 | 77.3 | 76.6 | 59.1 | 74.8 | 67.7 |
| Random | 35 | 58.5 | 61.8 | 77.9 | 73.7 | 63.2 | 74.0 | 66.3 |
| DyCoke | 35 | 61.4 | 63.9 | 77.9 | 75.4 | 63.7 | 74.8 | 67.9 |
| OmniSIFT | 35 | 66.7 | 70.2 | 83.1 | 78.9 | 69.9 | 79.4 | 73.2 |
| OmniZip | 25 | 61.8 | 59.7 | 75.3 | 75.4 | 60.6 | 74.0 | 66.2 |
| Random | 25 | 61.1 | 56.7 | 78.6 | 71.4 | 60.1 | 73.3 | 65.2 |
| DyCoke | 25 | 57.2 | 56.7 | 80.0 | 74.3 | 61.1 | 71.0 | 64.7 |
| OmniSIFT | 25 | 66.7 | 68.9 | 82.5 | 77.7 | 71.0 | 76.3 | 72.5 |
| Full Tokens | 100 | 60.1 | 62.2 | 78.6 | 74.9 | 62.2 | 74.8 | 67.0 |
| OmniZip | 35 | 60.5 | 56.7 | 76.6 | 72.0 | 59.6 | 72.5 | 64.7 |
| Random | 35 | 55.9 | 54.2 | 76.0 | 74.3 | 60.1 | 68.7 | 62.9 |
| DyCoke | 35 | 53.9 | 52.5 | 79.2 | 76.0 | 60.1 | 72.5 | 63.2 |
| OmniSIFT | 35 | 57.8 | 58.8 | 77.3 | 73.7 | 64.8 | 69.5 | 65.3 |
| OmniZip | 25 | 57.8 | 55.0 | 75.3 | 70.3 | 58.5 | 70.0 | 64.2 |
| Random | 25 | 53.3 | 54.2 | 76.6 | 72.0 | 55.4 | 67.9 | 61.2 |
| DyCoke | 25 | 52.6 | 54.6 | 74.7 | 74.3 | 58.0 | 69.5 | 61.7 |
| OmniSIFT | 25 | 58.5 | 59.7 | 75.3 | 73.7 | 60.6 | 70.2 | 64.7 |
效率分析(Table 3):在 WorldSense 上,35% 保留率下,OmniSIFT 的 7B 模型总推理时间从 15097.1s 降至 8756.0s(约 42% 加速),E2E 延迟从 4.94s 降至 2.86s,峰值 GPU 内存从 27.59GB 降至 22.91GB。3B 模型也有类似比例提升。
| Method | Retained Ratio | GPU Mem (GB) ↓ | Total Time (s) ↓ | Prefill Lat. (s) ↓ | E2E Lat. (s) ↓ | Acc (%) ↑ |
|---|---|---|---|---|---|---|
| Full Tokens | 100 | 27.59 | 15097.1 | 4.76 | 4.94 | 49.7 |
| OmniZip | 35 | 22.92 | 8886.4 | 2.80 | 2.89 | 48.9 |
| DyCoke | 35 | 23.09 | 8718.3 | 2.75 | 2.85 | 47.3 |
| OmniSIFT | 35 | 22.91 | 8756.0 | 2.76 | 2.86 | 50.0 |
| Full Tokens | 100 | 18.91 | 11399.4 | 3.59 | 3.79 | 45.8 |
| OmniZip | 35 | 14.75 | 7750.4 | 2.44 | 2.59 | 44.1 |
| DyCoke | 35 | 14.92 | 7578.8 | 2.39 | 2.53 | 43.9 |
| OmniSIFT | 35 | 14.79 | 7596.3 | 2.39 | 2.53 | 45.7 |
压缩比率鲁棒性(Figure 4):当音频压缩比 \(\rho_a\) 从 0.3 增至 0.9 时,OmniSIFT 在 WorldSense 上的性能从 ~49.8% 仅微降至 ~49.3%,而 OmniZip 从 48.9% 骤降至 ~44.0%,证实了视觉引导策略对音频压缩的鲁棒性。
消融实验:
- STVP 结构消融:移除空间分支后 DailyOmni/WorldSense 分别降至 69.4/46.9;移除时间分支降至 69.8/47.1;完整模型 73.2/50.0。
- VGAS 设计消融:用纯音频自注意力选择器替代后,DailyOmni/WorldSense 分别跌至 69.3/47.1,表明视觉引导是音频选择的核心。
- 压缩范式消融(Table 4):在所有保留率下,OmniSIFT 的非对称范式均优于 OmniZip 风格的对称训练版本。35% 时 DailyOmni 73.2 vs. 70.5,WorldSense 50.0 vs. 49.7;25% 时差距拉大至 72.5 vs. 68.8。
- 选择器深度消融:将 VGAS 加深至 3 层交叉注意力反而导致性能下降(VideoMME 68.3→67.2,DailyOmni 73.2→72.3),验证了轻量设计的合理性。
- 随机剪枝与 SSM 选择器消融(附录 D.4):替换 STVP 为随机视觉剪枝或 VGAS 为随机音频剪枝均大幅掉点;用 SSM 替代交叉注意力选择器亦效果不佳,进一步确认了当前设计的有效性。
- 自适应预算消融(附录 D.5):采用 VidCom2 风格的自适应视频 token 预算分配并未带来明显收益(DailyOmni 73.2 vs. 71.9),且增加预填延迟,支持了固定预算的实用选择。
- 替代 VGAS 设计(附录 D.5):直接基于注意力进行音频剪枝或拼接 av token 再打分的方案,性能均不及当前 VGAS 设计。
跨模型迁移实验(附录 D.5):将 OmniSIFT 迁移到 Qwen3-Omni(LoRA 微调),在 DailyOmni 上从 full-token 的 70.8 降至 70.5,WorldSense 从 50.2 降至 48.8,同时带来可观的延迟和内存节省,证明了部分泛化能力但仍有轻微性能退化。
与 FASTAV 对比(附录 D.5):在同等 token 预算下,OmniSIFT 远优于 FASTAV(DailyOmni 73.2 vs. 59.4,WorldSense 50.0 vs. 43.3),凸显了可学习压缩的优势。
🔬 细节详述
- 训练数据:AVoCaDO SFT 数据集,包含 107K 同步音视频 captioning 对。论文未提供数据集的详细统计(如时长分布、采样策略等)。
- 损失函数:论文未明确说明。推断为 LLM 骨干的标准 next-token prediction 交叉熵损失,VGAS 模块通过 STE 从该损失接收梯度。
- 训练策略:
- 学习率:\(1 \times 10^{-5}\)
- Batch size:128(总数,未提梯度累积)
- 优化器:未提及(原文无指定)
- Warmup 策略、训练轮数、学习率调度:均未提及
- 微调范围:仅 LLM decoder 和 VGAS 模块,视觉及音频编码器冻结
- 关键超参数:
- VGAS:8 头交叉注意力,内部维度 512,2 层 MLP(Sigmoid 输出)
- Chunk 时长:2 秒(与 Qwen2.5-Omni 对齐)
- 视频采样:2 FPS,最多 256 帧,空间分辨率最大 320 × 28 × 28
- 压缩比配置:35% 总保留率下 \(\rho_a = 0.4, \rho_v = 0.67\);25% 下 \(\rho_a = 0.5, \rho_v = 0.77\)。各基线的具体分配见论文 Table 6,均校准以确保实际保留的 token 数一致。
- 训练硬件:未提及 GPU 型号、数量、训练时长。
- 推理细节:WorldSense 效率测试的总时间 15097.1s(7B)和 11399.4s(3B)表明批量处理了大量样本,但解码策略(贪心/采样/temperature 等)未说明。QA 任务使用统一的 VideoMME 风格多选题 prompt(见论文 Figure 7);video-SALMONN-2 captioning 采用 GPT-4.1 作为评判器,评估 Miss、Incorrect、Hallucination 事件计数(prompt 见 Figure 9)。
- 正则化与稳定训练:未提及任何特殊技巧。
- 评估细节:论文未报告多次运行的均值/标准差。补充材料提供了 attention 稀疏可视化(Figure 10)及长视频效率扩展分析(Figure 11)。
⚖️ 评分理由
- 创新性 (1.2/2):提出“视觉主导、音频依赖视觉”的非对称压缩范式,与现有对称/独立方法形成清晰对比。STVP 的双粒度剪枝和 VGAS 的轻量交叉注意力设计合情合理,消融实验证实了组件有效性。但核心直觉(视觉引导音频)在跨模态学习中并不全新(如 Look, Listen and Learn),论文对与前驱工作的区分讨论不够深入;chunk 级压缩的理论最优性也缺乏分析。
- 技术严谨性 (1.0/1.5):方法推导清晰,余弦距离显著性估计与 STE 端到端优化表述规范。然而,STE 仅用恒等近似 \(\partial m / \partial s \approx 1\),未探讨更标准的变体或潜在偏差;压缩比 \(\rho_v, \rho_a\) 的选择依赖“经验评估”,未给出系统搜索或理论指导;STVP 在处理快速场景切换、相机运动时的失败模式也未分析。
- 实验充分性 (1.2/1.5):覆盖 5 个音视频基准,含长短时序 QA 和 captioning,消融实验维度全面(模块结构、范式、深度、随机替换等),并补充了与 FASTAV 的对比和 Qwen3-Omni 迁移实验。主要扣分点:所有主实验仅在 Qwen2.5-Omni 上进行(3B/7B 为同架构变体),跨架构泛化证据仍较弱——Qwen3-Omni 迁移显示性能微降;未报告多次运行的统计显著性;效率分析中总时间指标含义模糊(可能是批量总时间,但未明确);缺少对静音视频、纯音乐等极端情况的鲁棒性分析。
- 清晰度 (0.8/1):整体结构清晰,图 2(范式对比)和图 3(架构概览)直观。但训练细节严重缺失:优化器、训练步数、warmup 策略、硬件一概未提,无法复现训练。部分表格指标缩写(如 video-SALMONN-2 的 Miss/Hal/Total)未在正文首次出现时解释,降低了可读性。
- 影响力 (0.7/1.5):工作在 Omni-LLM 效率优化这一新兴子领域提供了竞争力方案,轻量压缩的理念可能启发后续研究。但 Omni-LLM 生态本身尚处早期,直接受众面有限;方法仅在 Qwen 系列验证,距成为领域标准实践仍有差距;理论贡献深度一般,主要价值在工程方面。
- 开源 (1.0/1.5):论文提供了可访问的 GitHub 仓库链接(https://github.com/dingyue772/OmniSIFT),承诺开源代码。但仓库实际内容(如训练脚本、推理代码、README)未在论文中详述,作者也未提供模型权重或评估日志。数据集 AVoCaDO 的获取方式未公开。因此,按“代码已提供但其他资源不明”的标准给分。
- 可复现性 (0.4/0.5):模型架构、计算公式和关键超参数(如学习率、batch size)已经说明,代码开源也大幅降低了实现门槛。但训练复现的关键信息(优化器、训练 epoch、硬件需求)缺失,推理配置(解码策略)也未明确。仅凭当前材料,独立研究者不经联系作者仍无法完整复现。
- 工程/实践价值 (0.8/1.5):方法工程落地导向明确:极低额外参数、推理延迟低于训练免费基线、即插即用(仅需微调可学习模块)。对资源受限或实时音视频应用有参考意义。不足在于:压缩比率仍需人工设定(自适应预算未带来增益,反而增加复杂度),固定 chunk 级预算不考虑内容密度变化,且仅在理解任务上验证,对需要完整音频信号的生成任务适用性未知。
🚨 局限与问题
论文明确承认的局限:
- 极端压缩下,精密的音视频对齐仍具挑战,因其依赖高度局部化证据,易被剪枝破坏。
- STVP 仅建模 chunk 内时序冗余,跨 chunk 和长程音视频结构未被探索。
- 使用固定、与 query 无关的 token 预算,虽支持更广任务,但牺牲了任务特异的压缩效率。
- 未来工作应探索内容密度驱动的自适应预算、query 引导的剪枝,并保留多轮对话语境和音频触发的视觉证据。
审稿人发现的潜在问题:
- 跨架构泛化性存疑:主实验局限于 Qwen2.5-Omni 系列,该模型特有的 2 秒 chunk 设计可能有益于 OmniSIFT 的表现。迁移到 Qwen3-Omni 后性能轻微下降(DailyOmni 70.8→70.5),暗示方法对该架构的局部对齐有一定依赖。在 VideoLLaMA、GPT-4o 等不同 tokenization 策略的模型上是否依旧有效,完全未知。
- STVP“伪时序”建模:基于两帧对应位置 patch 的余弦距离判断“时间变化”,本质上是不建模运动矢量的逐位置差分。无法区分真正的物体移动(如从左移右,对应位置高距离但语义重要)与噪声或短暂闪烁(同样高距离但应视为冗余)。这使STVP 对动态场景的理解可能退化,且与“检测 temporal redundancy”的声称有隙。
- 训练-评估分布不匹配:训练仅用 AVoCaDO captioning 数据,但评估任务包含多选题 QA 和复杂跨模态推理。方法可能过拟合到 captioning 特有的 token 重要性模式,其在 QA 任务上的优越性需更谨慎归因。
- 基线对比的公平性:OmniZip 是训练免费方法,而 OmniSIFT 经 107K 样本微调。论文声称“先微调 backbone 再应用压缩基线”,但微调 backbone 带来的性能增益和压缩方法的贡献无法干净解耦。例如,full-token 某些指标异常偏低,可能因微调后 baseline 更强。
- 实验报告的完整性:未提供多次运行的均值/方差,无法判断提升是否统计显著。效率数据中总时间 15097s 等数字可能暗示批量评估,但具体设置不清,使加速比的可信度打折扣。此外,所有压缩比配置未给出敏感性分析,就主观确定为“最优”。
- 补充实验暴露的局限:自适应视频预算分配并未带来收益(甚至略降),这暗示当前固定压缩率已接近性能天花板,或信息密度变化对 OmniSIFT 不敏感,但论文未深入讨论。加深 VGAS 选择器反而掉点,质疑了更强大交互的潜力。