OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
📄 OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models #音视频问答 #模型压缩 7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | #音视频问答 | #模型压缩 | arxiv 👥 作者与机构 第一作者(共一):Yue Ding(中国科学院自动化研究所模式识别国家重点实验室;快手科技Kling团队)与 Yiyan Ji(南京大学) 通讯作者:Qiang Liu(中国科学院自动化研究所模式识别国家重点实验室) 作者列表:Yue Ding(中科院自动化所;快手科技)、Yiyan Ji(南京大学)、Jungang Li(香港科技大学(广州))、Xuyang Liu(四川大学)、Xinlong Chen(中科院自动化所)、Junfei Wu(中科院自动化所)、Bozhou Li(北京大学)、Bohan Zeng(北京大学)、Yang Shi(北京大学)、Yushuo Guan(快手科技)、Yuanxing Zhang(快手科技)、Jiaheng Liu(南京大学)、Qiang Liu(中科院自动化所)、Pengfei Wan(快手科技)、Liang Wang(中科院自动化所) 💡 毒舌点评 这篇论文的“视觉先行、再引导音频”两阶段压缩,直觉干净,实验也漂亮——35% tokens就能战平甚至略超 full-token baseline,效率提升显著。但自信别太早:核心实验全在 Qwen2.5-Omni 上跑,换到 Qwen3-Omni 马上掉点(DailyOmni 70.5 vs. 70.8 full),说明方法的普适性没那么神。STVP 那套“按位置算余弦距离就当时间显著性”的操作,本质上仍在像素级做差分,真正的物体运动、遮挡这些时序动态它根本没建模,却好意思标榜“temporal redundancy”处理。Chunk 级剪枝更是直接摆烂,跨 chunk 长程依赖直接放弃,这可是 long-form 理解的基本盘。想法好、工程值钱,但别急着说自己是范式开创者。 ...