OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models
📄 OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models #音视频理解 #模型压缩 #多模态模型 #高效推理 6.3/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0.1/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 ✅ 6.3/10 | 前50% | #音视频理解 | #模型压缩 | #多模态模型 #高效推理 | arxiv 👥 作者与机构 第一作者:Zining Wang(北京航空航天大学计算机科学与工程学院,复杂与关键软件环境国家重点实验室) 通讯作者:Xianglong Liu(北京航空航天大学计算机科学与工程学院,复杂与关键软件环境国家重点实验室) 其他作者:Zhihang Yuan(北京大学)、Yingjie Zhai(华为技术有限公司)、Wenshuo Li(华为技术有限公司)、Han Shu(华为技术有限公司)、Ruihao Gong(复杂与关键软件环境国家重点实验室)、Jinyang Guo(北京航空航天大学计算机科学与工程学院/人工智能学院,复杂与关键软件环境国家重点实验室) 💡 毒舌点评 这篇论文的动机分析(层间异质性和跨模态锚点驱动)是一次漂亮的现象学观察,作者花了大力气证明“为什么”需要层自适应和跨模态对齐。但坦白说,方法论上更像一个“证件照”:SVD、DPC-KNN、余弦相似度这套组合拳看起来体面,深究下去却没有真正的新算法原理。核心卖点“training-free”既是铠甲也是软肋——轻量化部署确实友好,但也意味着它永远只能做“事后诸葛亮”,无法改变模型自身对冗余信息的处理逻辑。实验覆盖面广是优点,但依然缺少对深层why的拷问:为什么基于静态编码器输出的余弦相似度,能成为深层复杂语义交互的良好代理?这篇工作给了一个“够用”的解释,但离“令人信服”还有距离。 ...