OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
📄 OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models 标签:#音视频问答 #模型压缩 #音频理解 #Transformer #模型评估 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频问答 | #模型压缩 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Jinsen Su(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院) 通讯作者:Xiaowu Zheng(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院) 作者列表:Jinsen Su(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院)、Yongdong Luo(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院、阿里巴巴集团)、Yuexiao Ma(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院、厦门大学信息学院)、Yibo Hu(阿里巴巴集团)、Meiguang Jin(阿里巴巴集团)、Xiaowu Zheng(厦门大学媒体分析与计算实验室、厦门大学人工智能研究院) 💡 毒舌点评 这篇论文找到了一个很好的切入点:全模态压缩中不该让一个模态去指导另一个,因为音视频对同一个查询的“高光时刻”往往不同步。Attention可视化加相关性分布统计的Motivation做得扎实,直接命中了OmniZip等现有方法的软肋。不过,架构上对CLIP作为外部视觉评分器的依赖是最大的硬伤——明明音频侧可以复用模型内部表征做查询感知评分,视觉侧却要额外跑一个ViT-L,推理延迟在短生成场景下完全无法忽略。如果能用模型自身的视觉编码器替代CLIP,这篇工作的实用价值会再上一个台阶。 ...