VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference
📄 VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference 标签:#音频理解 #模型压缩 #语音大模型 #长音频处理 #高效推理 7.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #模型压缩 | #语音大模型 #长音频处理 | arxiv 👥 作者与机构 第一作者:Wenxu Jia(浙江大学,并署名美团上海) 通讯作者:未说明 作者列表: Wenxu Jia(浙江大学;美团上海) Dongjie Fu(浙江大学) Xize Cheng(浙江大学) Fangming Feng(浙江大学) Linjun Li(美团上海) Wenshi Chen(美团上海) Yingming Li(浙江大学) Zhou Zhao(浙江大学) Tao Jin(浙江大学) 💡 毒舌点评 VoxZip 用 ASR 文本当语义锚来压缩音频 token,思路直接且有效,能在 5% KV budget 下保住 91% 以上的长音频性能,工程价值突出。但论文对衰减注意力分数在缓存裁剪后的维护方式交代不清,且“直接相加文本与音频 embedding”这种跨模态注入缺少分布分析,更多是经验有效而非原理自洽。 ...