英文题目:AccKV: Towards Efficient Audio-Video LLMs Inference via Adaptive-Focusing and Cross-Calibration KV Cache Optimization
会议身份:
conference:aaai:2026:conference-paper-id:37467
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#模型压缩 #多模态模型 #高效推理 #音视频 #音视频理解
评分:5.7/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Zhonghua Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Kui Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Kunxi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Keting Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Yiyun Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaode Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Chengfei Lv:机构信息未能从会议 PDF 纯文本可靠映射
- Shengyu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
音视频大语言模型(Audio-Video Large Language Models, AV-LLMs)推理需同时缓存具时间特性的音频键值缓存与具时空特性的视频键值缓存(Key-Value Cache, KV Cache),序列冗长且模态异构导致开销巨大。AccKV是作用于预填充阶段的免训练即插即用压缩框架:先对注意力矩阵做重分配以抑制早出现词元(token)的累积偏差,再按层统计序列尾部文本区间对音视频区间的平均累积注意力得到模态优先级并加权,最后在各模态内均值合并非重要KV,并以高优先级模态的键(Key, K)为锚对低优先级模态做余弦相似度交叉校准与阈值驱逐,文本区间KV全部保留。与直接跨模态合并的LOOK-M及无视层间偏移的FastV不同,该方法坚持先模态内压缩后跨模态对齐,以保留同步结构并避免特征混淆。在VideoLLaMA2上以20%缓存预算评测MVBench动作定位任务时,AccKV得分为0.736667,明显高于H2O的0.724232并接近全缓存的0.737667。该结论目前仅在VideoLLaMA2搭配Qwen2-7B-Instruct与AVicuna搭配Vicuna-7B-v1.5两个7B级解码器、MVBench中10个音视频子任务加音视频场景感知对话(Audio Visual Scene Aware Dialogue, AVSD)上验证,未证明对更长视频或流式解码的外推性。原文未披露训练、推理延迟吞吐与部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么?要解决的推理负担从哪里来?
本文输入是音视频大模型在推理阶段面对的长序列多模态提示,目标是在生成回答时减少键值缓存占用的显存与计算量,同时尽量不降低问答与对话质量。必须保留的信息包括模型名称与解码器类型、缓存预算定义、数据集与指标方向、基线是否可实际运行。输出是一套在预填充后对每层 KV 做保留、合并与驱逐的推理期优化流程,不改变模型权重。
对刚入门的读者,白话解释是:键值缓存(Key-Value Cache,简称 KV 缓存)指 Transformer 解码时把已算过的键向量与值向量存下来,避免下一步重复计算的结构。音视频比纯文本长得多,一段视频展开成数百帧图像块,一段音频展开成沿时间的声学特征,两路拼接后序列长度可达两千以上,缓存随层数线性增长,很快占满显存。视频大语言模型 VideoLLaMA2 与音频视频模型 AVicuna 都面临这个问题。
沿一个样本走一遍有助于建立依赖:输入一段含动作的视频与其同步音频加一句文本提问,编码器先把视频切成时空令牌、音频切成时间令牌,再与文本令牌拼接送入大语言模型解码器。解码器逐层计算注意力并留下 KV,若全部保留则显存大,若随意丢弃则可能丢掉回答所需的关键帧或关键语音段。后续方法、实验与复现都围绕如何按层决定留谁、并谁、删谁展开。
已有 KV 优化路线为何不能直接搬到音视频?
纯文本大模型的 KV 优化通常按累积注意力分数选重要令牌。重点击率预言机方法 H2O 保留得分最高的少数 KV 对,SnapKV 在生成前识别重要位置,快页选择方法 Quest 按页估计重要性,量化方法 KIVI 对键与值做不同粒度量化,FastGen 按注意力头定制策略。这些方法报告在长文本上有效,但原文指出它们未针对多模态令牌的异构冗余设计。
多模态侧已有面向视觉的尝试。LOOK-M 在预填充阶段分析注意力并优先文本令牌,通过合并相似令牌管理缓存;MustDrop 在视觉编码与预填充阶段按空间相似合并相邻块;PruneVid 按问题与图像的注意力剪枝视频特征并合并时空标记;FastV 在第二层后剪掉一半视觉令牌。
这些工作主要面向纯视觉场景。原文认为它们未充分考虑音视频大模型特有的跨层注意力模式与音视频同步对齐需求,因此不能直接用于同时含音频时间序列与视频时空序列的推理。
教学上要区分同输入同目标的比较与类别差异。H2O 与 SnapKV 是同为推理期、无需训练的通用基线,可在相同缓存预算下比较;LOOK-M 与 FastV 是同为多模态推理期压缩的方法,但前者做跨模态合并、后者不分模态剪枝,与本文分模态先合并再对齐的假设不同。把纯文本方法的数字直接当多模态最优,或把视觉方法的失效归因于实现细节,都是误读,原文的对照正是为了暴露模态处理方式的差异。
三个实测现象如何锁定设计约束?
原文用小规模驱逐与合并实验提出 3 个约束。第一是注意力收敛:高层注意力不严格跟随任务类型,无论音频问答还是视频描述,高层都更偏向视频模态。第二是异构模态合并冲突:把时间特性的音频 KV 与时空特性的视频 KV 直接合并会导致特征分布混淆与性能大跌。第三是过度压缩或保留陷阱:不分模态统一处理会破坏音画同步与对齐,即使删掉与任务无直接关系的模态也会掉点。
下图展示 VideoLLaMA2 在视频相关任务与音频相关任务下从 Layer-0 到 Layer-27 的注意力分布,绿色为视频区、粉色为音频区,蓝色深浅为注意力高低,可用于核对收敛现象是否随层加深而出现。
看图路径: 1. 先看上下两行任务类型:上一行视频相关任务,下一行音频相关任务;2. 再横向比较 Layer-0 到 Layer-27 四列中绿色视频区蓝色竖线密度的变化;3. 观察 Layer-27 时粉色音频区是否仍有深蓝色高分竖线;4. 确认低层两模态均有注意力、高层收敛到视频的结论是否与像素一致
论文图 1。原论文 Figure 1:“The attention distribution of VideoLLaMA2.”。
从像素看,上行视频任务与下行音频任务在 Layer-0 时绿色与粉色区均有明显的蓝色竖线与斜向纹理,说明低层 2 模态各得部分注意力;到 Layer-18 与 Layer-27 时,深蓝色竖线集中在绿色视频区,粉色音频区仅剩稀疏浅色竖线,且该趋势在上下两行一致。这支持原文所说的与任务类型无关的高层视频偏向。需注意像素不能读出精确分数,定量程度以后续驱逐实验的数字为准。
时间冗余 × 时空冗余: 时间冗余指音频沿时间轴高度重复、相邻帧相似度高,时空冗余指视频同时在空间相邻块与时间相邻帧上重复,二者分工不同导致压缩敏感度不同,搭配讨论的原因是若用同一策略处理会过度压缩一端,组合意义是解释为何必须先分模态处理再对齐。
AccKV 的全景流程如何分工?
AccKV 是自适应聚焦与交叉校准构成的 KV 缓存优化框架,全部发生在推理期,不更新模型参数。流程按层执行:先做注意力重分配纠正位置偏向,再按层计算音视频模态优先级并加权注意力,接着按加权后的累积分数选出保留集,在模态内对未选中项做均值合并,最后以高优先级模态为锚对低优先级模态做余弦相似度阈值过滤,文本令牌的 KV 全部保留。
下图为方法总览,中部为主链,下方为注意力重分配与自适应聚焦示意,上方为模态内合并与跨模态校准示意,可对照文字中的 4 步执行顺序阅读。
看图路径: 1. 先沿中部主链看输入到输出:Transformer 块到注意力处理再到模态内合并与校准;2. 再看下方面板注意力重分配前后下三角矩阵颜色深浅与累积条的变化;3. 观察上方面板模态内合并的箭头与跨模态校准中打叉被删项的位置
论文图 3。原论文 Figure 3:“(a) Overview of AccKV. AccKV uses (b) attention redistribution to alleviate attention bias and adaptive focus- ing to identify important modalities, thereby avoiding mis-…”。
图中中部从左到右依次是音视频与文本输入、Transformer 块、注意力重分配加自适应聚焦、模态内合并加跨模态校准,最终输出压缩后的 KV;下方用乘以位置权重的箭头表示对下三角注意力矩阵的调整,累积条由偏向早期变为更均衡;上方用分组箭头表示同模态内多项并为一项,用打叉表示低相似项被删。像素细节支持分先合后对齐的顺序理解,具体公式符号见组件节。
自适应聚焦 × 交叉校准: 自适应聚焦负责按层判断当前更依赖音频还是视频并给注意力加权,交叉校准负责先在各自模态内合并冗余再以高优先级模态为锚对低优先级模态做相似度过滤,二者搭配的原因是只聚焦不校准仍会误删跨模态对齐信息,只校准不聚焦则会在高层浪费预算,组合后新增的作用是在保留对齐结构的前提下压缩。
每层如何计算优先级、选谁、并谁、删谁?
第一步是注意力重分配。设注意力矩阵为 A,序列长度为 l,查询为 Q,键维度为 dk,标准注意力为 softmax 归一化后的矩阵。原文对每个元素乘以与行列位置有关的权重,给早期列低权重、近期列高权重,以缓解下三角结构使早期令牌累积分数天然偏大的问题。实现上是对已算好的 A 逐元素加权,不引入可训练参数。
第二步是自适应聚焦。取序列末尾文本区间内的查询,对视频区间与音频区间分别求平均累积注意力,得到视频均值与音频均值,再归一化为视频权重与音频权重,两者之和为 1。然后把视频列的注意力列向量乘以视频权重,音频列乘以音频权重。这一步使本层更关注的模态在后续排序中占优,且权重逐层重新计算,因此低层可保留双模态、高层自动偏向视频。
第三步是模态内选择与合并。先对文本查询累积得到每个视频位置与音频位置的分数向量,拼接后取前 k 个作为全局保留索引,并统计其中视频保留数与音频保留数,各自至少保留的下限处理保证不出现空模态。再在视频内取分数最高的若干位置为保留集,其余为待合并集,音频侧同理。待合并集的键与值分别做平均,得到每模态各一个合并向量,保留集的 KV 保持原样。
第 4 步是交叉校准。假设某层视频权重高于音频,则把音频保留项加音频合并项作为待检集合,把视频保留项加视频合并项作为锚集合,计算两集合间键向量的余弦相似度矩阵,再对每个音频项取其与所有视频锚的平均相似度,低于阈值的音频 KV 被驱逐,高于阈值的保留。最终 KV 由视频保留项、视频合并项、过滤后的音频项与全部文本 KV 拼接而成。若音频优先级更高则角色互换。阈值在实验中取 0.9 与 0.6 两档,阈值越高删得越多。
注意力重分配 × 重点击率令牌: 注意力重分配负责给早期位置降权、给近期位置加权以纠正下三角累积分数对早期令牌的偏向,重点击率令牌指累积注意力长期居高的少数关键 KV,二者搭配的原因是若直接累积排序会漏掉近期重要令牌,组合后新增的作用是让筛选出的保留集更接近真实重要性。
模态内合并 × 跨模态对齐: 模态内合并负责在音频内部和视频内部分别对非保留 KV 做均值合并以保留信息轮廓,跨模态对齐负责用高优先级模态 K 向量为锚计算低优先级模态的余弦相似度并按阈值过滤,二者搭配的原因是音频是时间型冗余而视频是时空型冗余,直接跨模态合并会混淆分布,组合后新增的作用是先保结构再保同步。
KV 缓存驱逐 × KV 缓存合并: KV 缓存驱逐负责按累积分数与阈值直接删除低优先级模态的不对齐项,KV 缓存合并负责把同模态内未被选中的多项平均成一项保留,驱逐分工是彻底省显存,合并分工是留轮廓防信息断裂,二者搭配的原因是全驱逐易破坏同步而全合并省得少,组合后新增的作用是按模态特性分级压缩。
本研究训练了什么?实际计算过程是什么?
本研究未训练任何新模型,也未微调 VideoLLaMA2 与 AVicuna 的权重。没有训练阶段意味着不存在优化器、学习率、梯度路径、损失函数与参数冻结更新的区分,所有模型参数保持原样,AccKV 只在推理时读取每层的注意力矩阵与 KV 并执行加权、排序、平均合并与相似度过滤。原文未报告梯度是否截断,因为推理期不反向传播,不存在该问题。
真实计算过程是确定性规则加阈值过滤的组合:注意力重分配是逐元素乘法,自适应聚焦是区间均值与归一化,选择是全局 top-k 排序,合并是同模态均值,校准是余弦相似度加阈值比较。文本 KV 始终保留,不参与合并与驱逐。需要补的缺项是各数据集上的 k 取值与阈值选择依据,原文仅给出阈值 2 档与预算档位,未说明是否按验证集调参,复现时应固定阈值并记录每层保留数以保证可比。
在什么模型、数据与预算下比较?
模型为两个不同解码器的音视频大模型:基于 Qwen2-7B-Instruction 解码器的 VideoLLaMA2,以及基于 Vicuna-7B-v1.5 解码器的 AVicuna。硬件为 40 GB 显存的英伟达 A100。比较对象包括可实际运行的 H2O、SnapKV、LOOK-M、FastV 与本文 AccKV,全缓存作为上限参考。原文未声明代码与权重链接可用,本次亦未收到可验证的开源资源状态,因此不能写已公开,只能按论文文字复述。
数据与协议方面,视频理解用 MVBench 中同时含音频与视频的 10 个任务,包括动作序列、动作预测、意外动作、物体交互、物体混洗、动作定位、场景转换、动作计数、状态变化与角色顺序;对话理解用音频视觉场景感知对话数据集 AVSD,用 ROUGE 作为评价指标。指标方向为越高越好。VideoLLaMA2 侧用 20% 与 10% 缓存预算两档,AVicuna 侧用 160 词元与 120 词元两档。阈值取 0.9 与 0.6。原文未给出随机种子、重复次数与显著性检验,聚合口径按各任务分数直接列表,未说明是否宏平均,因此跨任务平均时需谨慎。
公平条件上,同一模型同一预算下比较不同策略,保留文本 KV 的做法在 AccKV 中明确,其他基线是否同样全保留文本在原文未逐一交代,这是阅读时需保留的限制。成本方面原文只报告缓存比例与词元数,未报告延迟、吞吐与峰值显存实测,不能把缓存减半直接等同于速度翻倍。
主结果:在相同预算下谁保留了精度?
比较问题是:在相同缓存预算与相同模型下,AccKV 相对通用文本方法与视觉方法能否以更小的精度损失保留更多任务性能,指标越高越好。公平条件为同一模型、同一预算档、同一任务集,全缓存为上限。
| 任务/条件 | Full Cache 音频分 | Evict Audio 后音频分 | Evict Video 后音频分 | Full Cache 视频分与说明 |
|---|---|---|---|---|
| 高层驱逐音频任务 | 0.700490 | 0.691272 | 0.523281 | 音频任务全缓存 0.700490,高层删视频大跌 |
| 高层驱逐视频任务 | 0.541667 | 0.525415 | 0.356390 | 视频任务全缓存 0.541667,高层删视频大跌 |
上表整理高层驱逐对照:无论音频任务还是视频任务,高层驱逐视频 KV 都带来大幅下降,而驱逐音频 KV 影响较小。这支持高层视频偏向的判断,但也说明即使音频任务仍需视频信息,不能按任务名简单决定只留一模态。代价是该实验仅报告两类任务的聚合分,未给出每层与每个头的分布,推广到所有层需谨慎。未胜出项是 Evict Video 策略,在两类任务下均为最差,构成明确反例。
| 条件 | Full Cache 代表值 | H2O 代表值 | AccKV 代表值 | 任务覆盖与预算 |
|---|---|---|---|---|
| VideoLLaMA2 20% 预算 AS/AP/UA 片段 | 0.763425 | 0.678517 | 0.748626 | 含 AS AP UA OI OS 等多任务,AccKV τ=0.9 |
| VideoLLaMA2 20% 预算 OI/OS/AL 片段 | 0.80300 | 0.769631 | 0.866752 | OI 任务上 AccKV 超过全缓存,属单点波动 |
| VideoLLaMA2 20% 预算 AVSD | 0.479462 | 0.352680 | 0.425179 | AVSD 用 ROUGE,越高越好 |
上表截取 VideoLLaMA2 在 20% 预算下的片段:AccKV 在多数任务上最接近全缓存,AVSD 上为 0.425179,高于 H2O 的 0.352680;LOOK-M 在该表对应位置接近零分,FastV 居中。原文报告 AccKV 可减少 80% 到 90% 内存占用而性能仅轻微下降,但该比例是预算换算而非实测显存,限制是未测延迟。需说明 OI 上 AccKV 单点超过全缓存 0.80300 达到 0.866752,总体趋势不等于每组都成立,不宜推广为压缩提升精度。
哪个组件在起作用?失败条件是什么?
消融问题是:注意力重分配、自适应聚焦与交叉校准三者各自贡献多少,评价指标为 AVSD 上的分数,越高越好。条件为同一 VideoLLaMA2 与相同预算,仅开关模块。
| 条件 | 音频合并 vs 驱逐音频分 | 视频合并 vs 驱逐视频分 | 模块状态 | 说明 |
|---|---|---|---|---|
| 异构直接合并音频任务 | 0.700490 | 0.651984 | Evict 对比 Merge 0.166571 | 直接跨模态合并大跌 |
| 异构直接合并视频任务 | 0.541677 | 0.474414 | Evict 对比 Merge 0.120523 | 直接跨模态合并大跌 |
| 三模块全开 AVSD | 0.425179 | 0.364630 | 全开最高 | 报告显示全开最高 |
上表先看异构合并失败条件:音频任务上直接跨模态合并仅 0.166571,远低于分别驱逐的 0.651984;视频任务上合并仅 0.120523,远低于分别驱逐的 0.474414。这支持先模态内合并再对齐的设计,避免信息混淆。代价是该实验未说明合并时的 k 与平均方式细节,复现需按原文均值合并实现。
消融趋势上原文报告三模块全开时 AVSD 最高,去掉交叉校准后下降,去掉自适应聚焦后进一步下降,全关时最低。这支持三者协同,但原文仅给出 AVSD 单数据集结果,未在 MVBench 各任务上逐项消融,也未报告方差,因此不能断言每个任务上都单调提升。未评测边界包括阈值 0.9 与 0.6 之外的选择,以及极低预算下各模块的稳定性,待验证。
证据的边界与未验证的推测有哪些?
直接报告的是:在给定预算下 AccKV 的任务分数高于所列基线,直接合并跨模态 KV 会导致大跌,高层删视频比删音频影响大。有限解释是:注意力收敛与冗余差异支持了按层聚焦与先分后对齐的合理性。未验证推测是:缓存减少 80% 到 90% 是否等比转化为延迟下降与吞吐提升,原文未测量推理时间、每词元延迟与峰值显存,相关性不是因果,不能承诺这些量得到改善。
缺失证据不是技术错误,但需明确:无统计显著性、无多种子重复、无每层保留数分布、无阈值选择曲线、无真实部署的显存时间表。总体趋势不等于每步成立,例如个别任务上压缩后分数波动超过全缓存,应视为噪声或任务特性,待更多重复验证。相关工作对照的限制是基线超参数是否按原文默认执行未完全交代,若基线预算换算方式不同,比较会有偏差,复现时应固定预算定义并公开每任务分数。
若要复现,应先固定哪些步骤?
先按原文算法顺序实现推理期钩子:在每层 Transformer 块后读取注意力矩阵与 KV,对注意力做位置加权,按文本区间对音视频区间求均值并归一化为权重,加权后按文本累积分数做全局 top-k,统计 2 模态保留数,模态内对未选中项做均值合并,再以高权重模态为锚计算余弦相似度并按阈值过滤低权重模态,最后拼接文本 KV。文本 KV 始终保留,阈值先取 0.9 与 0.6 两档,预算先复刻 VideoLLaMA2 的 20% 与 10% 以及 AVicuna 的 160 与 120 词元。
验证时先复现 3 个小实验:高层分别驱逐音频与视频、模态内驱逐对比跨模态合并、全部驱逐一模态,确认方向一致后再跑主表。记录每层视频权重与音频权重曲线、每模态保留数与被删数、相似度分布,以判断是否出现过度压缩一端。还需补的验证是:在相同预算定义下重跑 H2O、SnapKV、LOOK-M、FastV,报告每任务原始分而非仅平均,并补充延迟与显存实测,才能把效率声明落到部署层面。资源状态方面,本次未收到可验证的开源链接,不得声称代码已公开。
何时值得尝试 AccKV?一句话收束
当推理受显存限制、输入同时含长音频与长视频、且观察到高层注意力偏向视频时,值得尝试按层加权加先分后对齐的压缩;若任务强依赖细粒度音画同步,应从高阈值保守起步并监控 AVSD 与动作计数类任务的分数。常见误解是把按任务名只留一模态当成最优,实测显示即使音频任务删掉视频也会大跌,对齐信息不可丢;另一个误解是把直接合并当成信息保留,实测显示跨分布合并反而远差于分别处理。
收束判断是:AccKV 用无训练的规则组合在报告预算下维持了接近全缓存的精度,代价是阈值与预算需按场景校准,且效率仍缺延迟实测。下一步最值得补的是公开可运行脚本、固定预算口径、补充统计重复与时间显存表,之后才能从论文数字走向可部署收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

