英文题目:Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

标签:#音视频理解 | #系统综述 | #高效推理 | #音视频 | #多模态模型

评分:7.0/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Killian Steunou:机构信息未在 arXiv HTML 中可靠披露
  • Yannis Tevissen:机构信息未在 arXiv HTML 中可靠披露
  • Mounîm A. El Yacoubi:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

视频大语言模型以采样帧与同步音频及文本提示为输入,以问答、描述、检索与时序定位生成为输出,难点是帧数与上下文长度同时推高编码与注意力开销而限制实时部署。该综述先界定编码器-连接器-大语言模型系统边界与纳入标准并检索至2026年8月的候选机制,其输出的机制集合进入按管线阶段划分的归纳。接着按输入构建、编码器计算、表征与连接器、大语言模型执行与状态归类上百种机制,明确上游时序覆盖如何转化为下游词元与缓存预算。再在共享主机与输入协议下组装文献报告的精度-代价对照并与异构跨文证据分离,其鉴别的共享对照与评测缺口直接支撑视听联合预算与未来方向判断。与以往按压缩算子组织的工作相比,其差异是把上游选择与编码代价和下游词元预算与缓存增长显式关联,并要求计入选择器自身开销与计算量统计边界,具有系统权衡意义。在LLaVA-Video-7B共享主机与64帧输入协议基准评测下,TSPO方法的LongVideoBench得分为63.9,高于均匀基线的58.9。该结论适用边界受限于多项选择问答与离线长视频评测,尚未验证生成式描述、定位与流式长视频的外推。在延迟与推理开销方面,原文报告STC在复用75%缓存特征时将ViT编码延迟降低24.5%并将大语言模型预填充延迟降低45.3%,表明节省的词元预算须与编码代价一并评估。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:这篇综述到底在解决哪种贵?

这篇综述的研究对象是视频大模型,初学者可理解为编码器加连接器加大模型构成的 3 段系统。视频编码器把采样帧变为连续特征,连接器把特征投影或压缩为大模型可读的视觉 token,大模型再结合文本指令生成回答。视听系统多出 1 路音频编码器与对应连接器分支。

贵的来源不是单个模型太大,而是帧数与上下文长度同时膨胀。原文把瓶颈拆为 4 处:输入构建时选多少帧与多大分辨率,编码器按帧数与空间块数做特征提取,连接器决定保留多少视觉与音频 token,大模型预填充与解码的计算和键值缓存随总上下文长度增长。长视频常涉及数百帧与分钟级时长,若密集采样,编码器本身就可能主导总开销。

即使编码已经完成,未压缩的 token 进入大模型仍会推高预填充与缓存。综述筛选口径明确:只收录报告了参数量、每输入浮点运算、延迟、内存或视觉与音频 token 数等具体缩减效果的机制,覆盖 2022 年末以来的视频大模型,并向前兼容仍在当前管线中使用的帧采样与视觉编码器机制。

训练阶段优化、通用大模型优化与纯图像方法只作为相邻背景引用。本文配套维护了 1 个公开代码仓库,资源状态显示当前可用,初学者可把它当作 125 篇文献清单的入口,而不是把仓库当作实验证据。

与哪些路线相邻:能力综述与效率综述如何分工?

视频理解此前有多条综述路线。首类讲视频基础模型、视频语言学习与视频大模型架构,重点是能做哪些任务与基准表现。另一类讲长视频理解、时间定位、评测协议与全模态语言模型。效率方向也有通用多模态综述,例如把 token 压缩按底层机制组织,覆盖图像、视频与音频。

本文的差异是视频中心的管线视角。它在前人提出的编码、预填充与解码分段,以及输入、编码器、投影器与大模型干预点分类的基础上,进一步把帧选择与视频编码器设计接到连接器压缩与大模型侧推理,并单独考察音频 token 缩减与音频引导的视觉选择如何影响联合视听负载。

换句话说,它不只问某种剪枝算子好不好,而是问节省发生在管线哪里,上游时间覆盖与编码代价如何传导到下游 token 与内存预算。对语音与音频背景的研究生,这个分工提醒很关键:音频在此不是独立识别任务,而是第 2 路编码与 token 流。

综述只纳入 3 类视听机制,即压缩音频 token 流、用音频减少视觉处理、或约束联合视听 token 流,其余多模态能力讨论不在本文证据范围内。

问题如何界定:高效的比较基准是什么?

综述给高效下了系统级定义:在给定任务与硬件条件下,保持或提升语义性能,同时减少参数量、每输入浮点运算、wall-clock 延迟或内存。功耗与能量也被认为相关,但原文明确指出被调查方法中没有报告能量,因此不做比较。

比较困难来自 3 处异构。第 1 是指标边界不同:视觉编码器比较常报告编码器尺寸与每视角浮点运算并附带片段配置,而连接器与 token 缩减比较常报告主语言模型尺寸,且浮点运算统计边界不同,有的只算大模型预填充,有的把视觉编码也算入。

第 2 是输入协议不同:同样标称浮点运算的 2 套系统可能处理了不同帧数、分辨率与模态。第 3 是系统测量依赖批量大小、序列长度、精度、设备与软件栈,离线延迟与流式响应延迟、吞吐与峰值内存不能直接换算。

因此综述坚持只用每篇论文明确报告的值,记录对应模型变体与输入设置,不从架构推断浮点运算或延迟,也不把 token 保留比换算为浮点运算。跨论文比较只作为指示性证据,真正可比的是共享主模型、输入设置与 token 预算下的文献内复跑。

方法全景:四段管线各管哪种节省?

综述把全部机制按前向过程的位置分为 4 段。第 1 段是输入构建与选择,在编码前选帧、选块、选分辨率或排版。第 2 段是编码器计算,改特征提取算子、减少中间 token 或复用与替代编码计算。第 3 段是编码表示与连接器,在回答用大模型消费之前减少编码输出。第 4 段是大模型执行与状态,在大模型内部减少 token 处理或注意力,构造摘要 token 或管理键值缓存。

分类原则是看它删掉了哪段计算。编码器最后 1 块之后做的池化仍算第 3 段,在编码后做整帧选择也算第 3 段。跨段方法在每段都出现 1 次,但其端到端收益不归因到单段。例如有的选择器先把全部候选帧过 1 遍视觉编码器与投影器再打分,它缩短了回答上下文,但没有省下初始编码。

下图是理解全篇的骨架,初学者应先沿 1 个样本走完输入到输出,再看各章机制插在哪个箭头之间,全文共用这套编码器加连接器加大模型的参照系。

导读:该图展示视频嵌入器乘以大模型的标准范式,顶部同时给出文本指令与视频帧,中间依次经过视频编码器与连接器,底部由大模型生成回答,是后文 4 段划分的共同参照,像素细节可直接观察色块与箭头走向。

看图路径: 1. 先从顶部指令与视频输入出发,沿箭头数出视频编码器、连接器、视觉 token、大模型的先后顺序;2. 再看左侧指令箭头直接进入大模型,确认文本与视觉是在大模型输入处汇合;3. 最后注意连接器下方虚线框内的视觉 token,理解压缩点位于编码之后、大模型之前

原论文 Fig. 2:Video Embedder \\times LLM paradigm.

论文图 2。原论文 Fig. 2::“Video Embedder \times LLM paradigm. A video encoder transforms sampled frames into continuous features; a connector projects or compresses them into the LLM token space, where…”。

解释:图中视频分支自上而下是采样帧进入视频编码器得到时空表示,再经连接器做投影或重采样,输出离散的视觉 token 送入大模型。文本指令从左侧直接进入大模型,与视觉 token 汇合后生成回答。音频扩展沿相同逻辑增加 1 路独立音频编码器与连接器。教学要点是压缩点的位置决定省哪段:连接器之前省编码,连接器处省进入大模型的 token 数,大模型内部省预填充与缓存,而任何在编码后才做的选择都无法退还已付的编码开销。

组件首段:输入构建如何用帧预算换时间覆盖?

帧采样直接减少送入编码器的帧数,同时减少注入语言模型的视觉 token 数。丢掉的帧下游无法恢复,所以这是覆盖与精度的首道权衡。综述区分查询无关与查询相关 2 类,前者只看视频信号,后者以问题或指令为条件打分。代理编码器处理过的候选帧即使目标模型没见过,其代价仍属于选择管线。

固定覆盖基线包括均匀或跨步采样,以及把视频分成固定段每段取 1 片的时序分段网络思想。内容覆盖方法针对分钟到小时视频的时间冗余,例如用核时间分割划分描述子序列再分配采样,或用代理帧嵌入最大化所选子集的几何体积,或用运动显著性做无学习采样。

学习型查询无关选择器用训练好的视觉策略自适应选帧并可早停。查询相关方法通常先算帧文本对齐再强制多样性或覆盖,例如在固定 token 预算下结合提示帧相关性与时间覆盖,或按相关性分配每帧分辨率。2025 年至 2026 年的新选择器多用强化学习或生成式选择,例如只训练数百万参数的时间采样策略。

综述提醒净节省取决于省下的下游工作是否超过打分器自身开销,且优势在稀疏证据问题上明显,在部分综合基准上可能消失。例子:稀疏证据问答可视为查询相关选择最能发挥的场景,均匀采样则可视为无偏基线,教学时不要把例子数值当作论文报告。

帧采样 × 大模型上下文长度: 帧采样分工是在编码前决定保留哪些帧,直接减少编码器要处理的帧数 T;大模型上下文长度分工是决定预填充计算量与 KV 缓存大小,记为 L。搭配理由是被丢掉的帧不再产生视觉 token,可同时降低编码与大模型两段负载;组合意义是上游时间覆盖锁定了下游可用证据上限,下游压缩无法恢复未采样时刻。

组件中段:编码器与连接器各省哪笔账?

编码器效率针对连接器或大模型处理之前的特征提取。综述分 3 小类:高效架构与算子、编码器内部 token 缩减、编码计算复用或替代。很多架构前身是在识别或检索上评测的,其开销与精度不能直接搬到视频问答的端到端结论。

轻量卷积与分层池化注意力 Transformer 用不同方式降本,前者在时间维度做通道移位或渐进扩展,后者在编码器内逐步池化时空 token。状态空间编码器用选择性状态空间模型替代 2 次自注意力,追求线性时间视频编码。紧凑与稀疏编码器或蒸馏 CLIP 式编码器,或让编码器直接输出更少 token。

编码器内部缩减在块之间合并相似 token,早层仍处理全序列。输入块选择在首块之前就删 token,编码器根本看不到它们。复用类方法跨帧传播残差 token 子集、缓存相似帧特征、或直接消费视频编解码器已有的运动与残差信息,用很小的增量编码器替代密集 RGB 编码。

连接器段的缩减发生在编码之后,好处是更小的大模型输入,但已付的编码成本除非上游另有机制否则省不掉。常见手法包括保留最具信息量 token、剪枝合并、参数无关聚类、利用时空冗余的剪枝、按段分配预算、网格池化下采样、学习型重采样器用少量隐查询构造紧凑表示、以及维护编码表示记忆库。

视觉编码器 × 连接器: 视觉编码器分工是把像素变为连续特征,承担空间与时间建模算力;连接器分工是把特征投影或重采样到大模型输入空间,决定多少视觉 token 真正进入大模型。搭配理由是编码器再便宜,若输出 token 全量进入大模型,预填充仍很贵;组合后可用便宜特征加激进压缩换取更多帧覆盖。

组件末段:大模型内部与视听联合如何省内存?

管线最后 1 段针对已投影的视觉 token,它们主导上下文长度,从而驱动预填充开销与键值缓存内存。综述分 5 小类:解码器 token 剪枝合并、稀疏解码器注意力、由大模型层计算的摘要 token、键值缓存压缩、键值缓存卸载与检索。

解码器剪枝利用深层对视觉 token 注意力较弱的现象,在早期层后剪掉低注意力 token,或先跨帧合并时间冗余再按重要性剪枝。稀疏注意力跳过部分注意力对但保留 token 序列,把视频诱导的网格稀疏重排为硬件友好的块。摘要 token 让大模型自身层在注意力约束下计算压缩表示,替代前置重采样器。

缓存压缩用驱逐、合并或量化减少驻留状态,驱逐删条目,量化降低保留条目的精度。卸载则把历史状态保存在显存外,问答时只检索相关块,活跃显存可有界而总存储历史可增长。视听效率证据相对稀疏,报告成本常省略音频编码器,模态消融也不常见。

已有工作显示音频可引导视觉 token 缩减并同时压缩音频流,但语音可能指代屏外事件,可见事件也可能没有有效声音,因此更强的方向是随查询与上下文自适应分配跨模态预算,并在视觉可答、音频可答、联合可答与冲突样本上分别评测。

音频 token 压缩 × 音频引导的视觉选择: 音频 token 压缩分工是减少音频编码器输出进入大模型的数量;音频引导的视觉选择分工是用声音信号决定保留哪些视觉帧或 token。搭配理由是视听流存在时间同步关系,声音突变可提示视觉关键段;组合意义是联合视听 token 预算可向有声事件倾斜,但音频编码器自身开销必须计入,否则节省是虚的。

解码层缩减主要省预填充计算,视觉键值缓存压缩主要省解码内存与延迟,2 者可组合。键值驱逐、合并与量化的证据效应不同,已发表结果也不共享相同协议。流式系统暴露检索与驱逐的权衡,检索保精度但峰值显存接近全缓存,硬上限驱逐用精度换常数内存上限。

KV 缓存压缩 × 稀疏注意力: KV 缓存压缩分工是减少解码时驻留的键值状态,目标是内存与每步解码延迟;稀疏注意力分工是减少预填充阶段实际计算的注意力对,目标是首 token 时间。搭配理由是前者管解码内存,后者管预填充计算;组合后长视频与多轮对话才能同时控制首字延迟与显存增长,但两者加速比不能直接相乘,需实测联合系统。

训练与构造:哪些在训练,哪些只是推理时调用?

这是 1 篇综述,没有统一的新模型训练,因此本节按原文证据说明每类机制的参数与监督状态,而不是假设训练流程。对于即插即用类,原文明确 host 冻结、方法训练无关,例如均匀采样、多数查询相关的训练无关选择器、以及在冻结 host 上复跑的后编码器缩减。这类方法实际计算是调用已有编码器、投影器与大模型做前向,外加选择器或剪枝规则的前向,不存在梯度更新。

需要训练的构造包括 3 类。第 1 类是学习型采样器与轻量选择器,例如在冻结 CLIP 特征上训练时间采样策略、用问答模型的奖励优化策略、或蒸馏标题条件教师排序到小视觉时间打分器,其监督来自伪标签、教师排序或强化奖励,原文报告了可训练参数量与选择延迟,但部分工作未报告选择器开销,缺项需明确指出。

第 2 类是学习型重采样器与记忆模块,例如查询转换器、感知器重采样器、每帧极少 token 的压缩器与循环记忆桥,它们随主系统训练,推理时只做前向压缩。第 3 类是混合解码器方向的微调,例如在剪枝调度下做轻量微调以恢复精度。凡原文未说明冻结还是更新、梯度是否经过选择器、监督来源与重置时机的,1 律视为缺项。

无训练不等于确定性求解,因为即使参数冻结,采样、检索与解码设置仍会影响输出。也不能从参数冻结推定系统输出确定。复现时应先区分训练无关调用与需训练模块,再核对监督信号与可训练参数范围。

实验条件:任务、基准与统计边界如何对齐?

综述覆盖的任务包括分类、定位、描述、检索、问答与对话,输入为 RGB 帧加可选同步音频与派生文本如字幕、语音识别转写或光学字符识别 token。效率比较集中在多选或结构化问答的视频大模型基准,因为它们是被调查方法最常共享的协议,包括短中长不同时长与视频数、问题数配置。早期编码器工作则多在动作识别上报告每视角浮点运算与视角数。

指标分 2 层。解析型硬件无关指标包括参数量、每输入浮点运算与保留 token 数或比例,保留速率单位另有吞吐含义,不能混用。系统级测量包括 wall-clock 延迟、吞吐与峰值内存,解释依赖批量大小、序列长度、精度、设备与软件栈。流式系统额外报告处理速率或响应延迟与随流增长的有界内存。能量是相关但无人报告的指标,不做比较。

公平条件要求固定下游模型、帧预算、基准与划分,否则采样器、视觉表示、连接器与大模型容量相互混杂。综述明确只用论文明确报告的值,记录模型变体与输入设置,参数列遵循来源的统计边界,可能含整机也可能只含语言骨干。

浮点运算提供硬件无关的公分母,但不替代部署速度。延迟、内存与能量的有意义比较需要固定硬件软件栈与测量边界,不同栈的值汇总会制造虚假精度。初学者复述时必须同时核对数据集、模型基线、实验阶段、指标、单位与聚合对象,数值相同不等于相同指标,百分点与相对百分比要分开记录。

主结果首组:编码器在识别操作点上报告了什么?

编码器侧结论必须分任务阅读。识别类结果不直接证明问答端到端效率,但能说明算子与分辨率策略的操作点。下表整理原文连续句子中实际出现的对照,比较问题是:在各自报告的输入协议下,池化注意力改进与状态空间编码器的精度与计算操作点如何分布,指标方向是识别精度越高越好、计算与延迟越低越好。

编码器机制精度对照参数与计算对照速度与内存对照输入与测量条件
池化注意力改进82.9 对 82.751M 对 88M 参数,约 3 分之 1 推理计算原文此句未给速度Kinetics-400,相对 Video Swin
状态空间编码原文此句未给精度原文此句未给参数6× 吞吐,40× 显存降低64 frames,A100-80G,批量 128

表后解释覆盖主要收益与具体代价:该表支持的判断是轻量与结构简化可以在识别操作点上移动曲线,例如更少参数达到相近精度,或同类精度下更快,但不支持跨行排名,因为训练数据与测试视角不同。反例是视角数会重塑表面权衡,原文指出相近精度的骨干因视角数不同导致总计算差异很大。未评测边界是这些编码器浮点运算不含输出 token 数与下游连接器与大模型,转向问答仍需端到端复测。复述时应保留每视角浮点运算乘以视角数的原始口径,不把总量拆为单视角。

主结果第 2 组:连接器前压缩省了多少 token 与预填充?

连接器前缩减的直接收益是更小的大模型输入,代价是已付编码成本与可能的细节丢失。下表只用原文连续句子中的保留比、加速比与延迟降幅,比较问题是:在各自 host 与输入下,方法用多少保留预算换到多少预填充或生成加速,指标方向是保留比越低越省、相对精度越高越好、加速比越大越好。

方法族保留预算预填充或生成收益相对精度条件机制要点
信息 token 选择保留 6.6 %7.8× 预填充加速原文此句未给精度只保留最具信息量 token
自适应剪枝合并平均 14× 视觉 token 压缩原文此句未给加速原文此句未给精度自适应剪枝加合并
时空合并选择10 % 保留6.3× 预填充加速99.1 % 相对精度注意力加多样性选择加树形合并
分段密度剪枝FLOPs 降至 8.3 %7.1× 预填充加速98 % 保留精度按时序分段按密度剪枝
按帧独特性压缩4 分之 1 token生成延迟降 70.8 %原文此句未给精度每帧压缩强度自适应

表后解释覆盖主要收益与具体代价:多类方法在约 25 % 保留下接近基线,而约 10 % 保留下显式建模时间冗余的方法退化更平缓,空间单选更快触顶。未胜出项是纯空间选择在低预算下掉点更多。具体代价是选择器与编码开销:整帧先编码后选择的方法缩短上下文但不省编码,甚至报告高于均匀采样的延迟。跨段联合方法把编码前、连接器前与层内缩减叠加,端到端加速无法归因到单段。固定输入与固定下游预算 2 种评测测的是不同好处,省下的预算也可转为更多帧覆盖而非单纯加速。

主结果第 3 组:大模型侧内存与稀疏计算如何取舍?

大模型侧比较本质受限:各方法在不同骨干、基线与 token 预算下报告保留精度。下表比较问题是:在各自基线下,缓存驱逐、量化、卸载检索与稀疏预填充分别改善内存还是计算,指标方向是内存占用与延迟越低越好、精度越接近基线越好。

大模型侧机制内存或上下文效果计算或延迟效果精度条件关键设计
时序合并加逐步驱逐1.4× 内存降低1.5× 推理加速相对基线视频大模型预填充合并加解码驱逐最低注意力 token
跨模态熵分配 KV 预算KV 内存减 72 %解码快 2.82×多模态长上下文套件按层分配预算
按冗余与范数驱逐峰值显存降 94 %原文此句未给延迟长上下文预算满时驱逐
关键帧剪枝加枢轴驱逐8× 上下文压缩,2048 frames 进 16K 上下文每输出 token 时间降 20 %Qwen2-VL-7B关键帧选择加枢轴引导驱逐

表后解释覆盖主要收益与 trade-off:预填充稀疏与缓存压缩管的是不同部位,前者降首 token 时间,后者降解码内存,两者可组合但需验证兼容性,不能把各自加速比相乘。未胜出或权衡项是检索式卸载在流式问答保精度较好,但峰值显存接近全缓存并需额外 CPU 或磁盘存储。硬上限驱逐用数个点精度换常数内存上限。负结果是解码器层缩减在部分共享复跑中仍掉数个点,说明层内剪枝的预算与调度需与前置压缩联合设计。

消融与反证:离散量化与层内剪枝的代价在哪?

除核心压缩比,还需看两类论文特有细节:表示瓶颈的形式与缩减发生在哪一层。下表比较问题是:当压缩推到每帧极少 token 或层内早期合并时,精度代价与吞吐收益如何变化,指标方向是 token 越少越省、精度下降越小越好。

压缩位置压缩强度精度代价速度或规模收益适用条件
编码器块间合并相似 token 二分匹配合并掉 0.2 % 至 0.3 % 精度ViT-L 视频吞吐升 2.2×识别类评估,非问答端到端
离散码本瓶颈压缩至 0.07 % tokenNExT-QA 掉 0.66 个点视频流极小需保留时空位置哈希
流式帧间去重减少 82.8 %约 98 % 保留流式精度响应快 1.76×内容帧间不变,可迁移到新 host
时空合并选择10 % 保留99.1 % 相对精度6.3× 预填充加速固定 token 预算
分段密度剪枝FLOPs 降至 8.3 %98 % 保留精度7.1× 预填充加速时序分段

表后解释覆盖支持判断与反证:该表支持离散与合并类瓶颈可以在很大压缩下保持可用,但代价形式不同。块间合并的早层仍处理全序列,输入块选择才能让编码器根本看不到删掉的块。离散码本省 token 但依赖码本与位置哈希设计。流式去重在静态内容上收益大,在快切运动与细节任务上需重测。反证是编码器内剪枝在极低预算下介于空间单选与时间感知方法之间,说明只省编码不建模时间冗余不够。吞吐与首字延迟改善不等于解码内存改善,长流仍需缓存侧机制。

边界与缺项:哪些结论不能推广?

首个边界是跨阶段不可比。视觉编码器多在识别上报告,管线后段几乎只在视频问答上报告,且 2023 年至 2024 年多用 GPT 辅助的开放式打分,2025 年至 2026 年转向更便宜的多选,任务与指标变了,效率进步无法按年份连为 1 条曲线。高效识别骨干不等于端到端视频大模型高效。

第 2 是报告粒度不足。多数方法只报告多选问答的总精度,视频多模态基准虽标注内容域与时长,方法仍只报告聚合值,静态讲座验证过的预算与快切体育验证过的预算被混为 1 谈。没有比较表包含描述、检索或定位指标,唯一在描述上评测的选择器因协议不同被排除在共享比较之外。

多选提供候选答案,常靠粗粒度物体场景线索可解,生成式描述与时间边界需要更细细节,多选无损的保留比未必生成无损。第 3 是成本口径缺失。选择或分配模块自身的前向常未计入,音频编码器与分配模块常被省略,浮点运算统计边界不 1,能量无人报告。

综述因此建议未来协议固定视频、提示与模态输入、分辨率与解码设置,即插即用方法再共享冻结 host、候选帧池与帧或 token 预算,并同时报告编码器、连接器与大模型预填充浮点运算、保留 token 数,以及同输入与同计算预算 2 套任务性能,再辅以共享参考栈的系统测量。

复现先做什么:从哪个基线与配置起步?

先复现可比性最强的起点。原文指出新兴的实践起点是约 7 B 语言骨干、32 帧、统一评测工具的配置,已有多个训练无关缩减在此复跑。初学者应先固定均匀采样基线,再接入某 1 后编码器缩减,保持帧数、分辨率、解码设置与评测划分不变,记录保留 token 比、相对预填充浮点运算与多套问答精度的均值相对值。不要开始就改 host 或帧数,否则无法判断收益来自方法还是输入。

再补全被省略的代价。把选择器、辅助模型与音频编码器的前向计入,分别记录编码延迟、预填充延迟、解码延迟与峰值内存。若做流式,另记 1 小时半帧率流的峰值显存与卸载到 CPU 或磁盘的字节数,并区分显存驻留峰值与实验内存约束 2 种口径。

视听实验需做模态消融,至少报告视觉、音频、联合可答样本上的变化,避免音频锚点在某段帮忙、另一段误导被平均值掩盖。代码层面,官方仓库当前可用,可用于找回 125 篇清单与各家族入口,但仓库完整度为部分,能力字段缺失,不能把它当作可运行权重或 1 键复现脚本。

复现仍需回到每篇原论文的输入协议与统计边界,按原文变体与帧设置重跑,核对数据集、模型基线、实验阶段、指标、单位与聚合对象。数值相同不等于相同指标,百分点与相对百分比要分开记录。

收束:何时值得尝试音频与激进压缩?

当部署受限是首字延迟与长上下文显存,且问答证据稀疏时,值得尝试查询相关的帧选择与时间冗余感知的 token 合并,并在约 25 % 保留附近先验证。若要推到约 10 % 保留,应优先选择显式建模跨帧冗余的方法,而不是纯空间单选,同时把省下的预算用于扩大时间覆盖或跨帧连续分配,而不是只看加速比。编码已成瓶颈时,再向上游做编码器内剪枝、特征缓存或编解码器原语替代。

当视频自带同步音频且事件有声时,值得尝试音频引导的视觉缩减与音频 token 下采样,但必须把音频编码器计入,并用视觉可答、音频可答、联合可答与冲突样本分别验证,学习随查询与上下文变化的跨模态分配。纯静态讲座 footage 验证过的预算不要直接用于快切运动,问答多选验证过的预算不要直接承诺描述与定位无损,至少加测 1 个生成或定位任务。

对刚入行的误解要澄清:保留比不说明节省位置,跨段联合方法的端到端加速不能归因到单段。浮点运算是硬件无关公分母,不代表部署速度。检索式内存保精度但不省峰值显存,硬驱逐省显存但掉精度。下一步最缺的不是新算子,而是相同视频、相同提示、相同模态输入下的精度计算协议,以及跨域与跨任务的重测。

📎 论文与评分元数据

排名:前50% | 文档类型:综述 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-11 语音/音乐/音频论文速递