📄 DAVSS: Distilled Audio-Visual State Space Models
标签:#音视频理解 #知识蒸馏 #模型压缩 #高效推理
6.4/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5
✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频理解 | #知识蒸馏 | #模型压缩 #高效推理 | arxiv
👥 作者与机构
Saurabhchand Bhati 与 James Glass 来自麻省理工学院计算机科学与人工智能实验室(CSAIL);Mrudula Athi 与 Amit S. Chhetri 来自亚马逊(Amazon)。论文附有生成式 AI 使用披露,声明相关工具仅用于语法检查等基础编辑。
💡 毒舌点评
这篇论文的工程直觉值得肯定:用状态空间学生模型换掉视听分类里的 Transformer 主干,把联合建模层从不足 5% 加深到 30%,确实抓住了注意力二次复杂度限制融合深度的痛点。但宣传口径需要打折扣。摘要宣称「比 CAV-MAE 小 12 倍仍优于它」,引言却写着「小 3.5 倍」,同一篇论文里两个压缩倍数打架,暴露出写作的不严谨;而对照最终对比表,DAVSS-Medium 在 AudioSet 上仍落后 EquiAV 约 1.9 个 mAP,「优于现有视听模型」的说法只在「以小胜大」这个限定条件下成立。速度方面全文只给了相对推理时间的图,没有任何绝对时延或吞吐数字,效率主张难以落地验证。此外蒸馏收益高度依赖教师质量:换成多帧强教师后,在标准的十帧集成推理下学生性能几乎不动,说明这条路线的天花板被教师牢牢锁死——作者自己也承认未来要走出 CAV-MAE 家族找教师。
📌 核心摘要
论文提出 DAVSS,一种通过知识蒸馏得到的视听状态空间模型,用于音频事件分类。方法以 CAV-MAE 为教师、结构化状态空间模型为学生,训练目标为真实标签二元交叉熵与师生输出 KL 散度的加权组合。设计上有两个关键选择:其一,利用 SSM 的线性复杂度处理更长的输入序列,以更小的 patch 尺寸换取更细的输入分辨率,弥补参数量下降带来的容量损失;其二,把约 30% 的参数投入音频-视觉联合建模层,远超 CAV-MAE 中不足 5% 的比例,使跨模态交互更深而不显著增加拼接序列的计算成本。在 AudioSet 全量 200 万视频训练集上,14.4M 参数的 DAVSS-Tiny 达到 51.6 mAP,超过 165M 参数的教师 CAV-MAE(50.5),84.4M 的 DAVSS-Medium 达到 52.7 mAP 并在 VGGSound 上取得 67.5% 准确率;消融实验确认融合位置、初始化与蒸馏各自贡献明显,分辨率越细性能越好,支持了作者把增益归因于细粒度输入处理的假设。对部署方而言,patch 尺寸还充当了吞吐与精度之间的调节旋钮:以更粗分辨率运行时速度可达教师的约两倍而性能仍不落后。整体来看,这项工作说明线性复杂度序列模型在多模态融合深度上拥有 Transformer 不具备的结构自由度。
这项工作的隐含论点值得展开:多模态融合的深度受限于序列建模的复杂度假设。Transformer 的二次注意力把「早融合」变成了计算奢侈品,社区因此默认晚期融合是合理设计而非无奈妥协;DAVSS 用线性复杂度的序列模型重新打开了这个被锁死的设计空间,说明很多所谓的架构结论其实只是特定基底的副产品。对多模态建模者而言,这是一个比具体数字更有价值的提醒。
🔗 开源详情
- 代码:论文中未提及代码仓库或项目主页。
- 模型权重:论文中未提及训练或预训练权重的发布。
- 数据集:实验使用公开的 AudioSet 与 VGGSound,论文未自行发布新数据。
- Demo:论文中未提及在线演示。
- 论文中引用的开源项目:论文中未提及可直接获取的开源实现链接。
- 其他披露:文末声明生成式 AI 仅用于基础编辑(grammar checks)。
🏗️ 方法概述和架构
模型由音频与视觉两个同构的模态专属编码器和一个联合建模块组成。每个编码器分三个阶段,每阶段包含一个状态空间块与一个基于 patch merging 的下采样层,逐级压缩空间维度并增加特征通道数。视觉编码器接收 224×224 图像,经 patch 嵌入后依次输出 H/P×W/P、H/2P×W/2P、H/4P×W/4P 三级特征;音频编码器对 1024×128 的频谱图做同样处理,输出 T/4P×F/4P 级特征。两路特征先展平拼接再重塑为二维联合特征图,送入最后的联合组处理,池化后的嵌入经线性层给出 527 类分类输出。以 patch 尺寸 4 为例,音频与视觉分支分别产生 32×4 与 7×7 的特征,合并为 59×3 的联合块。
下图展示了 DAVSS 中音频与视觉编码器及联合建模块的详细结构。

两个模态专属编码器各含三个「状态空间块加 patch 合并下采样」的阶段,逐级压缩空间维度并扩展通道;联合块在第三组之后接管拼接后的特征,其参数占比远高于 Transformer 视听模型的末端融合层——这一结构差异正是性能提升的关键来源之一。
训练目标为 \(L=0.5\left(L_{\mathrm{BCE}}(y,\hat{y}_{\mathrm{stu}})+L_{\mathrm{KL}}(\hat{y}_{\mathrm{teach}},\hat{y}_{\mathrm{stu}})\right)\),其中二元交叉熵项约束学生对真实标签的预测,KL 散度项约束学生逼近教师 CAV-MAE 的输出分布;同一视听输入同时喂给师生两个模型。底座为选择性扫描状态空间模型:相比线性时不变的 S4,其状态参数依赖输入内容,无法使用卷积视图并行训练,需借助硬件感知优化与并行扫描算法加速。
训练配置沿用 CAV-MAE 预处理:10 秒视频配平行音频,音频转成 1024×128 频谱,视频按每秒一帧采样 10 帧 RGB,训练时随机取单帧、推理时对各帧预测取平均。学习率 1e-4,共训 10 轮,自第二轮起每轮减半;批大小 36,mixup 概率 0.5。三个规格的模型在两组编码器中分别使用 (2,2,8)、(2,2,8)、(2,2,15) 层,四组特征维度分别为 (64,128,256,512) 与 (96,192,384,768),总参数量为 14.4M、46.9M 与 84.4M。
设计动机上,Transformer 视听模型把两路 token 拼接后送入自注意力,序列长度翻倍导致平方复杂度急剧上升,因此 CAV-MAE 只敢在十二层中的最后一层做联合建模;状态空间模型以线性复杂度处理序列,使得加长输入、加深联合层都不再是计算瓶颈,这正是本文两个核心设计的立足点。蒸馏框架则继承了 DASS 的经验:仅靠从头训练,随机初始化的状态空间学生在分类任务上明显落后于 Transformer,而教师输出分布的软约束能在参数量大幅缩水的情况下补回大部分性能。
蒸馏框架的损失设计虽然简单却有两个细节值得注意:二元交叉熵项保证学生不脱离真实标签分布,KL 散度项传递教师的类间相对关系,二者各占一半权重避免了软目标完全支配训练;同一视听输入同时喂给师生两模型,使 KL 项比较的是对相同内容的理解差异而非输入错位。底座方面,选择性扫描的状态参数依赖输入内容,无法像 S4 那样用卷积视图并行训练,硬件感知优化与并行扫描算法是使其可训练的前提,这也解释了为何此类模型直到近年才可行。
💡 核心创新点
- 把 Transformer 到 SSM 的蒸馏框架从纯音频扩展到视听联合建模。此前 DASS 只处理音频分类,本文证明该范式在双模态拼接序列更长的场景下依然成立,且学生能在 AudioSet 与 VGGSound 双基准上反超教师。
- 深化联合建模层的比例发现。该结论来自控制总参数量的对照实验,排除了单纯加参数的解释,因而对架构设计具有因果层面的参考价值。Transformer 视听模型因注意力平方复杂度被迫把融合压到最后不足 5% 的参数上,本文利用 SSM 的线性复杂度把联合层扩展到 30%,并通过控制总参数量的融合位置消融证明:过浅或过深的融合都会掉点,第三组之后融合最优,说明模态专属层承担着把两路嵌入映射到公共空间的前置作用。
- 细分辨率假说的实证支持。作者假设小模型的性能增益来自以更细粒度处理输入,并用不同 patch 尺寸的系统实验验证:分辨率越粗性能单调下降,同时分辨率也成为调节吞吐与精度权衡的旋钮,允许以两倍速运行仍不落后教师。这一发现把「模型变小」与「看得更细」联系起来,为小模型设计提供了容量之外的补偿维度。
📊 实验结果
主实验在 AudioSet AS-2M(200 万条训练、2.2 万条评估)与 VGGSound(18.3 万训练、1.5 万测试)上进行,评价指标分别为 mAP 与准确率。
| 模型 | 参数量(M) | AudioSet mAP | VGGSound acc |
|---|---|---|---|
| CAV-MAE | 165 | 50.5 | 65.4 |
| CAV-MAE scale+ | 165 | 51.2 | 65.5 |
| Audiovisual MAE | 170 | 51.8 | 65.0 |
| MAViL | 170 | 53.3 | 67.1 |
| EquiAV | 173 | 54.6 | 67.1 |
| DAVSS-Tiny | 14 | 51.6 | 65.4 |
| DAVSS-Small | 47 | 52.5 | 66.7 |
| DAVSS-Medium | 84 | 52.7 | 67.5 |
融合位置消融(四组等参设置):模态专属深度为 2/3/4 组时 mAP 分别为 49.6/50.6/50.0,第三组后融合最佳。蒸馏与初始化消融:随机初始化无蒸馏仅 28.2 mAP,加蒸馏跃升至 47.6;ImageNet 初始化再加至 50.3;音频分支用 DASS 初始化达 52.2,并加快收敛;换更强的 DASSv3 初始化则饱和在 52.1。教师强度消融:多帧 CAV-MAE 教师使单帧推理的学生从 51.5 提到 52.2,配合帧集成达 52.5,但在标准十帧集成下两种教师几乎持平。分辨率实验显示 patch 尺寸增大性能持续下降,且音频分支的 patch 尺寸对推理速度影响大于视觉分支,原因在于相同 patch 尺寸下音频频谱产生的 token 数远多于视觉输入。综合三组消融可以读出一条清晰的证据链:蒸馏贡献了从 28.2 到 47.6 的最大跳变,ImageNet 与 DASS 初始化再补上约 4.6 个 mAP,融合位置与教师强度各自带来约 1 个 mAP 的精细调整;模型最终的反超并非单一技巧的产物,而是这些因素叠加的结果。
下图对比了不同 patch 尺寸下 DAVSS 的推理速度与 mAP 的权衡曲线。

随着 patch 增大、token 数减少,推理速度上升而性能下降,其中 patch 尺寸 6 的配置在速度约为教师两倍的情况下 mAP 仍不落后 CAV-MAE;曲线还显示音频分支的 patch 尺寸对速度的影响大于视觉分支,因为相同尺寸下音频频谱产生的 token 远多于图像。
分辨率假设的验证方式有一个微妙之处:patch 尺寸变化同时改变了输入序列长度与每 token 的信息粒度,两者对性能的贡献无法在该设计中分离。不过辅助证据偏向粒度解释——若纯粹是序列越长越好,那么固定 patch 而加长序列应当同样有效,但论文的帧集成实验显示单纯增加推理帧数收益有限。分辨率作为吞吐旋钮的实用价值则是确定的:部署方可以在精度损失可接受的场景用粗分辨率换取约两倍速度,这种连续可调的特性是固定架构不具备的。
🔬 细节详述
数据与预处理完全继承 CAV-MAE:音频 1024×128 频谱、视频 10 帧 RGB 中 224×224 中心裁剪,训练随机单帧、推理帧集成。训练超参数包括学习率 1e-4、10 轮调度(次轮起每轮减半)、批大小 36、mixup 0.5;损失中两项各占 0.5 权重。架构细节上,联合特征的拼接方式为先展平、拼接、再重塑,例如 patch 尺寸 4 时形成 59×3 的联合块;融合位置实验通过强制两个编码器均为四组来保证不同融合点的总参数量一致,排除参数量混淆。推理测速使用 5000 对视听样本,结论是 patch 尺寸 6 的模型显著快于 CAV-MAE 且性能更高,但论文未给出绝对时延。教师增强实验均匀采样 5 帧(文献指出 4-5 帧后收益饱和)。伦理与披露方面,论文声明生成式 AI 仅用于语法润色。未披露的信息包括:训练硬件与时长、蒸馏温度、数据增强的完整清单以及代码是否开放。补充两点观察:其一,蒸馏温度在损失定义中未出现,KL 项可能使用默认温度,复现者需要自行试探;其二,三个规格的模型共享同一训练配方,未针对 Tiny 规格单独调参,这意味着小模型的成绩可能仍被低估,也说明该配方对规模变化相当稳健。对想跟进的研究者,最直接的路是用开源的 CAV-MAE 权重复现教师侧,再按文中超参数训练学生,但状态空间底座的具体实现版本(S4 还是选择性扫描变体)论文交代得比较简略。
融合位置消融的实验设计尤其讲究:为排除参数量混淆,作者强制两个编码器均为四组,使不同融合点的总参数量严格一致;结果显示第二组后融合(大部分参数用于联合建模)反而最差,说明模态专属层承担着把异构嵌入映射到公共空间的前置作用,跳过这一步会让联合层在不可比的特征上做融合。教师强度实验则揭示了一个实用规律:多帧教师对单帧推理的学生有增益(51.5 到 52.2),但在标准十帧集成下增益消失,说明蒸馏收益的评估必须与推理协议绑定,否则容易高估。
⚖️ 评分理由
- 创新性 (1.2/2):把已验证的音频蒸馏范式推广到视听场景属于合理的增量创新,联合层比例与细分辨率的发现有一定洞察价值,但核心组件(DASS 蒸馏、CAV-MAE、SSM 底座)均为现成技术,方法论新颖性有限。
- 技术严谨性 (1.2/1.5):融合位置消融控制了总参数量,初始化与教师强度实验层层递进,证据链组织良好;扣分在于摘要与正文对压缩倍数的表述自相矛盾(12 倍对 3.5 倍),且速度结论缺少绝对数字支撑。
- 实验充分性 (1.1/1.5):双基准、三规格、四组消融覆盖了主要设计决策,但推理效率只有相对曲线,没有时延、吞吐或内存占用的量化表格,效率主张的验证弱于精度主张。
- 清晰度 (0.8/1):架构描述与公式清楚,消融表完整;倍数表述不一致和图表信息密度不足影响了阅读体验。
- 影响力 (0.9/1.5):高效视听模型是下游检索与边缘部署的实用方向,30% 联合层比例的结论对后续架构设计有直接参考意义,但 AudioSet 上仍未越过 EquiAV、MAViL,范式影响力受限。
- 开源 (0.0/1.5):全文未提及代码、模型权重或训练脚本的发布计划,也没有可访问的项目主页。
- 可复现性 (0.3/0.5):学习率、轮数、批大小、mixup、预处理流程等关键超参数披露完整,基于公开的 CAV-MAE 教师与 AudioSet 数据可以较有把握地复现主要结果。
- 工程/实践价值 (0.9/1.5):14M 参数达到 51.6 mAP 对算力受限的视听应用很有吸引力,分辨率旋钮也便于部署方按算力预算调节吞吐;缺少绝对速度数据削弱了落地指导性。
🚨 局限与问题
- 作者承认更强教师的探索局限于 CAV-MAE 家族,未来需要在家族之外寻找更强的视听教师。
- 作者承认融合位置的消融只做到组粒度,逐层的精细分析留待后续。
- 分析指出:摘要的 12 倍压缩对应 Tiny(14M)与 CAV-MAE(165M)的比较,引言的 3.5 倍表述没有说明对应规格,两种口径并列而未解释,损害了数字主张的清晰度。
- 分析指出:在标准十帧集成推理下,多帧强教师带来的学生增益很小(52.2 对 52.5),蒸馏收益对推理协议敏感,论文对此着墨不足。
- 分析指出:AudioSet 上 DAVSS-Medium 落后 EquiAV 1.9 个 mAP,「优于现有视听模型」的说法应限定为 CAV-MAE 等特定基线或相近效率语境。
- 分析指出:视觉分支训练时只用单帧,时序信息没有进入训练样本,模型更接近静态图像加音频的分类器,与视频理解任务仍有差距。
- 分析指出:无任何开源承诺,权重与训练代码不可得,削弱了其作为高效基线的社区价值。
- 分析指出:蒸馏温度未在损失定义中出现,复现者需要确认 KL 项采用的具体温度配置。
- 分析指出:推理效率只有相对曲线而无绝对数字,约两倍相对速度缺少可核查的吞吐或时延值。