📄 Unlocking Spatial Grounding in Large Audio-Visual Retrieval models
标签:#声源定位 #对比学习 #多模态模型 #音频理解 #Transformer
7.2/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5
✅ 7.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #声源定位 | #对比学习 | #多模态模型 #音频理解 | arxiv
👥 作者与机构
- 第一作者:Hugo Malard(LTCI, Télécom Paris, Institut Polytechnique de Paris, France)
- 通讯作者:Stéphane Lathuilière(Inria at Université Grenoble Alpes, CNRS, LJK, France),根据其机构隶属关系及项目主导角色推断
- 作者列表:Hugo Malard(LTCI, Télécom Paris, Institut Polytechnique de Paris)、Michel Olvera(LTCI, Télécom Paris, Institut Polytechnique de Paris)、Sanjeel Parekh(Meta, Reality Labs Research)、Gaël Richard(LTCI, Télécom Paris, Institut Polytechnique de Paris)、Slim Essid(NVIDIA, France)、Stéphane Lathuilière(Inria at Université Grenoble Alpes, CNRS, LJK)
💡 毒舌点评
这篇工作巧妙地证明了大型检索模型内部存在可解锁的空间信息,并以此在多个基准上大幅碾压此前最佳结果,做到了“鱼与熊掌兼得”。然而,声源静默时效果不佳这一已知难题并未被解决,且推理时的音频条件化需求使得该局部化模块无法直接用于大规模检索,管挖不管填,留下了明显的实用性缺口。
📌 核心摘要
- 本文旨在解决弱监督设置下的音视频声源定位(AV-SSL)任务,其核心挑战在于如何在不使用像素级标注的情况下,从仅具备全局对齐能力的预训练检索模型中恢复出精确的空间定位信息。
- 方法核心是提出LAIP(Localization via Audio-Informed Pooling)框架,该框架通过插入轻量级的音频引导空间池化(AiSP)模块,用帧对齐音频查询中间层视觉token,从而在全局池化前提取出声源位置信息。
- 与先前从零开始训练专用定位模型的方法不同,LAIP创新性地复用了大规模预训练检索模型PE-AV的中间层表征,通过修改视频编码器前的接口,将检索模型成功改造为定位器。
- 主要实验结果极其亮眼:在AVATAR基准上,LAIP的成绩(CIoU 26.22%)几乎比先前的最好方法TAVLO提高了一倍;在AVSBench的S4和MS3子集上,F-score分别达到了65.18%和49.00%,远超此前方法;在ADE-SP上同样取得了33.35% m-IoU的最佳性能。
- 实际意义在于,这项工作提供了统一检索与定位任务的路径,证明无需从头训练即可从现有大规模模型中解锁高质量的空间定位能力,极大降低了对密集空间标注的依赖。
- 主要局限是定位模块依赖音频作为查询条件,导致视频表征无法预先计算,因此在将该模块用于大规模检索时计算开销巨大,不具可扩展性。
🔗 开源详情
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:论文中使用的评估基准包括 AVSBench、AVATAR 和 ADE-SP,训练数据为VGGSound的一个子集,但均未提供数据集下载链接或直接获取方式
- Demo:论文中未提及
- 复现材料:论文正文及附录提供了详细的训练超参数(学习率1e-4、批大小10、轮次10)、模型架构细节(AiSP池化因子{2,2,6}、适配器维度512、特征提取层第16层)以及消融实验配置,但缺少代码、配置文件或模型检查点。
- 论文中引用的开源项目:论文引用了多项第三方工作(如PE-AV、EZ-VSL、TACO、CLIP、SigLIP等),但未提供它们的GitHub或项目主页地址。
🏗️ 方法概述和架构
本文提出的LAIP(Localization via Audio-Informed Pooling)框架的核心目标,是将以全局检索为优化目标的大规模音视频预训练模型PE-AV改造为能够输出像素级声源定位图的定位器,且整个过程仅依赖弱监督(视频级别的音视频配对信号),无需任何密集的空间标注。PE-AV本身由三个基于Transformer的编码器组成:音频编码器、单帧图像编码器和视频编码器。在标准的检索流程中,图像编码器将每一帧的密集空间令牌压缩为一个单一的[CLS]令牌,视频编码器再对这些[CLS]令牌序列进行时序建模以生成视频级表征。这一设计虽然利于高效的跨模态全局对齐,却完全丢弃了帧内的空间细节,构成由检索转向定位的根本性障碍。
下图示意了传统检索模型与LAIP在处理空间信息上的关键差异。

图中,传统流程中图像编码器的[CLS]令牌和空间信息被丢弃,导致定位信息丢失;LAIP则通过定位模块保留了空间信息,并生成兼容视频编码器的令牌。
下图展示了定位模块(AiSP)的具体结构,它是LAIP框架的核心组件。

图中,视觉特征和音频查询经过三级AiSP单元和卷积块的级联处理,逐步降低空间分辨率,最终输出池化令牌和多尺度分割热图。
LAIP的方法流程可概括为:输入视频片段及对应音频→冻结的音频与图像编码器提取特征(含关键的中间层空间令牌与帧对齐音频查询)→可训练的音频引导空间池化(AiSP)模块逐步将密集空间令牌汇聚为保留声源信息的替代[CLS]令牌→带有轻量适配器的冻结视频编码器处理替代令牌序列以得到最终视频表征→通过多损失联合训练使模型在定位声源的同时保持与预训练检索空间的兼容性。整个过程的定位图由AiSP模块中自然产生的跨模态注意力图导出,无需额外的定位分支。
下图展示了LAIP的整体框架流程,用于将预训练的检索模型改造为定位器。

图中,冻结的图像编码器提供空间令牌,音频编码器提供帧对齐的查询,可训练的定位模块将这些令牌汇聚成替代[CLS]令牌,输入到带有适配器的视频编码器中。
LAIP完全冻结PE-AV的音频编码器和图像编码器,以保留其在大规模数据上学习到的丰富音视频语义。图像编码器采用Vision Transformer(ViT)结构,共24层,输入为单帧图像,输出包含一个[CLS]令牌和一组密集空间令牌。论文观察到,随着层数加深,空间细节在图像编码器的深层逐渐被全局池化操作抹除,因此特意从第16层(即倒数第9层)提取密集空间令牌\(V_t^{\ell} \in \mathbb{R}^{HW \times F}\)(\(H, W\)为特征图的空间尺寸,\(F\)为特征维度),而非取最后一层的[CLS]令牌。这一设计选择是方法有效性的重要前提:深层[CLS]令牌已过度全局化,难以从中恢复精确的空间对应关系;而中间层令牌仍保留着足够丰富的局部结构信息,为后续音频引导的空间池化提供了原始素材。
音频编码器对音频波形进行短时傅里叶变换并提取频谱图特征,通过Transformer编码后输出一个全局音频[CLS]表征\(A_g^{(i)}\)(用于后续对比损失)以及一个音频令牌序列\(\{a_t\}\)。由于音频的帧率和视频的采样帧率通常不一致,LAIP引入了一个轻量级的“局部聚合器”来实现帧率对齐。该聚合器由两层一维卷积和一个时序平均池化层组成,对音频令牌序列进行降采样,为每一帧图像生成一个帧对齐的音频查询向量\(a_t \in \mathbb{R}^F\)。这一查询向量将作为后续所有池化操作的条件信号,驱动视觉特征的聚合过程。
定位模块被插入在图像编码器与视频编码器的接口处,是整个方法的枢纽。它由三级级联的AiSP单元组成,每个AiSP后接一个轻量的卷积适配块,三级池化核\(K\)依次为\(\{2, 2, 6\}\),将空间尺寸逐步下采样直至退化为单个替代[CLS]令牌\(\tilde{c}_t^L\)。这种层级设计并非单纯的工程选择,而是出于对Vision Transformer中“寄存器”(register)token现象的深刻考量——部分视觉令牌具有异常高的范数及过度全局化的语义,容易主导交叉注意力权重,破坏空间选择性。采用卷积-池化范式、在局部块内完成空间下采样的方式,能够有效抑制这些全局异常令牌的影响,使池化过程始终保持空间局部性。
每个AiSP模块(以池化核\(K\)为例)的内部计算流程如下:
- 输入:空间尺寸为\(H \times W\)的视觉令牌图\(V_t\)和帧对齐音频查询\(a_t\)。
- 查询-键-值投影:将视觉令牌分别线性投影并规一化,得到键集合\(\{k_i\}\)和值集合\(\{v_i\}\)(\(i=1,\dots,HW\));音频查询经线性投影和规一化后得到查询向量\(q_a\)。
- 全局注意力计算:通过缩放点积注意力计算全局Softmax注意力图\(\alpha \in \mathbb{R}^{H \times W}\),该图明确反映了音频在当前帧中对每个空间位置的关注程度,因此可直接用作声源定位的分割图。注意力计算保持了全局归一化特性,即\(\sum \alpha_i = 1\),确保概率质量守恒。
- 空令牌机制:在键序列中拼接一个可学习的“空令牌”\(x_{\empty}\)。当音频内容与视觉场景不匹配时(如无声帧、画外音或负样本对),模型可将注意力转移到空令牌上,从而避免对任何图像区域产生虚假激活。这一机制既是处理现实视频中声源不可见情况的有效手段,也是一种重要的正则化,防止负样本时的错误激活。
- 空间加权池化:将注意力图\(\alpha\)与值\(v_i\)逐元素相乘,并在每个\(K \times K\)非重叠空间块\(\mathcal{B}_{u,v}\)内进行加权求和,得到池化后的特征图\(Y \in \mathbb{R}^{\frac{H}{K} \times \frac{W}{K} \times F}\)。与局部归一化的池化不同,该方法保留了全局归一化的注意力分数,使得部分不包含声源信息的块可以自然获得极小的响应,避免将无关背景信息强行拉入聚合特征。
每个AiSP之后跟随一个卷积核大小为3的轻量卷积块,用于进一步精炼池化后的空间特征。三级AiSP形成一个从高分辨率到低分辨率的金字塔结构,不仅输出了一个与原始[CLS]令牌维度相同的替代令牌\(\tilde{c}_t^L\),还同时产生了三个不同分辨率的注意力图\(M_1, M_2, M_3^h\)(其中第三级使用8头注意力,以应对低分辨率下的多模态性)。多尺度注意力图的层级一致性由后续损失函数强制约束,而最终的定位热图则通过上采样并平均\(M_1\)、\(M_2\)及最优头\(M_3^{h^\star}\)获得,实现了多尺度信息的充分融合。
由AiSP生成的替代[CLS]令牌序列\(\{\tilde{c}_t^L\}_{t=1}^T\)被送入PE-AV的视频编码器(Transformer)以捕获跨帧时序动态并输出视频级表征\(O(i,j)\)。这里的\(O(i,j)\)表示:视觉输入来自视频\(i\),而驱动池化的音频查询来自视频\(j\)(当\(i=j\)时构成正样本对)。由于替代令牌与预训练时的原始[CLS]令牌在分布上存在固有差异,直接将其注入完全冻结的视频编码器会导致模型坍塌——定位模块可能退化至简单模仿原始[CLS]令牌而忽略音频信息。为此,LAIP在视频编码器的MLP层中插入了少量可训练的适配器(Adapter,瓶颈维度512),总参数量仅约7M,使视频编码器能够适应新的输入分布,同时整个预训练视频编码器的其余参数保持冻结,从而既利用其强大的时序建模能力,又避免破坏原有检索表示空间。在仅需检索的场景下,可直接丢弃适配器并恢复原始PE-AV的前向过程,实现检索性能的完全保留。
整体架构如图2所示(原文图2)。输入视频片段的所有帧并行通过冻结的图像编码器,取第16层输出得到密集空间令牌;音频经音频编码器得到音频令牌序列及全局[CLS]表征,局部聚合器将音频令牌序列对齐至视频帧率后,送入定位模块。定位模块(图3a)内部由三级AiSP及卷积适配块串行组成,每一级的视觉特征图空间尺寸递减,最终汇聚为替代[CLS]令牌序列。该序列经过插入适配器的视频编码器后得到视频级表征,与全局音频[CLS]表征一同计算Sigmoid对比损失。同时,AiSP三级产生的注意力图参与多分辨率正则化损失和空令牌正则化损失。定位模块完全基于音频条件构建视觉表征,使得最终的视频表征\(O(i,j)\)对声源位置高度敏感,其内部的注意力图即为声源定位的直接输出。
总损失由三项组成:\(\mathcal{L}_{SIG} + \lambda\mathcal{L}_{MRes} - \mu\mathcal{L}_{\empty}\)(典型超参数\(\lambda=100, \mu=0.01\))。Sigmoid对比损失\(\mathcal{L}_{SIG}\)将音频条件视频表征与全局音频表征进行对齐,保留了跨模态判别能力,同时迫使AiSP产生有利于对齐的精确空间注意力;多分辨率正则化损失\(\mathcal{L}_{MRes}\)通过计算相邻分辨率注意力图之间的Frobenius范数,迫使不同尺度的注意力在空间上一致,消除了池化过程中可能产生的不确定性,并使得多尺度融合成为可能;空令牌正则化损失\(\mathcal{L}_{\empty}\)鼓励模型在负样本对上关注空令牌,有效处理无可见声源场景。这一系列精心设计使得在不使用任何密集标注的情况下,仅靠全局对比学习即可驱动AiSP学会精确的声源定位,成功将预训练检索模型“解锁”为高性能声源定位器。
💡 核心创新点
- 范式创新:从检索模型中“解锁”空间定位能力:不同于主流方法从头训练专用定位模型,本文首次系统性证明大规模音视频检索模型的中间层保存了可被利用的丰富空间结构,并提出LAIP框架将其解锁,为复用大规模预训练模型提供了新范式。
- 音频引导的层级空间池化机制(AiSP):提出了一个新颖的渐进式跨模态池化模块。它以音频为查询,通过三级级联和局部块内聚合的方式引导视觉特征的空间压缩,既能产出与下游时序编码器兼容的帧级表征,又能生成多尺度定位热力图,巧妙地统一了定位和检索两个任务的表示需求。
- 兼容检索架构的弱监督训练策略:通过Sigmoid对比损失、空令牌正则化和多分辨率一致性损失的组合,LAIP在没有真实标注掩码的情况下,成功训练了该定位模块,并确保其输出与预训练的视频编码器保持兼容,隐式地利用了预训练知识进行蒸馏。
- 多分辨率注意力一致性正则化:针对多级池化架构,提出一种无需真实值标签的空间正则化损失,强制相邻尺度的注意力图保持一致性,有效地从多尺度表征中提炼出更清晰、更鲁棒的定位信号。
📊 实验结果
论文在AVATAR、AVSBench和ADE-SP三个基准上进行了全面评估。
下图展示了LAIP在电锯声源场景下的定位效果,与基线方法TACO进行定性比较。

图中可见,LAIP的定位热图更平滑地覆盖在声源(电锯)上,离群激活点较少,说明其空间定位更为精准和一致。
AVATAR数据集结果:LAIP在所有场景下均大幅超越此前最优方法TAVLO。
| 方法 | 单声源 CIoU (%) | 单声源 AUC (%) | 混音 CIoU (%) | 混音 AUC (%) | 多实体 CIoU (%) | 多实体 AUC (%) | 画外音 TN (%) |
|---|---|---|---|---|---|---|---|
| TAVLO (10k) | 13.42 | 14.08 | 14.13 | 14.52 | 12.08 | 12.69 | 91.18 |
| EZ-VSL on PE features (10k) | 13.08 | 13.97 | 12.12 | 12.78 | 11.10 | 11.91 | 92.62 |
| LAIP (Ours, 10k) | 27.63 | 27.77 | 27.35 | 27.40 | 23.69 | 23.85 | 90.94 |
AVSBench数据集结果:LAIP在F-score上大幅领先,在更具挑战性的MS3子集上mask-IoU也最优。
| 方法 | S4 mask-IoU (%) | S4 F-score (%) | MS3 mask-IoU (%) | MS3 F-score (%) |
|---|---|---|---|---|
| SLAVC | 28.10 | 34.60 | 24.37 | 25.56 |
| TACO | 29.68 | 41.91 | 25.88 | 30.72 |
| LAIP (Ours) | 39.31 | 65.18 | 30.77 | 49.00 |
ADE-SP数据集结果:LAIP同样取得了最优性能,且是唯一基于检索模型的方法中得分最高的。
| 方法 | 检索模型 | m-IoU (%) | mAP (%) |
|---|---|---|---|
| DenseAV | 否 | 25.5 | 32.4 |
| TACO | 否 | 27.74 | 35.75 |
| CAV-MAE Sync | 是 | 22.7 | 22.6 |
| LAIP (Ours) | 是 | 33.35 | 53.57 |
消融实验:消融实验证实了各组件的关键作用。在AVATAR平均指标上,完整LAIP(CIoU 26.22%)优于去除空令牌正则化 \(\mu=0\)(23.01%)、同时去除空令牌和多分辨率一致性损失 \(\mu=\lambda=0\)(19.45%)、仅使用单头注意力池化(14.34%)、使用最后一层特征(15.92%)以及将AiSP模块中的CNN替换为Transformer(21.61%)。这表明层级式卷积池化设计、空令牌机制和中间层特征选择均不可或缺。
🔬 细节详述
- 训练数据:使用从VGGSound数据集中筛选的10,000个高帧率视频子集,与TAVLO保持一致,以便公平对比。
- 模型参数量:LAIP总参数量约35M,而PE-AV有1.7B。新增的Adapter约7M参数。
- 损失函数与超参数:总损失结合Sigmoid对比损失(\(\mathcal{L}_{SIG}\),含可学习温度\(\tau\)和偏置\(b\))、多分辨率正则化损失(\(\mathcal{L}_{MRes}\),权重 \(\lambda=100\))和空令牌正则化损失(\(\mathcal{L}_{\emptyset}\),权重 \(\mu=0.01\))。
- 训练策略:使用学习率1e-4,批大小10,训练10个epoch。图像编码器特征取自第16层。除新增模块和Adapter外,PE-AV预训练权重全部冻结。
- 训练硬件:论文未提供GPU型号和训练时长。
- 推理细节:最终定位热力图由三张注意力图(第一级高分辨率图 \(M_1\)、上采样后的中分辨率图 \(Up(M_2)\)、上采样后最佳匹配的低分辨率图 \(Up(M_3^{h^\star})\))平均得到,并经过最小-最大归一化至 \([0, 1]\) 区间。最佳匹配头 \(h^\star\) 由 \(\arg\min_{h}||M_2 - Up(M_3^h)||_F\) 决定。
⚖️ 评分理由
创新性 (1.6/2):提出LAIP框架,首次系统性证明大型音视频检索模型中间层保留可解锁的空间定位信息,通过音频引导层级空间池化(AiSP)实现弱监督声源定位,区别于从零训练定位模型的主流范式(A_SUMMARY 1/2/3, A_METHOD开头)。
技术严谨性 (1.3/1.5):基于中间层保留空间细节的观察选择特征层,以卷积池化层级抑制ViT注册令牌效应,引入空令牌和适配器处理声画不匹配与分布偏移,技术推导严谨,消融实验证实各组件必要性,无逻辑漏洞(A_METHOD各节, A_RESULTS消融)。
实验充分性 (1.2/1.5):在AVATAR、AVSBench和ADE-SP三个基准上评估,包含详细消融和主流基线对比,验证了跨数据集泛化能力;但未在PE-AV以外的检索模型上验证通用性,未评估对检索任务本身性能的影响,失败案例深入分析不足,实验充分性仍有提升空间(A_RESULTS, A_LIMITS)。
清晰度 (0.8/1):论文结构清晰,图2/3/4等示意图准确表达架构与流程,方法用公式和分步描述具体,实验表格完整,定性分析与失败案例辅助理解,无明显表达混乱或符号歧义(S_HEAD/S_MIDDLE图示描述)。
影响力 (1.0/1.5):证明预训练检索模型可被改造为高性能定位器,在多个基准上大幅提升,特别是AVATAR指标近乎翻倍,为复用大规模多模态模型提供新路径;但因音频条件池化导致检索不可扩展,实际应用范围受限,整体影响力可观但有限(A_SUMMARY 4/5, A_LIMITS)。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.3/0.5):论文提供了学习率、批大小、池化因子、特征层等关键超参数和架构细节,附录补充了消融细节与评估协议说明,但未报告训练GPU型号和训练时长,硬件信息缺失,可复现性存在少量缺失(A_METHOD参数描述, 细节详述“训练硬件未提供”)。
工程/实践价值 (1.0/1.5):新增35M参数、7M适配器,轻量复用1.7B预训练骨干,在弱监督下实现定位能力解锁,体现了高效工程利用;但音频条件化视频表征导致无法离线预计算视频特征库,阻碍大规模检索场景下的实际部署,工程价值受到折扣(A_SUMMARY 5/6, A_LIMITS)。
🚨 局限与问题
- 论文明确承认的局限:作者明确指出,由于AiSP模块使视频表征依赖于音频查询,因此在进行大规模检索时,无法像传统方法那样离线预计算视频特征库,导致每次查询都需要在线计算,计算开销巨大,不具备可扩展性。虽然可以丢弃适配器恢复原检索模型,但LAIP模块本身无法直接改善大规模检索。
- 审稿人发现的潜在问题:
- 声源静默问题未解决:论文展示的失败案例(图9)显示,对于极小或极大的声源,模型表现不佳。此外,虽然在画外音场景的定量指标TN上表现尚可(90.94%),但略低于一些基线方法(如EZ-VSL的96.91%),说明模型在处理无可见声源时仍有改进空间。作者将此归因于TN指标的阈值偏差,但并未提供修正后的评估结果,稍显论证不足。
- 与检索任务的脱节:虽然论文声称提供“统一路径”,但其方法实质上是在检索模型“外面”套了一个定位模块。定位需要新增模块和重训,而检索引擎本身未获任何增强。标题中的“Unlocking”(解锁)一词极为精准,但目前只是“能解锁”,而非“解锁后能更好地服务原任务”,这一gap需要更坦诚地讨论。
- 对特定backbone的依赖:方法设计和实验完全建立在PE-AV模型之上。虽然理论上可泛化,但其对PE-AV特有瓶颈(如
[CLS]token的接口修改)的针对性过强。论文未对其他主流音视频检索模型(如基于ViT的ImageBind变体)进行实验,其在更通用架构上的有效性有待验证。 - 性能差异分析不足:在AVSBench上,LAIP的F-score远高于mask-IoU,作者解释为其注意力图天生“尖锐”(sharp and peaky),不适应固定阈值0.5。虽然逻辑成立,但缺乏对如何平滑或校准生成热力图以提升mask-IoU的探索,留下了一个可供改进的空间。