英文题目:CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
会议身份:
conference:aaai:2026:conference-paper-id:38374
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#多模态学习 #弱监督学习 #音视频 #音频事件检测
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jinxing Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Ziheng Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Yanghao Zhou:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxin Mao:机构信息未能从会议 PDF 纯文本可靠映射
- Zhangling Duan:机构信息未能从会议 PDF 纯文本可靠映射
- Dan Guo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
弱监督稠密音视频事件定位输入为长未剪辑视频与同步音频且仅提供视频级多标签,输出为同时在双模态中共现的每个事件类别与起止时间,难点在于无时间边界监督且事件密集重叠需抑制单模态背景干扰。首先互事件一致性评估为每段独立预测音频与视觉事件概率并用Jensen-Shannon散度度量分歧,取补得到逐时间戳一致性分数。然后跨模态显著锚点识别依据该分数在全局视频取Top-K与在多个局部时间窗口内取Top-k时间戳,抽取对应音频与视觉特征并融合成紧凑多模态锚特征。接着基于锚的时间传播以锚特征为键值增强全时序音视频特征,并结合前景权重输出逐段音视频事件概率再经多示例学习池化与视频级标签计算交叉熵。与隐式交叉注意力融合或依赖外部大模型伪标签的方法不同,该链条将可信点显式压缩为锚再做查询式语义传播,减少背景污染并保留细粒度时序结构。在UnAV-100基准下,CLASP的平均mAP指标为30.0,高于CCNet基线的26.9。该结论适用边界限于给定冻结特征与评测协议下的双模态共现事件,低一致性与单模态事件等场景尚未验证。训练成本与推理开销受限于原文配置,UnAV-100上训练40轮且模型计算量为5.7G FLOPs并在NVIDIA A40硬件上评测。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入只有视频级标签时,定位难在哪里?
本文的研究对象是长而未剪辑的视频及其伴随音频。输入是一段被均匀切成 T 段的视频,每段有对应的视觉片段与音频片段。训练时给的监督只是一个视频级多标签向量,告诉模型整段视频出现过哪些事件类别,不告诉每个类别从第几秒到第几秒出现。测试时则要求模型输出每个事件的开始时间、结束时间与类别,评测会把预测段与真值段按时间交并比进行比较。
初学者容易把这个任务理解成普通的视频分类加后处理。区别在于普通分类只需要回答整段视频有没有,而这里要求回答每一时刻是什么。弱监督意味着时间轴上没有逐帧类别监督,模型必须自己决定把视频级语义分配到哪些时刻。如果某时刻音频与视觉都指向同一类别,这个时刻就相对可信;如果两边各说各的,就可能是单模态事件或背景噪声。本文把前者称为跨模态显著锚点,后续方法都围绕如何找到这些锚点并把它们的语义铺开。
稠密音视事件定位 × 弱监督稠密音视事件定位: 稠密音视事件定位要求在未剪辑长视频中给出每个音视共现事件的起止时间与类别,训练时有逐段边界;弱监督稠密音视事件定位输入相同但训练时只有视频级多标签,不知道事件在何时出现。二者分工是前者定义交集事件与稠密评测方式,后者定义缺失时间监督后的新难点,搭配意义是本文方法必须把分类语义从可靠时刻传播到全时序才能补上缺失的边界监督。
已有路线为何不能直接搬到长视频弱监督?
与本文同输入、同目标但监督不同的第一条路线是全监督稠密音视事件定位。代表性做法是先用跨模态金字塔编码器在多时间尺度融合音视特征,再做联合的类别分类与边界回归。原文提到这类方法在全监督下可达约 50% 平均精度,但在弱监督下回归分支缺少起止时间监督,难以直接训练,因此本文把任务重构为显式的逐时刻事件分类问题,不再直接回归边界。
第二条路线是短视频的音视事件定位与音视解析。它们同样只用视频级标签,常用跨注意力融合、显著片段发现、背景抑制、标签去噪或借助外部大模型生成伪标签。原文指出这些工作大多面向已剪辑好的短视频,事件在时间上相对集中。搬到平均含多个事件、最长可达数十秒甚至上 100 秒的未剪辑视频时,事件会在多个位置重复出现,单靠全局池化或单点显著性容易漏掉分散的事件。
第三条路线是直接把全监督长视频模型降级到弱监督使用。原文把这类基线也纳入比较,目的是检验同一运行阶段下结构是否通用。报告显示它们在弱监督下的平均精度明显低于本文方法,支持了需要专门设计锚点发现与语义传播的判断。这也说明类别差异不能当成同条件胜负,本文的比较限定在相同弱监督训练与相同评测协议下进行。
一个篮球场例子如何走完从标签到时间条带?
下面用一个教学例子串起任务,例子中的类别名来自原文插图,不代表新的实验结论。假设一段 40 秒的篮球场视频,弱标签只写了人群、欢呼、篮球弹跳 3 个词。模型看不到每个词出现在第几秒,只能看到整段的画面帧序列与音频波形。理想输出是 3 组时间条带,分别标出每个类别在时间轴上的起止位置,且只保留音频与视觉同时成立的部分。
沿样本走一遍:输入是按时间切分的视觉段与音频段;表示是各自经预训练主干得到的特征;组件需要先对每时刻独立预测音频事件概率与视觉事件概率,再比较两者是否一致;目标是得到逐时刻的音视事件概率;输出是经前景门控后的逐时刻概率,推理时按阈值取类并连成事件段。这个流程的关键是中间的一致性判断,它决定了哪些时刻值得信任。
以下导读帮助建立任务图像:上方面板是随时间展开的画面与波形,下方面板是音频事件、视觉事件与交集事件的三排条带,红色标记是双模态最一致的时刻。
看图路径: 1. 先看顶部弱标签与底部三排事件条带的对应关系;2. 再对比音频事件、视觉事件与最下交集事件的差异;3. 最后沿红色虚线找到标为显著锚点的时刻位置
论文图 1。原论文 Figure 1:“Illustration of the Weakly-supervised Dense Audio- Visual Event Localization (W-DAVEL) task.”。
从像素可见,顶部弱标签列出 3 个类别,下方波形从 0 秒延续到 40 秒,三排条带用不同颜色区分人群、欢呼与篮球事件。最上一排交集事件明显短于下面两排单模态事件,说明只有双模态同时成立才被保留。红色虚线锚点并非均匀分布,而是落在多条带重叠或事件切换附近,这与原文把锚点定义为预测可靠且跨模态语义高度一致的时间戳是一致的。该图只用于理解输入与输出形态,不提供可复述的数值结论。
CLASP 把全流程切成哪五步?
CLASP 的整体安排是 5 步流水线。第一步是单模态特征准备,用冻结的预训练主干分别提取音频与视觉的初始特征,并经卷积映射到共享维度。第二步是互事件一致性评估,对每时刻独立预测音频与视觉的事件概率,再用分布差异度量得到一致性分数。第三步是跨模态显著锚点识别,按该分数分别做全局与局部取点,并把音频与视觉锚点融合成多模态锚点。第四步是基于锚点的时间传播,先用单模态变换器建模时序关系,再用交叉注意力让时序特征查询锚点。第 5 步是分类与训练,输出前景权重与音视事件概率,训练时经多实例池化得到视频级预测再与弱标签算损失。
以下导读帮助定位各模块在图中的位置:左上是特征准备,中间是分类器加差异计算,右上是全局与局部分支,下方是传播与分类输出。
看图路径: 1. 先沿左上到右下追踪从特征准备到分类输出的主路径;2. 再看中间一致性分数如何同时送入全局与局部分支;3. 最后看底部传播模块中锚点作为键值被时序特征查询的位置
论文图 2。原论文 Figure 2:“Illustration of our cross-modal salient anchor-based semantic propagation (CLASP) framework for W-DAVEL.”。
从像素可见,左上两路分别用图像堆叠加 I3D 与波形加 VGGish 得到序列特征;中间两路事件分类器输出后汇入平均分布再算散度,得到随时间起伏的一致性分数;右上全局分支标注从整段取前 K 个,局部分支标注在每个局部窗内取前 k 个,两路经加法与线性层汇成统一锚点;底部两路变换器输出后再以锚点为键值做交叉注意力,最后经拼接分类与前景相乘得到逐时刻概率。该图只展示数据流向与汇合点,具体计算细节见后续组件小节。
一致性分数如何算出,锚点如何取出?
互事件一致性评估的输入是初始音频特征与视觉特征,形状都是时间步乘特征维。每个模态各用一个独立分类器,先线性加激活再线性加激活,输出每时刻每个类别的概率,记为音频概率与视觉概率。目标是衡量两组概率在每个时刻有多不一致。原文明确用詹森香农散度实现:先取两者的平均分布,再分别算平均分布到各自的分歧并取平均,最后在类别维平均得到每时刻一个标量,再用一减该值得到一致性分数。分数越高表示 2 模态在事件类别上越一致。
跨模态显著锚点识别以上述分数为唯一指示器。全局识别直接在整条时间轴取分数最高的 K 个下标,取出对应的音频与视觉特征,得到全局音频锚点与全局视觉锚点。局部识别先把视频分成 M 个时间窗,每窗含向下取整的时间段数,在每窗的分数切片内取前 k 个,得到每窗的锚点集合,再把所有窗的锚点拼起来经线性层对齐到 K 个。最后把全局与局部按模态相加,再把音频与视觉拼接经两层线性融合成最终的多模态锚点。原文默认全局 K 取 10,每窗 k 取 4,UnAV-100 的窗口数取 14,ActivityNet1.3 取 16。
互事件一致性评估 × 跨模态显著锚点识别: 互事件一致性评估负责逐时刻比较音频分支与视觉分支预测的事件概率分布,给出一致性分数;跨模态显著锚点识别负责按该分数挑出最可靠的时间戳并取出对应特征。二者搭配的理由是弱监督下没有逐帧标签,只能用双模态是否说一致来代替可靠性,组合后把不可靠时刻的分类问题转化为向可靠锚点查询语义的问题。
全局锚点识别 × 局部锚点识别: 全局锚点识别在整条视频范围内取一致性分数最高的 K 个时刻,负责抓住视频中最确定的事件;局部锚点识别把视频切成 M 个时间窗,在每个窗内取前 k 个时刻,负责不漏掉分散在不同位置的重复事件。二者搭配是因为长视频事件多次出现,只取全局容易集中在一段,组合相加后得到既有代表性又有覆盖度的锚点集合。
锚点语义如何被搬运到每一时刻?
基于锚点的时间传播先解决模态内时序建模。原始音频与视觉特征各自经过两层单模态变换器,得到具有上下文的时序特征。消融显示一致性分数用变换器前后的特征会有差异,原文报告用初始特征计算一致性更好,说明一致性判断不需要先做时序平滑,而传播阶段则需要时序上下文。
随后是跨注意力的搬运过程。时序音频特征与时序视觉特征分别作为查询,多模态锚点同时作为键与值。注意力权重反映该时刻与锚点所编码事件是否相关,权重高的时刻会更多吸收锚点语义,再经残差相加得到增强后的时序特征。直观理解是锚点像词典中的可靠例句,每个时刻都去查词典中哪些例句与自己相关,再把相关例句的语义复制一份过来。这种设计让可靠时刻的类别信息可以扩散到边界模糊或单模态较弱的时刻。
多模态锚点特征 × 基于锚点的时间传播: 多模态锚点特征是把音频锚点与视觉锚点拼接再经线性层融合后的紧凑表示,负责承载最明确的音视共现语义;基于锚点的时间传播负责让每时刻的时序特征以交叉注意力查询该锚点表示。二者搭配的理由是锚点本身只是少数点,必须通过查询权重把语义按需搬运到全时间轴,组合后才形成逐时刻可分类的增强特征。
没有逐帧标签时,损失从哪里来?
分类与训练阶段同时产生两个输出。第一个是前景权重,对增强后的音频与视觉特征各用线性加激活得到每时刻一个标量,取两者平均作为整体前景分数,用来表示该时刻更像事件还是背景。第二个是音视事件概率,对拼接后的音视特征用分类器得到每时刻每个类别的概率,再与前景分数逐元素相乘以压制背景段。推理时直接用门控后的逐时刻概率按阈值取类,原文推理阈值取 0.5。
训练监督只来自视频级标签。具体做法是把逐时刻概率在时间维做多实例池化,得到视频级预测,再与视频级真值算交叉熵损失。用于一致性评估的单模态概率也按同样方式施加正则。原文未报告梯度是否截断、锚点取点是否可微、池化具体是平均还是注意力加权之外的细节,因此复述时只能说监督来源是视频级标签经时间聚合后的分类损失,不能推定取前 K 操作的梯度路径。
前景权重 × 音视事件概率: 音视事件概率负责回答每时刻属于哪一类事件,由拼接后的音视特征经分类器得到;前景权重负责回答该时刻更像事件还是背景噪声,由单模态特征经线性加激活得到。二者搭配的理由是弱监督下背景段容易被误判为事件,相乘后可以压制背景段,组合意义是用门控后的概率做推理,用其时间池化后的视频级预测做训练监督。
在哪些数据与特征上验证,评测口径是什么?
实验覆盖两个长视频数据集。UnAV-100 含 10790 段未剪辑视频,总时长超 126 小时,多数超过 40 秒,覆盖 100 类音视事件,平均每段 2.8 个事件,最多 23 个,按 3 比 1 比 1 划分训练验证测试。ActivityNet1.3 含 19994 段长视频,平均约 100 秒、平均 1.41 个动作类,覆盖 203 类日常与体育表演动作。原文把后者也用于检验泛化性。
特征与训练配置按数据集分别交代。UnAV-100 按 25 帧每秒采样,用光流加连续 RGB 送双流 I3D 得 2048 维视觉特征,音频按 0.96 秒窗、0.32 秒步长切片后用 VGGish 得 128 维特征,最大时间长度取 224,不足补零、超长截断。ActivityNet1.3 视频采样 16 帧每秒、音频 16 千赫,视觉用 R2+1D-34、音频仍用 VGGish,最大长度取 256。UnAV-100 训练 40 轮、批量 16,ActivityNet1.3 训练 40 轮、批量 8,优化器均为 Adam、学习率 1e-4,在单张 40 GB 显存卡上运行。评测指标是时间交并比阈值从 0.5 到 0.9 步长 0.1 的平均精度,以及 0.1 到 0.9 的平均值,数值越大表示定位越准。
与同条件基线相比,收益与代价是什么?
比较的问题是:在相同弱监督训练与相同评测协议下,锚点传播是否优于直接沿用短视频解析模型与全监督长视频模型。公平条件是表中所有方法都在弱监督下训练与评测,指标方向是平均精度越高越好。表后解释需要同时给出收益与未胜出或边界之处。
| ActionFormer (Zhang, Wu, and Li 2022) | 23.2 | 19.7 | 16.2 | 11.8 | 6.2 | 14.3 |
|---|---|---|---|---|---|---|
| DAVE (Geng et al. 2023) | 25.5 | 21.7 | 17.8 | 13.0 | 6.8 | 15.8 |
| CCNet (Zhou et al. 2025d) | 31.7 | 27.0 | 22.2 | 16.3 | 8.5 | 19.6 |
| CLASP (ours) | 34.6 | 29.0 | 23.6 | 17.6 | 9.8 | 21.3 |
上表来自 ActivityNet1.3 的逐阈值比较,CLASP 在各阈值与平均值上均高于表中基线。结合原文文字,CLASP 在该表平均值上超过最接近的 CCNet 约 1.7 个百分点;在 UnAV-100 上超过 CCNet 约 3.1 个百分点,并超过短视频路线的最优者数个百分点。效率方面原文报告 CLASP 参数与计算量明显小于全监督基线,推理耗时也更短,说明精度收益没有以更大的模型为代价。但必须同时看到的边界是:原文明确全监督方法可达约 50% 平均值,弱监督最优仍低约 20 个百分点;高阈值下绝对值下降更快,说明边界精确度仍是短板。
以下导读对应定性可视化:左侧是乐器演奏场景,右侧是街景警笛场景,每组自上而下是基线、本文方法与真值。
看图路径: 1. 先对比每组中 CCNet、CLASP 与真值的条带起止位置;2. 再观察 CLASP 条带上红色虚线锚点的疏密分布;3. 最后检查右侧长视频尾段对短事件的漏检与补回情况
论文图 3。原论文 Figure 3:“Visualization examples of the weakly-supervised dense audio-visual event localization.”。
从像素可见,左侧基线在开头数秒漏掉短笛类且尾段边界偏短,本文方法补回了开头片段并把长笛与短号的条带接得更完整;右侧基线漏掉尾段的车辆经过与警笛事件,本文方法在 30 秒后补回了多条短事件。红色虚线锚点在左侧集中于中后段的密集事件区,在右侧集中于 20 秒后,分布不均匀但多落在真值条带内部,支持了锚点引导语义传播的解释。该图是单样本展示,不能推广为全程每段都成立,末段结果也不能代替整体平均精度。
拿掉哪一部分,性能会掉多少?
消融要回答 3 个操作问题:全局锚点数、每窗锚点数与窗口数如何取值;一致性用哪一层特征;全局与局部分支以及锚点本身是否必要。原文固定其他条件逐一变动,指标仍是各阈值平均精度。
| 消融条件 | 指标口径 | 较弱取值 | 最优取值 | 对照结论 |
|---|---|---|---|---|
| 全局锚点数 | 平均精度 | 较少时偏低 | 取 10 时最高 | 过多略降 |
| 每窗锚点数 | 平均精度 | 取 1 或 2 偏低 | 取 4 时最高 | 取 8 略降 |
| 局部窗口数 | 平均精度 | 取 4 或 8 偏低 | 取 14 时最高 | 取 28 略降 |
| 一致性特征 | 平均精度 | 变换器后特征偏低 | 初始特征更高 | 无需先做时序建模 |
| 分支与锚点 | 平均精度 | 单分支或无锚点偏低 | 双分支加锚点最高 | 2 分支互补 |
上表是对原文消融文字的归纳,不直接引用逐阈值数字,逐阈值数字见原文表格。表后解释需要给出具体代价与反例:全局数取 5 时平均值偏低,增至 10 提升,继续增大到 15 或 20 反而略降;每窗数在 4 最优,取 1、2 或 8 都略低;窗口数在 14 最优,取 4、8 或 28 都略低,说明三者都不是越大越好。分支消融显示只用局部略优于只用全局,但双分支同时使用最高,支持细粒度局部比较更有益但仍需全局代表性的判断。
传播消融显示不用锚点时平均值下降约 0.7 个百分点,支持锚点语义确有增益。未胜出项是各类偏离最优的取值,它们仍优于部分 prior 方法,说明框架对超参数有一定鲁棒性,但复现时仍应先固定原文最优组合。
哪些结论还不能下,缺了哪些验证?
原文直接报告的是在给定特征与划分下的平均精度与效率数字,有限解释是锚点分布与注意力搬运带来了提升,未验证的推测是把这种提升归因到更一般的语义理解能力。表达上需要区分:报告显示双数据集最优,支持在该协议下有效,可能的原因是双模态一致性过滤了单模态噪声,但待验证的是换主干、换采样率或换标注口径后是否依然成立。
缺项需要具体点名。原文未报告多次随机种子的方差与显著性,未测量误检率、类别级表现与长尾类别行为,未给出训练时长与峰值显存之外的部署延迟、帧率与功耗,也未公开代码可用性声明。资源状态为未发现可验证的开源链接,因此不能写代码已公开,只能写本次未能确认可达。相关性不等于因果,锚点落在事件内部与定位更准同时出现,不能直接断定锚点必然导致边界变准,还需补做打乱锚点位置或随机锚点的对照。
要复现先做什么,需要哪些超参数?
复现的第一步是按原文准备特征与长度。UnAV-100 用双流 I3D 与 VGGish 并对齐到最大 224 步,ActivityNet1.3 用 R2+1D 与 VGGish 并对齐到 256 步,缺失部分补零。不要从模型名称推定主干是否冻结或更新,原文只说用预训练主干提取初始特征并经卷积映射,未明确冻结细节,缺失处应如实记录。
第二步是固定关键超参数再训练。全局锚点数取 10,每窗锚点数取 4,窗口数在 UnAV-100 取 14、在 ActivityNet1.3 取 16,训练 40 轮、学习率 1e-4,批量大小分别为 16 与 8,推理类别阈值取 0.5。建议先跑通视频级分类损失下降,再检查一致性分数是否在事件段内偏高、锚点是否落在事件内部,最后再看逐阈值平均精度。
第三步是补做原文未给的验证。至少记录多种子均值方差、类别级精度、高阈值下的边界误差分布,以及替换随机锚点与单分支的对照,才能判断收益是否来自锚点质量而非参数量或训练时长差异。系统可运行性要区分特征已备好、模型可训练与端到端可部署 3 个层次分别验证。
何时值得尝试这种锚点传播思路?
当任务同时满足 3 个条件时值得尝试:输入是未剪辑长视频加音频,目标是双模态同时成立的交集事件,监督只有视频级多标签且无法负担逐段标注。此时先用双分支独立预测再比较一致性,是一种低成本的可靠性代理,比单凭一侧模态的显著性更不易被背景或单模态事件带偏。
使用时要记住适用边界。高阈值精度下降更快,说明该方法更擅长找回事件存在与大致位置,对精确起止仍有限;全局与局部超参数需要按平均事件密度调整,事件稀疏时可减小窗口数,事件密集重复时应保留局部分支。教学上容易误解的是把一致性分数当成事件概率本身,实际上它是双模态是否说一致的度量,还需经锚点查询与前景门控才得到最终的逐时刻概率。总体上,这是一条用可靠时刻带动全时序的实用路线,但与全监督的差距提示弱监督稠密定位仍有较大研究空间。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses


