📄 AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes #音视频理解 #多模态模型
9.3/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5
🔥 9.3/10 | 前10% | #音视频理解 | #多模态模型 | arxiv
👥 作者与机构 第一作者:Yaoting Wang(复旦大学大数据学院、计算机科学技术学院/人工智能学院) 通讯作者:Henghui Ding hhding@fudan.edu.cn(复旦大学大数据学院、计算机科学技术学院/人工智能学院) 作者列表:Yaoting Wang(复旦大学大数据学院、计算机科学技术学院/人工智能学院)、Yun Zhou(同上)、Zipei Zhang(同上)、Henghui Ding(同上) 💡 毒舌点评 AVTrack用一个精心策划的、仅含测试集的基准,漂亮地撕下了现有AVIS方法在真实复杂场景下的“遮羞布”。八个挑战维度覆盖全面,让那些在简单场景中“称王称霸”的模型原形毕露——HOTA不足21,堪称惨烈。然而,论文提出的“救世主”基线AVTracker,本质上是一个靠堆砌VLM和SAM“老本”的模块化流水线。其推理开销大到离谱(每帧18,900 GFLOPs),速度仅为0.21 FPS,且整个基准不提供训练集,让“如何在这套场景上通过训练真正变强”成为一个悬而未决的开放问题。这更像是一个昂贵的“鉴定师”,而非一个实用的“解题者”。
📌 核心摘要 本论文针对现有人中心音频视觉实例分割(AVIS)基准场景简单、缺乏动态挑战的问题,提出了AVTrack数据集,包含871个视频、3120个精细标注的实例轨迹,覆盖视觉遮挡、相机运动变化、多轮说话等八类复杂条件。该数据集定位为纯测试集,旨在提供一个长期稳定的评估平台。
方法上,论文设计了一个基于模块化流水线的基线AVTracker,利用Whisper转写与说话人嵌入进行语块聚合,再配合视觉大模型(VLM)Qwen3-VL和SAM3在局部窗口内建立音视对应,最后通过全局推理模块关联同一说话人的轨迹片段。与以往端到端AVIS方法相比,AVTracker的独特之处在于其训练无关、可插拔的模块化架构,直接用文本语义桥接音频和视觉。在AVTrack上的实验表明,主流VIS方法HOTA<12,最强AVIS方法HOTA<21,而AVTracker达到了29.08 HOTA,领先约8个点。此外,论文还与商业模型Gemini 2.5 Pro进行了零样本对比,其HOTA仅为14.4,进一步证明了AVTrack的挑战性。该基准为评估复杂场景下的人中心音视理解提供了有价值的测试平台;其主要局限是计算代价极高,且纯测试集设计使模型无法利用场景内训练数据进行适配。
主要实验结果如下(表2摘要,数值为百分比):
方法类型 方法名称 HOTA DetA AssA IDF1 MOTA VIS VITA 9.70 10.54 9.35 12.32 1.91 VIS LBVQ 10.29 11.77 9.36 12.87 1.98 VIS CAVIS 11.46 12.10 10.07 12.95 1.96 AVIS AVISM 20.84 23.22 19.53 26.57 3.95 AVIS ACVIS 20.60 22.59 19.66 26.23 4.23 AVIS AVTrackFormer 21.47 22.51 20.26 26.41 4.11 AVIS AVTracker 29.08 31.18 28.47 34.55 16.20 🔗 开源详情 代码:论文仅提供了项目网站,未提及公开代码仓库。 模型权重:论文未提及提供模型权重。 数据集:论文声明提供数据集下载,但报告中未提及可直接访问的下载链接。根据摘要,项目网站为 https://FudanCVL.github.io/AVTrack/。 Demo:论文中未提及。 复现材料:论文附录F提供了基线AVTracker的实现细节和超参数配置,附录G提供了VLM推理所用的提示,但未提供可直接运行的代码和检查点。 论文中引用的开源项目: SAM (Kirillov et al., 2023) Grounded-SAM (Ren et al., 2024) Mask2Former (Cheng et al., 2022) VITA (Heo et al., 2022) Qwen3-VL (Bai et al., 2025) Whisper (Radford et al., 2023) SpeechBrain / ECAPA-TDNN (Desplanques et al., 2020) MossFormer2 (Zhao et al., 2024) SAM 3 (Carion et al., 2025) 🏗️ 方法概述和架构 AVTracker是一个三阶段、完全基于预训练模型的模块化流水线,不进行任何任务特定训练。其核心思想是利用文本作为音频和视觉之间的语义桥梁,通过"局部音视匹配+全局身份关联"的策略完成追踪。
...