📄 AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes
#音视频理解 #多模态模型
9.3/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5
🔥 9.3/10 | 前10% | #音视频理解 | #多模态模型 | arxiv
👥 作者与机构
- 第一作者:Yaoting Wang(复旦大学大数据学院、计算机科学技术学院/人工智能学院)
- 通讯作者:Henghui Ding hhding@fudan.edu.cn(复旦大学大数据学院、计算机科学技术学院/人工智能学院)
- 作者列表:Yaoting Wang(复旦大学大数据学院、计算机科学技术学院/人工智能学院)、Yun Zhou(同上)、Zipei Zhang(同上)、Henghui Ding(同上)
💡 毒舌点评
AVTrack用一个精心策划的、仅含测试集的基准,漂亮地撕下了现有AVIS方法在真实复杂场景下的“遮羞布”。八个挑战维度覆盖全面,让那些在简单场景中“称王称霸”的模型原形毕露——HOTA不足21,堪称惨烈。然而,论文提出的“救世主”基线AVTracker,本质上是一个靠堆砌VLM和SAM“老本”的模块化流水线。其推理开销大到离谱(每帧18,900 GFLOPs),速度仅为0.21 FPS,且整个基准不提供训练集,让“如何在这套场景上通过训练真正变强”成为一个悬而未决的开放问题。这更像是一个昂贵的“鉴定师”,而非一个实用的“解题者”。
📌 核心摘要
本论文针对现有人中心音频视觉实例分割(AVIS)基准场景简单、缺乏动态挑战的问题,提出了AVTrack数据集,包含871个视频、3120个精细标注的实例轨迹,覆盖视觉遮挡、相机运动变化、多轮说话等八类复杂条件。该数据集定位为纯测试集,旨在提供一个长期稳定的评估平台。
方法上,论文设计了一个基于模块化流水线的基线AVTracker,利用Whisper转写与说话人嵌入进行语块聚合,再配合视觉大模型(VLM)Qwen3-VL和SAM3在局部窗口内建立音视对应,最后通过全局推理模块关联同一说话人的轨迹片段。与以往端到端AVIS方法相比,AVTracker的独特之处在于其训练无关、可插拔的模块化架构,直接用文本语义桥接音频和视觉。在AVTrack上的实验表明,主流VIS方法HOTA<12,最强AVIS方法HOTA<21,而AVTracker达到了29.08 HOTA,领先约8个点。此外,论文还与商业模型Gemini 2.5 Pro进行了零样本对比,其HOTA仅为14.4,进一步证明了AVTrack的挑战性。该基准为评估复杂场景下的人中心音视理解提供了有价值的测试平台;其主要局限是计算代价极高,且纯测试集设计使模型无法利用场景内训练数据进行适配。
主要实验结果如下(表2摘要,数值为百分比):
| 方法类型 | 方法名称 | HOTA | DetA | AssA | IDF1 | MOTA |
|---|---|---|---|---|---|---|
| VIS | VITA | 9.70 | 10.54 | 9.35 | 12.32 | 1.91 |
| VIS | LBVQ | 10.29 | 11.77 | 9.36 | 12.87 | 1.98 |
| VIS | CAVIS | 11.46 | 12.10 | 10.07 | 12.95 | 1.96 |
| AVIS | AVISM | 20.84 | 23.22 | 19.53 | 26.57 | 3.95 |
| AVIS | ACVIS | 20.60 | 22.59 | 19.66 | 26.23 | 4.23 |
| AVIS | AVTrackFormer | 21.47 | 22.51 | 20.26 | 26.41 | 4.11 |
| AVIS | AVTracker | 29.08 | 31.18 | 28.47 | 34.55 | 16.20 |
🔗 开源详情
- 代码:论文仅提供了项目网站,未提及公开代码仓库。
- 模型权重:论文未提及提供模型权重。
- 数据集:论文声明提供数据集下载,但报告中未提及可直接访问的下载链接。根据摘要,项目网站为
https://FudanCVL.github.io/AVTrack/。 - Demo:论文中未提及。
- 复现材料:论文附录F提供了基线AVTracker的实现细节和超参数配置,附录G提供了VLM推理所用的提示,但未提供可直接运行的代码和检查点。
- 论文中引用的开源项目:
- SAM (Kirillov et al., 2023)
- Grounded-SAM (Ren et al., 2024)
- Mask2Former (Cheng et al., 2022)
- VITA (Heo et al., 2022)
- Qwen3-VL (Bai et al., 2025)
- Whisper (Radford et al., 2023)
- SpeechBrain / ECAPA-TDNN (Desplanques et al., 2020)
- MossFormer2 (Zhao et al., 2024)
- SAM 3 (Carion et al., 2025)
🏗️ 方法概述和架构
AVTracker是一个三阶段、完全基于预训练模型的模块化流水线,不进行任何任务特定训练。其核心思想是利用文本作为音频和视觉之间的语义桥梁,通过"局部音视匹配+全局身份关联"的策略完成追踪。
第一阶段为说话人语块聚合:利用Whisper对音频进行ASR转录,得到带时间戳的文字段;为处理潜在的语音重叠,可选择性地使用语音分离模型(如MossFormer2)增强语音。之后,通过ECAPA-TDNN对每个片段提取说话人嵌入,并根据嵌入的余弦相似度(阈值0.35)合并相邻的同一说话人语块,形成K个说话人语块 \(S = \{s_k\}_{k=1}^K\)。每个语块包含起止时间和对应的文字内容。此动态窗口策略旨在保持语义的完整性和上下文的连贯性。
第二阶段为局部窗口处理:对每个说话人语块 \(s_k = (t^s_k, t^e_k, x_k)\),将其时间边界转换为视频帧索引。在该局部窗口内,并行执行两个任务:1) 局部推理器(Local Reasoner,基于Qwen3-VL VLM)根据文字 \(x_k\) 和视频帧,在提示引导下判断说话人,并输出每帧的说话人边界框 \(b^{(f)}_R\);2) SAM3对每一帧进行人体分割,产生大量的候选边界框 \(B^{(f)}_{SAM3}\) 和对应的掩码。通过计算最大IoU,将推理器预测的边界框与SAM3的候选框进行匹配,检索出对应的掩码 \(m^{(f)}\),从而为该语块形成一条局部轨迹 \(T^{local}_k = \{(f, m^{(f)}) | f^s_k \le f \le f^e_k\}\)。同时,从该局部轨迹中选出掩码面积最大的帧作为关键帧,用于后续的全局关联。
第三阶段为全局窗口处理:收集所有语块产生的关键帧 \(F_{key} = \{I^{f^{key}_k}\}^K_{k=1}\) 及其文字上下文。全局推理器(Global Reasoner,同样基于Qwen3-VL)对这些关键帧进行跨帧身份关联,判断哪些帧属于同一个人,最终输出身份到帧索引的映射 \(G: p \mapsto \{k_1, k_2, ...\}\)。最后,根据此映射收集属于同一身份 \(p\) 的所有局部轨迹,合并为全局轨迹 \(T_p = \bigcup_{k \in G(p)} T^{local}_k\),对于没有观测到的帧,则插入空掩码以维持时间连续性。整个流程训练无关,所有组件均可灵活替换升级。
💡 核心创新点
- 复杂场景人中心AVIS基准(AVTrack):现有数据集大多场景简单、标注粗略。AVTrack通过系统定义八类复杂条件(视觉遮挡、相机运动变化、背景切换、相对位置变化、多实例、多轮说话、音视不一致、实例尺度动态变化),提供了871个视频、3120个精细标注的实例轨迹,数据来源涵盖电影、综艺、访谈等7种不同类型,刻意避开了实验室受控环境,揭示了现有方法在真实场景下的巨大性能下降。
- 训练无关的模块化追踪基线(AVTracker):提出一种"语音转录-局部音视匹配-全局身份关联"的流水线。其巧妙之处在于利用ASR转录的文字作为跨模态语义桥梁,结合VLM的推理能力进行局部说话人定位和全局身份去重,无需任何任务特定训练即可超越所有端到端AVIS模型。
- 动态语义窗口与语块聚合:放弃固定大小窗口,基于ASR时间戳和说话人嵌入动态构建语块,减少冗余VLM调用,同时保证每个处理窗口内含有一个完整的说话回合,为VLM提供了充分的语义上下文,提升音视对应准确性。
- 对多说话人和重叠语音的处理框架:集成可选的语音分离模块(如MossFormer2)处理重叠语音,且其"局部产生轨迹,全局关联身份"的流水线天然支持说话人身份长期维护,解决了多轮交替说话的追踪难题。
📊 实验结果
在AVTrack测试集上,所有纯视觉(VIS)方法的HOTA均低于12(VITA 9.70、LBVQ 10.29、CAVIS 11.46),说明在复杂场景中,仅靠视觉信息进行说话人追踪几乎不可行。现有的端到端AVIS方法借助音频信息将HOTA提升至约20~21(AVISM 20.84、ACVIS 20.60、AVTrackFormer 21.47),但仍远不能满足实际需求。论文还测试了商业模型Gemini 2.5 Pro,其零样本HOTA仅为14.4,甚至低于端到端训练基线,凸显了该基准的挑战性。
相比之下,AVTracker以HOTA 29.08、DetA 31.18、AssA 28.47大幅领先,相较最佳端到端基线AVTrackFormer提升约7.6个点。MOTA指标更是从不足5跃升至16.20,显示出其在减少身份切换方面的优势。
Per-challenge分析显示,AVTracker在所有八个挑战子集上均保持领先,在相机运动变化上表现最佳(29.6),而在音频视觉不一致(18.5)、视觉遮挡(28.1)和多实例(27.0)等类别下相对较弱,主要失败模式为遮挡下交替说话时的轨迹关联歧义。
消融实验(表3)揭示:1) 缩小语音处理器(Whisper-small)或VLM(Qwen3-VL-4B)规模均导致性能明显下降(如HOTA从28.85降至24.01);2) 使用人脸识别特征替代VLM全局推理时,HOTA再降约5.23点,证明了VLM语义推理在全局身份关联中的重要性;3) 放弃动态窗口或局部语块压缩导致严重性能下跌(HOTA从28.85降至27.45或16.88)。集成高质量的语音分离器(MossFormer2)能带来正向收益(HOTA 28.85 -> 29.08),但使用性能不佳的分离器反而会损害性能,说明分离质量对下游任务至关重要。
🔬 细节详述
- 训练数据:AVTrack基准本身为纯测试集,不提供训练数据。端到端基线方法(如AVISM)使用AVISeg数据集进行训练,论文未列出具体预训练数据规模。
- 损失函数:AVTracker无需训练,无损失函数;所提出的端到端基线AVTrackFormer遵循与AVISM相同的检测、分割及跟踪损失范式和训练方式,论文未详述具体损失函数。
- 训练策略:AVTracker是训练无关的流水线;AVTrackFormer等端到端方法训练细节未在主体部分说明,但应按照原文献配置训练。
- 关键超参数:帧率r=1 FPS,说话人相似度合并阈值τ=0.35,IoU匹配阈值0.3;ASR模型为Whisper-large-v3-turbo,说话人嵌入编码器为ECAPA-TDNN(SpeechBrain),VLM为Qwen3-VL-8B-Instruct,分割模型为SAM3-Video,可选语音分离器为MossFormer2。阈值τ的敏感性分析显示,在[0.30, 0.40]区间内HOTA仅变化0.56,表明对该参数鲁棒。
- 训练硬件:未说明端到端模型训练硬件;AVTracker推理在单块48GB NVIDIA A6000 GPU上进行。
- 推理细节:AVTracker推理速度为0.21 FPS,每帧计算量约18,900 GFLOPs,其中Qwen3-VL占97%(约18,200 GFLOPs),是其显著效率瓶颈。
- 正则化或稳定训练技巧:对AVTracker无此需求;端到端方法的这些细节未提供。
⚖️ 评分理由
创新性 (1.5/2):AVTrack基准从场景定义到数据构建填补了复杂人中心音视追踪的重要空白,八个挑战维度有理有据,远超现有数据集。基线AVTracker巧妙利用VLM和SAM的现有能力进行零样本追踪,“文本语义桥接音视”的思路有很好的洞察力。然而,AVTracker本质上是现有预训练模型的工程组合,缺乏新的模态融合或表征学习机制,方法层面的原创性不足。
技术严谨性 (1.3/1.5):数据集构建流程清晰,有明确的多阶段过滤、自动预标注和人工校验质量控制,15名标注员工作近3个月,确保了数据质量。AVTracker各模块设计合理,消融实验论证充分,揭示了各组件的作用、模型规模的影响,以及对超参数的鲁棒性。不足之处在于,对AVTracker失败模式的剖析不够深入,未系统研究VLM或ASR在何种具体条件下会失效。与端到端模型的对比稍显不公平,缺少领域迁移的实验对照。
实验充分性 (1.3/1.5):实验覆盖了VIS和AVIS的多个代表性方法,并在统一的AVTrack测试集上公平评估。消融实验设计合理,考察了模型规模、语音分离质量、语块处理策略等关键因素。此外,还与商业多模态大模型Gemini 2.5 Pro进行了对比,进一步增强了数据集的挑战性和说服力。Per-challenge分析揭示了方法的相对弱点。但端到端对比模型数量有限,且所有训练后的基线都用AVISeg数据集训练,未设计在部分AVTrack风格数据上微调的对比实验,来消除训练域和测试域之间的差异。此外,缺少对分割质量(如mIoU)的专门评估。
清晰度 (1.1/1.2):论文结构合理,问题定义、数据集统计、方法流程和实验分析层次分明。图表清晰,特别是流水线示意图和数据集统计对比图,有助于理解。符号使用基本一致,但某些细节(如Global Reasoner的具体提示设计)仅在附录给出,主体部分对具体流程和失败案例的讨论可以更充分一些。整体文字流畅。
影响力 (1.0/1.5):AVTrack作为一个高质量、高难度的“试金石”型基准,对推动复杂场景下的鲁棒性研究有直接的推动作用,能激励后续研究者去挑战长尾、动态的音视对齐问题。然而,该任务相对垂直,主要面向音视追踪与分割社区,受众广度有限。纯测试集设计虽有其价值,但也可能降低部分希望“刷点”的研究者的使用意愿。此外,基线模型效率过低,难以直接转化成实际应用,限制了其短期在产业界的影响力。
开源 (1.2/1.5):论文明确提到项目网站为
https://FudanCVL.github.io/AVTrack/,并声明发布数据集。原文图7详细展示了数据集构建流程,附录F提供了AVTracker配置细节,附录G提供了完整的提示设计,这表明其开源诚意,但审阅时网站可能尚未包含完整的代码仓库、模型权重或可直接下载的数据集链接,因此未在分析中体现具体链接。has_code, has_model 应为“否”或“未说明”。数据集因是核心贡献,has_dataset 为“是”。可复现性 (0.5/0.8):AVTracker的框架完全依赖开源预训练模型(Whisper、ECAPA-TDNN、Qwen3-VL、SAM3等),论文给出了所有组件名称和关键超参数,提示设计在附录中提供,这使得复现成为可能。数据集的收集、标注和质控流程描述详细。但AVTracker本身没有代码库,复现需要自行编配多个模型API和复杂的数据管线,实际复现难度较高。由于是纯测试集,端到端模型的训练复现依赖AVISeg等外部数据集。
工程/实践价值 (1.5/1.5):这是一篇典型的系统驱动型工程论文。数据集构建涉及完整的收集、自动预标注、人工校验和质控流水线,提供了详细的构建指南。AVTracker流水线则体现了清晰的模块化设计思想,每个组件可独立升级或替换,具有很高的工程参考价值和可复用性。这种“零训练、拼乐高”的基线对于社区快速搭建音视理解系统有直接帮助。
🚨 局限与问题
论文明确承认的局限:作者承认AVTrack为纯测试集,无法用于训练;AVTracker的推理效率极低,每帧计算量主要来自VLM;当前方法在视觉遮挡、多实例和音视不一致等场景中仍表现不足。
审稿人发现的潜在问题:
- 训练与测试的领域失配:AVTracker作为零样本基线,与在AVISeg上训练的端到端模型对比存在不公平性。后者可能从未见过如此复杂的场景。若能加入在数据风格与 AVTrack 相近的少量数据上微调的实验,结论会更具说服力。
- 对VLM的过度依赖:AVTracker 97%的计算量来自Qwen-VL,其性能高度依赖该VLM的能力。一旦VLM在特定口音、复杂画面或多人交互中推理出错,整个流水线将毫无防备地崩溃。论文缺乏对此类鲁棒性的系统分析和讨论。
- AVTrackFormer的贡献度有限:所提出的端到端基线AVTrackFormer相比AVISM仅增加了双向融合模块,性能提升微弱,不足以作为一个独立的强基线贡献。
- 测试集泛化能力未知:测试集来自7类不同的视频源,但论文未报告每个子类的性能,无法评估模型在不同域(如动画 VS 现实电影)的泛化差异。
- 评估指标缺失:仅报告了追踪相关指标,缺少实例分割质量(如掩码IoU)的独立评估,不利于理解检测和分割模块各自的贡献上限。