📄 Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026
标签:#音视频理解 #多模态模型 #语音识别 #模型集成
7.1/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1/1.5
✅ 7.1/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频理解 | #多模态模型 | #语音识别 #模型集成 | arxiv
👥 作者与机构
第一作者:Jinxing Zhou(Mohamed bin Zayed University of Artificial Intelligence) 通讯作者:正文未明确标注 作者列表:Jinxing Zhou、Suiyi Zhao、Yanghao Zhou、Ruohao Guo(机构:Mohamed bin Zayed University of Artificial Intelligence;Anhui University of Science and Technology;National University of Singapore;China Agricultural University)
💡 毒舌点评
这套系统最聪明的地方是推迟决定,并把无目标、语义替换和空输出恢复分成不会任意覆盖的路径;官方第 2 名说明组合确实有效。最薄弱的地方也同样明显:缺少最终组件消融,T-acc 还明显落后第 3 名。读者可以认可端到端竞赛成绩,但难以从现有证据判断 5 模型 TRACE、SaSa 替换或 GPT 恢复各自是否值得成本。
📌 核心摘要
MeViS-Audio 要求系统从口述运动描述中找出目标,并在整段视频持续输出掩码。语音在这里是查询载体而不是发声物体线索,所以系统既要可靠转写,也要理解方向、交互角色、时间阶段和参考实体;查询可能描述不存在的目标,还可能只在后半段发生动作。Speech2MaskTrack 用 1 条分层管线处理这些相互不同的失败类型。
faster-whisper large-v3 先生成词级转写,Qwen3-30B-A3B 再把自然语言编译为结构化运动程序。SAM3.1 枚举最多 16 条目标与参考轨迹,TRACE 用相机补偿后的运动、完整轨迹关系和角色证据排序;词汇 presence gate 可以将无目标查询置空。SaSaSa2VA 轨迹只在条件满足时替换基础结果,GPT 与 16 帧 storyboard 仅用于仍为空的输出。
官方结果排名第 2,Final 为 0.705662,J&F 为 0.5374,J/F 分别 0.5123/0.5626,N-acc/T-acc 为 0.7241/0.8554。相对第 3 名,J&F 和 N-acc 更高,但 T-acc 低 0.0964,说明目标轨迹质量、空目标判断和时序准确性并未同步占优。
系统的优点是明确推迟提交,并让恢复路径不破坏已有非空预测;缺点是这种保守规则也无法修复错误但非空的轨迹。最终配置没有组件消融,多个冻结大模型、多次视频遍历和 GPT 恢复的边际贡献与成本无法分开。结果证明竞赛系统有效,却难以证明每个复杂模块都必要或可低成本迁移。
🔗 开源详情
正文没有提供 Speech2MaskTrack 源码、模型权重、提示模板、配置仓库或可下载结果文件。faster-whisper、SAM3.1、SaSaSa2VA 等第三方模型的存在有别于本文系统开放,因此按无核心产物的零分锚点记录。
🏗️ 方法概述和架构
第 1 阶段处理语音查询。faster-whisper large-v3 使用 beam 5、温度零、词级时间戳且关闭跨段文本条件,输出转写与置信线索。冻结的 Qwen3-30B-A3B 不直接生成掩码,而把查询编译为运动程序:目标类别与数量、运动方向、主动或被动交互角色、动作发生阶段以及用于关系判断的参考实体。结构化表示让后续模块知道应追踪谁、与谁比较和何时验证。
观察下图的决策次序,先辨认 faster-whisper 转写如何被编译成运动程序中的目标、方向、角色与时序约束,再查看视觉候选如何依次经过排序、门禁和恢复。

图中分支由 SAM3.1 提供候选、TRACE 按完整轨迹排序、lexical gate 执行置空,SaSaSa2VA 只在条件满足时替换;这种顺序保护已有非空结果,却仍缺逐组件消融。
第 2 阶段先扩大候选集。SAM3.1 根据目标和参考提示生成最多 16 条完整实例轨迹,proposal threshold 为 0.25。候选不会在第 1 帧立即定夺,因为晚发生动作、遮挡和相似实例需要完整轨迹证据;这一延迟提交策略减少把参考物或早期显眼物体误当目标。
TRACE 对每条候选计算相机运动补偿后的质心残差,并结合完整轨迹的方向、交互距离、角色关系和时间阶段。5 个按视频分组的模型集成排序,使同一视频的多个实例在共享上下文中比较。这个步骤输出最可能轨迹,但不负责判断查询目标是否存在。
第 3 阶段由冻结词汇 presence gate 处理 no-target。阈值 0.5 以下可抑制基础非空掩码,避免系统被迫在没有目标时选 1 个候选。presence 与轨迹排序职责分离,使 N-acc 和普通 J&F 可以独立解释,也防止关系参考实体因词面匹配被错误输出。
第 4 阶段尝试 SaSaSa2VA 4B 的完整表达式条件轨迹。模型以 100 个均匀时间点读取视频;只有 presence 为真且结果通过条件时,它才替换 SAM3.1 基础轨迹。替换不是无条件叠加,目的是利用更强视听语义修正基础分割,同时保留无目标门禁。
最后的恢复路径只处理仍为空的情况。GPT 先裁决查询是否可恢复,16 帧 storyboard 提供时间概览,SaSaSa2VA 再生成候选并由掩码仲裁选择;2 级置信门槛均为 0.85。非破坏规则规定已有非空预测不会被 GPT 覆盖,这保护正确基础结果,却也把错误非空轨迹留成不可恢复故障。
端到端决策因此具有明确的先后依赖:转写决定运动程序,程序约束目标与参考候选,TRACE 提供基础非空轨迹,presence 决定是否保留,SaSa 只作条件替换,GPT 只救空结果。每 1 级都冻结且不需训练,但前级错误会沿后级传播;这种控制流比单纯罗列模型更能解释系统行为。
💡 核心创新点
运动程序把语音查询从一句文本提示变成可执行约束。类别、数量、方向、角色、时间和参考实体被显式拆开,使候选排序能够使用完整轨迹关系,而不是只依据目标名或单帧外观。
延迟提交让候选决策等待完整轨迹。SAM3.1 先枚举多实例,TRACE 等看完整段运动后再排序;这特别针对晚发生动作、被动角色和遮挡。相机补偿质心残差减少镜头运动被误认成物体动作,参考轨迹又为“靠近、跟随、离开”等关系提供基准。
层级恢复控制把 no-target、语义替换和空输出恢复分成有优先级的路径。presence gate 可以输出空,SaSaSa2VA 只在满足条件时替换,GPT 恢复只接管仍为空的结果。非破坏策略降低后处理把好结果改坏的风险,是竞赛系统中明确的安全取舍。
另一项值得单列的系统贡献,是把“空预测”和“错误非空预测”视为不同故障。前者允许高置信的故事板恢复,后者禁止后处理覆盖。这个不对称规则牺牲一部分纠错范围,换取已有轨迹不被生成式裁决任意改写;它是可检查的工程原则,不是含糊的模型集成。
创新强度受证据限制。论文只报告最终配置,没有逐项关闭 TRACE、presence、SaSa 替换或 GPT 恢复,无法确认官方得分由哪个环节贡献。多模型组合本身不是创新证明,真正可认可的是结构化运动程序、完整轨迹推理和层级恢复控制。
📊 实验结果
官方挑战结果如下:
下面比较 J&F、N-acc 与 T-acc 相对第 3 名的正负差异,检验官方第 2 名是否意味着所有子任务同步领先。
| 评测设置 | Speech2MaskTrack 分数 ↑ | 相对第 3 名差值 ↑ |
|---|---|---|
| Final | 0.7057(精确记录 0.705662) | 未报告 |
| J&F | 0.5374 | +0.0787 |
| J | 0.5123 | 未报告 |
| F | 0.5626 | 未报告 |
| N-acc | 0.7241 | +0.0689 |
| T-acc | 0.8554 | -0.0964 |
最终分 0.7057、排名第 2,说明整套系统在 MeViS-Audio 官方协议下有效。J&F 对第 3 名高 0.0787,N-acc 高 0.0689,支持轨迹排序与无目标门禁具有竞争力;T-acc 反而低 0.0964,形成明确负面差值,提醒读者难以用综合排名掩盖时序准确性的相对短板。
J 与 F 分别衡量区域重叠和边界质量,二者都低于 0.6,说明复杂运动指代仍远未饱和。N-acc 与 T-acc 关注不同子问题,也难以与 J&F 相加解释。论文给出晚动作、被动角色、早期遮挡和近距离交互案例,适合说明系统为何需要完整轨迹,却不是量化消融。
排名差异呈现出明确取舍:相对第 3 名,区域与边界综合质量及无目标判断获益,而时间准确性反向下降。因而 Final 的领先难以解释为所有子任务同步改进,也难以仅凭总分把恢复模块视为时序定位的有效证据。
最大的实验缺口是没有最终组件级对照。读者无法知道 5 模型 TRACE 集成、SaSaSa2VA 替换、presence gate 或 GPT 恢复分别改变多少分,也无法衡量增加 1 次大模型调用或 1 次视频遍历的收益。官方表支持端到端系统,不支持每个模块的独立优越性。
🔬 细节详述
Whisper 采用 beam 5、采样温度 0 和词级时间戳,以稳定随机转写过程;查询解析由冻结 Qwen3-30B-A3B 完成。若 ASR 把方向、否定或参考实体写错,结构化程序会把错误放大到全链路,后续分割模型没有原始语音证据纠正。
SAM3.1 proposal threshold 0.25,最多保留 16 条完整轨迹。TRACE 先补偿相机运动再比较质心残差,加入方向、角色与目标—参考关系,并用 5 个 video-grouped 模型集成。候选池若根本不含真实目标,排序再准确也无法恢复。
presence threshold 0.5 用于决定是否允许非空输出。SaSaSa2VA 4B 读取 100 个均匀时间点,覆盖长视频但可能漏掉持续极短的判别动作。16 帧 storyboard 更稀疏,适合粗略时间概览,不保证捕捉瞬时接触。
GPT 恢复的查询裁决和掩码仲裁均要求至少 0.85 置信。恢复只在当前输出为空时启动,并禁止覆盖非空轨迹。该设计把误改风险压低,却意味着选错实例但仍有掩码时不会进入补救。
目标轨迹与参考轨迹必须在完整时间轴上共同解释动作。晚发生的靠近或离开难以由首帧距离裁定,被动角色也难以仅凭运动幅度识别;TRACE 的关系特征正是为这 2 类歧义服务。相机补偿若不准,质心残差仍可能把镜头运动泄漏为对象运动,因此该特征并非天然可靠。
5 个 video-grouped 模型集成、1 次 100 点时序读取和 16 帧故事板意味着同一视频会被多次处理。正文没有报告各阶段延迟、峰值显存、API 调用次数或失败回退率,无法将 0.0787 的 J&F 名次优势换算为单位成本收益,也无法判断实时场景是否可承受。
验证案例覆盖晚发生动作、被动交互、早期遮挡及相似物体近距离互动,说明完整轨迹和参考关系的动机合理。不过这些案例只展示成功模式,没有形成按动作类型、遮挡程度或目标数量分组的误差统计,难以替代受控消融。
⚖️ 评分理由
创新性 (1.6/2):将语音查询编译为运动程序,再以完整轨迹关系排序并分层恢复空预测,较单次文本提示或首帧匹配有明确系统创新。
技术严谨性 (1.2/1.5):TRACE、presence gate、SaSaSa2VA 替换和非破坏恢复的控制逻辑写得完整,但缺少逐组件消融,无法确认复杂链条中各模块的必要性。
实验充分性 (1.0/1.5):官方挑战集给出 Final、J、F、N-acc 与 T-acc 完整结果及相邻名次差异;只有最终系统单点,未提供配置消融或跨数据验证。
清晰度 (0.7/1):阈值、模型职责、空预测路径与非空错误边界均可定位,然而多套缩写和恢复分支使读者仍需较高成本还原端到端行为。
影响力 (1.2/1.5):口述运动指代连接语音理解与视频分割,对视听检索有直接价值;核心提升仍主要来自视觉轨迹系统,音频只承担查询转写,影响范围有限。
开源 (0.0/1.5):正文没有发布 Speech2MaskTrack 源码、权重、配置或结果文件,列出的 faster-whisper、SAM3.1 等第三方模型不构成本系统开放。
可复现性 (0.4/0.5):beam、温度、主要阈值和采样点数披露充分,但缺代码、最终组件消融及部分大模型提示模板,独立复现仍有明显不确定性。
工程/实践价值 (1.0/1.5):官方第 2 名说明系统在竞赛条件下有效;多模型、多次视频遍历、GPT 恢复和候选枚举带来较高延迟与资源成本,工程迁移门槛高。
🚨 局限与问题
多阶段错误会级联:ASR/解析错会误导全链路,SAM 候选池缺失无法补救,16 帧 storyboard 可能漏短动作,且非破坏策略不能修复错误但非空的轨迹。最终配置没有组件消融,并依赖多个大模型与多次视频遍历。
进一步审视
多阶段级联是首要风险:ASR 的否定词或实体错误会污染运动程序,程序错误会误导候选排序;SAM3.1 缺失真实实例时,TRACE 无法凭空补回。16 帧 storyboard 和 100 点采样都可能漏掉短动作。
非破坏恢复只处理空输出,难以修复错误但非空的轨迹。这种取舍有助于保护好结果,却使某类失败永久绕过 GPT。官方 T-acc 相对第 3 名低 0.0964,也提示时间定位仍是显著短板。
最终系统没有组件消融,也没有跨数据集、运行时、显存或调用成本报告。代码、权重和配置仓库均未发布,第三方很难验证阈值与提示细节。官方第 2 名只能证明竞赛设置下的端到端效果,难以直接外推到开放域语音查询或实时视频。