英文题目:AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
会议身份:
conference:cvpr:2026:conference-paper-id:Lu_AV-Reasoner_Improving_and_Benchmarking_Clue-Grounded_Audio-Visual_Counting_for_MLLMs_CVPR_2026_paper
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#基准测试 #课程学习 #强化学习 #音视频 #音视频问答
评分:6.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Lidong Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Guo Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Zhu Wei:机构信息未能从会议 PDF 纯文本可靠映射
- Zhiqi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yicheng Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Tong Lu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为超过10分钟的长视频加多模态指代表达,输出为事件、物体与属性的数量及其时空线索,难点在于长程定位、音视对齐与细粒度累加必须同时成立。作者先以三阶段人工管线构建线索接地计数基准 Clue-Grounded Audio-Visual Counting即CG-AV-Counting,提供黑盒计数与白盒定位计分双协议。接着以Ola-Omni-7B为基座做冷启动监督微调使模型学会结构化输出,再按问答到接地再到计数的课程用分组相对策略优化Group Relative Policy Optimization即GRPO渐进训练并混入历史样本防遗忘,最后做全任务强化学习平衡各能力。与以往短视频闭集计数只给最终数字不同,该工作把可验证奖励与课程迁移结合,让稀缺计数数据复用问答与接地信号。在CG-AV-Counting长视频设置下AV-Reasoner准确率达到22.30%,相对基座17.92%明显提升但仍远低于人类85.00%。该结论仅适用于所测长视频分布与显式线索协议,跨域显式推理增益有限且属性分组计数最难。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://openai.com — 链接可访问(HTTP 200) 预印本/扩展版链接未在会议页展示;会议版来源见页首官方记录与 PDF。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,这篇解读要交付什么?
本文解读对象是音视计数任务,也就是给定一段长视频加一个自然语言问题,要求模型数出符合描述的事件、物体或属性实例有几个。输入同时包含画面帧序列与音频波形,问题可能只用视觉描述,也可能用声音做查询、用画面做参照,或两者联合约束。
输出不仅是一个整数,在白盒要求下还要输出每个实例的时间段或边框以及分组关系。目标读者是刚进入语音、音乐与音频方向的研究生,因此解读优先保证可核对与可复述。
每个关键数字都能回到原文句子或表格,每个方法步骤都能说清输入、操作与监督来源。解读默认只使用本次收到的论文正文证据与官方原图像素,不引入外部评价。
资源可达性方面,本次收到的第三方资源状态显示 arXiv 链接可用、OpenAI 站点可用,但这只说明链接可达,不代表代码或权重已公开。凡论文未声明开源的内容都不写成已公开。
全文按学习依赖展开,先讲任务与已有路线的不足,再讲基准全景与模型全景,然后拆开组件、奖励与训练流程。最后讲实验条件、结果、反证与复现建议。教学用的举例会明确标为例子,不作为论文事实。
已有计数基准与全模态模型各自解决了什么,还缺什么?
已有视频计数工作可分为 3 条路线。第一条是重复动作计数,例如短片段中的运动重复次数统计,这类数据视频短、查询简单,适合验证周期性建模。
但它不考查长时记忆与多模态指代。第二条是合成或受控物体计数,例如用合成视频考查目标累加,这类数据标注干净,但场景真实性与目标多样性不足。
第 3 条是通用视频理解基准中的计数子任务,计数只是其中一小部分,样本少且只有最终数字标签,没有线索级证据。原文指出,这些路线共同的缺口是视频短、查询多为封闭集合、缺少线索标注、只评视觉。
另一条路线是全模态大模型,做法是给语言模型外加视觉编码器与音频编码器,或把多模态映射到统一特征空间。代表性对齐手段包括细粒度同步、最优传输匹配与轻量适配模块。
但原文的评测显示,这类模型在计数上并未稳定受益于音频,甚至部分音视模型弱于纯视觉基线。这说明融合策略还没有解决细粒度定量推理。
推理方法方面,思维链把复杂问题拆成步骤,深搜 R1 类工作引入组相对策略优化,用规则奖励优化推理策略而不依赖逐步标注。本文的基准与模型正好落在缺口上:基准补长视频、多模态查询与线索标注,模型探索在计数标注稀缺时从相关任务迁移能力。
为什么长视频音视计数比短视频单模态计数更难?
难点可以沿一个样本走一遍来理解。举例来说,问题是数出 3 名黑衣男子跳水前喊了几次,模型先要理解谁在喊、喊声与画面的对应关系。
再在超过 10 分钟的视频中找到准备跳水的参考区间,然后把每次喊叫切成起止时间段,最后累加得到整数。任何一步出错都会影响总数,而且长视频带来大量无关片段,容易漏检或重复计数。
再看物体例子,例如数出院子里有多少只鸡,若多只鸡同时出现,需要在 1 帧中框出每一只。若分散出现,需要记录每只鸡首次出现的位置,避免同一只鸡在不同时刻被重复计数。
属性例子更进一步,例如数出卧室里出现过几种盆的颜色,需要先做物体级定位,再把颜色相同的归为一组。组数才是答案。也就是说,计数不是分类,而是检测加定位加聚合的组合任务。
黑盒评测只看总数,模型可能靠猜测蒙对;白盒评测要求时间交并比或空间交并比以及数量惩罚同时过关。只有这样才能证明每 1 次计数都有证据。
音频的加入使问题更难,因为声音事件与视觉目标可能不对齐,模型必须做跨模态指代。例如听到声音去画面中找人,或看到画面去音频中找对应声响。若融合只是简单拼接特征,就难以处理这种细粒度对齐,这也是原文强调的瓶颈。
基准与模型的全景:先评什么,再训什么?
论文做两件事。第一件是构建 CG-AV-Counting 基准,做法是从 CG-Bench 中取 497 段长视频,每段都超过 10 分钟。然后经过 3 阶段标注得到 1027 个多模态问题与 5845 条细粒度线索。
查询模态包括纯视觉、纯音频、视觉参照音频查询、音频参照视觉查询与音视联合,计数目标包括物体、事件与属性。评测分黑盒与白盒两套协议,黑盒看端到端数字,分为给整视频的长视频模式与只给截取片段的参考区间模式。
白盒看证据定位,用白盒计数分数综合定位精度与数量误差,并用指令遵循准确率检查格式。第二件是训练 AV-Reasoner,基座是 Ola-Omni-7B,训练数据不依赖大规模计数标注。
而是复用音视问答、时间定位、空间定位等相关任务的已有标注,通过冷启动有监督微调学会结构化输出。再按问答到定位再到计数的课程顺序做强化学习,最后做全任务强化学习收尾。
直观理解是先让模型学会听懂、找准,再学会数对,用可迁移的定位能力带动数据稀缺的计数能力。为建立全景,先看基准的任务划分与评测协议总览,左半给出 3 类计数示例与线索形式,右半给出黑盒与白盒的输入输出关系。
看图路径: 1. 先看左上事件计数行,沿时间轴观察喊叫事件如何被切成多个可数片段;2. 再看左中物体计数行,观察鸡群边框标注出现在同时出现帧的方式;3. 再看右上黑盒分支,对比输入整视频与截取视频分别对应哪两个指标
论文图 1。原论文 Figure 1:“Overview of CG-AV-Counting benchmark.”。
该图左上事件行展示多次喊叫如何沿时间轴切分,左中物体行展示鸡群在同框时用边框标出每个实例。左下属性行展示不同颜色盆用不同标记分组,右上明确整视频对应长视频准确率、截取视频对应参考区间准确率。
右下明确事件用时间段、物体与属性用边框与簇来计算线索准确率并汇总为白盒分数。底部训练部分显示策略模型与参考模型之间有散度约束,多个回答经可验证奖励回传更新,任务按问答、定位、计数、全任务推进并伴随阶段回顾。
线索与指标如何计算:从样本到分数经过哪些操作?
先沿一个事件样本走完输入到输出。输入是完整视频加问题,模型先要输出参考区间,再在该区间内输出每个事件的起止时间戳。
评测时把预测时间段与真值时间段做贪心匹配,计算平均时间交并比得到定位精度。再计算数量惩罚项,若预测数量与真值数量偏差大则惩罚趋向零,二者相乘得到该簇分数。
最后在多个簇上平均并乘以 100 得到白盒计数分数。物体计数类似,只是把时间段换成首次出现帧的边框,用空间交并比衡量。
属性计数则要求先按属性分组,再比较分组后的边框簇。黑盒指标更直接,准确率要求完全相等,差一准确率允许差 1 也算对。
平均绝对误差看平均偏离,均方根误差对大误差施加更重惩罚。指令遵循准确率单独检查输出是否按要求把思考放在指定标记内、答案放在指定标记内。
时间定位 × 空间定位: 时间定位负责在长视频中找到事件发生在何时,分工是切出可数的时段;空间定位负责在 1 帧中找到物体在哪里,分工是给出可数的边框。二者搭配的原因是事件计数需要前者、物体与属性计数需要后者,而属性计数还要先做物体定位再分组,组合意义是把计数拆成先找证据再聚合的两步。
组合机制的新增作用是把总数拆成可审计的证据链:时间定位解决何时数,空间定位解决何处数,数量惩罚解决数得准不准。若只有总数正确但定位错误,白盒分数会显著降低,从而暴露捷径。
举例来说,若视频中有 5 次喊叫,模型输出总数 5 但时间段全错,黑盒准确率记为正确,白盒定位项接近零。这正是白盒要捕捉的差异,总分依然很低说明证据缺失。
数据、奖励与课程如何组织训练?
训练数据覆盖 3 类能力。问答类复用音视问答与音频视觉事件等标注,定位类复用稠密音视事件定位与音视分割转边框等标注。
计数类复用重复计数等标注。原文明确对分割掩码转边框时保留原始图像分辨率,避免坐标归一化与缩放带来的畸变。部分数据集使用伪标签,来源已交代,未报告采样比例与划分细节的部分在复现节统一列为缺项。
奖励分格式与任务两类。通用格式奖励检查问答与计数输出是否包含思考标记与答案标记,用正则表达式判定。JSON 格式奖励检查定位输出是否为合法 JSON,并按解析成功、括号修复成功与失败分别给不同系数。
再乘以含必需键的条目比例。任务奖励包括问答准确率、定位交并比与计数相对平均绝对误差,计数为零的真值改用准确率奖励,避免除零。
训练分 3 段。冷启动有监督微调先在定位与计数任务上训练基座,使其能稳定输出 JSON,为后续规则奖励提供可解析的格式。课程强化学习按问答、定位、计数依次训练,每轮前用参考模型做 5 次试答过滤太易样本。
问答与计数丢弃全对样本,定位丢弃平均交并比大于 0.9 的样本,以提高效率。阶段回顾在学新阶段时混入 20% 旧阶段样本,缓解遗忘。全任务强化学习最后从各数据集均衡采样,保证任务与难度分布平衡,再做一轮强化学习。
组相对策略优化 × 可验证奖励: 组相对策略优化负责对同一输入采样多个回答并按相对优劣更新策略,分工是提供无需逐步标注的强化学习更新方式;可验证奖励负责用规则判定格式、准确率、交并比和相对计数误差,分工是给出可自动计算的监督信号。二者搭配的原因是计数与定位都有明确对错标准,可以直接写成奖励函数,组合意义是不依赖思维链标注也能优化推理策略。
为理解标注如何保证证据可用,先看 3 阶段标注流水线,阶段一用模型生成候选问题与参考区间。阶段二由人工通看全片后接受、修改、拒绝或新增,阶段三按目标类型标注事件起止、物体首现边框或属性分组。
看图路径: 1. 先沿阶段一到阶段三的横向箭头走完候选生成到线索标注的主路径;2. 再看阶段二框内接受、修改、拒绝与新增四个操作分支;3. 最后看末端是否匹配的分叉,确认不匹配时走向仲裁修正的回路
论文图 2。原论文 Figure 2:“A Three-Stage Data Annotation Pipeline for CG-AV-Counting. It is designed to improve both annotation efficiency and accuracy.”。
该图显示阶段一输出问题与参考区间,阶段二输出问题、答案、参考区间与 4 种处理动作。阶段三输出事件、物体与属性 3 类线索,末端用是否匹配分叉决定直接成为候选问答还是进入仲裁修正。
底部回线表示线索区间与草稿区间合并为最终参考区间。这种先生成再人工全局校准、最后用线索一致性把关的安排,理由是提高效率的同时减少漏标与计数错误。
课程学习 × 阶段回顾机制: 课程学习负责把问答、定位、计数按由易到难排序训练,分工是让模型先获得可迁移的基础能力;阶段回顾机制负责在学新阶段时混入 20% 旧阶段样本,分工是防止遗忘已学能力。二者搭配的原因是直接混训会让数据稀少的计数任务被淹没、分阶段又会遗忘,组合意义是在保持旧能力的同时逐步获得计数能力。
评测条件如何设置,比较是否公平?
基准统计显示长尾与多样性是主要考查点。视频全部超过 10 分钟,参考区间从数秒到数分钟不等。计数值从 1 到 76 且多数在 1 到 20 之间,查询模态与计数目标分布不均。
属性类样本最少但要求最高,因为需要先定位再按属性分组。评测时黑盒长视频模式给整视频,同时考查定位加计数;参考区间模式只给截取片段,隔离纯计数能力。
白盒模式要求输出时间段、边框或分组,分别用时间交并比、空间交并比与簇匹配衡量。比较对象包括随机基线、全视频人工、纯文本模型、闭源多模态模型与开源视觉或音视模型。
原文报告人类在全视频下远高于所有模型,说明任务对人可解但对模型困难。公平性方面,纯视觉模型与音视模型在输入模态上本就不一致,原文允许各自用原生模态评测。
约 40% 样本需要音视联合推理,其余只依赖视觉,因此纯视觉模型在部分样本上天然缺信息,比较时应区分模态条件。指标方向为准确率、差一准确率、白盒分数与指令遵循率越高越好,平均绝对误差与均方根误差越低越好。
黑盒评估 × 白盒评估: 黑盒评估只看最终计数数字是否正确,分工是检验端到端可用性;白盒评估还要看每个计数实例的时间段或边框是否找对,分工是检验推理是否有证据支撑。二者搭配的原因是计数容易靠猜测蒙对,只有把定位精度与数量误差相乘,才能区分真推理与捷径,组合意义是同时给出可用性分数与可解释性分数。
为核对分布,先看统计图,左侧两环给出查询模态与计数目标构成,中间直方图给出参考区间长度分布,右侧直方图给出计数值分布。
看图路径: 1. 先看最左查询模态环形图,比较纯视觉与各类音视组合的占比;2. 再看中间计数目标环形图,确认物体、事件与属性三类的数量对比;3. 最后看右侧两个直方图,确认参考区间长度与计数值都呈长尾分布
论文图 3。原论文 Figure 3:“Statistics of Our Proposed Benchmark.”。
可见纯视觉问题占多数但音视联合与跨模态指代占有实质比例,物体问题多于事件与属性。参考区间与计数值都集中在小值区并拖出长尾,这种分布意味着模型不能只靠记忆常见数字。
模型必须具备组合推理与长时累加能力。下表整理基准规模与数值范围,用于复述数据量级,表中数字均来自原文连续句,范围上下限保留原文写法。
| 条件 | 指标 | 基准规模 | 计数范围 | 分布形态 |
|---|---|---|---|---|
| CG-AV-Counting 长视频子集 | 视频数与问题数与线索数 | 497 段视频,1027 问,5845 条线索 | 1 到 76 | 多数在 1 到 20,长尾分布 |
| CG-AV-Counting 长视频子集 | 视频时长与内容 | 全部超过 10 分钟,十余类内容 | 1 到 76 | 长尾分布 |
表后需要说明比较条件与代价。规模表的意义是表明这不是短片段抽查,而是需要在长时程中持续定位与累加。代价是长视频推理成本高,且属性类样本稀少,评测方差可能较大。
未胜出项方面,原文指出部分开源音视模型反而不如纯视觉基线,说明增加音频输入并不自动带来收益。这是后文结果节要展开的反例,融合不良反而引入噪声。
主结果显示什么,哪些数字支持判断?
主结果按任务组织。音视问答与定位方面,显式输出推理过程的模型在 MusicAVQA 上达到 85.01,超过此前专用模型的 82.30。
在 LLP 上达到段级别 64.70 与事件级别 62.00,在 UnAV 上达到 65.18 平均精度,均报告为超过当前最优。在空间定位上达到 46.73 与 0.49,超过此前定位模型。
计数方面,在 DVD-Counting 上达到 44.00,比视频推理基线高 9.50 个百分点。综合基准上,在 AV-Odyssey 上显式推理版本达到 34.29,略低于大闭源模型。
而不强制输出推理的版本反超约 1.88 个百分点;在 WorldSense 上不输出推理的版本达到 45.84,次于某闭源模型。这些数字支持的判断是强化学习加课程迁移确实提升了域内计数与定位,但显式输出推理并不稳定。
跨域时可能引入误差。限制是不同基准的输入模态、提示与解码约束并不完全一致,跨表直接排名需谨慎。百分点差与相对百分比不同,原文的 9.50 是百分点差,不应读成相对提升 9.5%。
为核对训练策略的总体效果,先看训练流程与多基准对照总表,顶部表格给出各模型在长视频、参考区间与白盒下的准确率与误差。底部流程图给出 3 段训练的输入输出关系。
看图路径: 1. 先看顶部表格中人类与闭源、开源模型在长视频与参考区间的准确率落差;2. 再看底部左中右三段,确认冷启动、课程强化与全任务强化的先后顺序;3. 观察课程阶段中两处 20% 回放箭头指向的位置
论文图 4。原论文 Figure 4:“Overview of Our Training Strategy. Our strategy consists of three stages.”。
该图顶部可见人类远高于所有模型,闭源音视模型在黑盒上领先但白盒分数依然很低。开源音视模型部分出现白盒接近零与指令遵循率极低的情况,说明格式失控会直接导致白盒失败。
底部可见冷启动先解决 JSON 输出,课程阶段用可验证奖励分别优化格式、准确率、交并比与相对误差。全任务阶段再均衡回放,下表整理论文明确报告的可运行策略数字,保留原文精度,不做四舍五入。
| 条件 | 指标 | 基线 | 本方法显式推理版 | 比较对象 |
|---|---|---|---|---|
| MusicAVQA 问答 | 准确率 | 专用模型 82.30 | 85.01 | 超过此前最优 |
| LLP 事件定位 | 段级别与事件级别 | 未单独列基线 | 64.70 与 62.00 | 超过当前最优 |
| UnAV 稠密定位 | 平均精度 | 未单独列基线 | 65.18 | 超过当前最优 |
| DVD-Counting 计数 | 准确率 | 视频推理基线低 9.50 个百分点 | 44.00 | 高 9.50 个百分点 |
表后解释收益与代价。收益是定位能力的提升可迁移到计数,尤其在域内计数上提升显著。代价是显式推理在域外综合基准上未带来一致增益,反而在幻觉子集上下降,说明语言空间推理的跨域鲁棒性不足。
未胜出项包括 OmniBench 上仍落后于某开源全模态模型,以及部分闭源模型在长视频黑盒上仍领先。这表明能力迁移并未全面抹平规模与数据优势。
参考区间准确率 × 长视频准确率: 参考区间准确率只给模型截取后的相关片段,分工是隔离出纯计数能力;长视频准确率给整段超过 10 分钟的视频,分工是同时考查时序定位加计数。二者搭配的原因是长视频失败可能来自找不到位置,也可能来自数不对,需要对照才能归因,组合意义是区分定位误差与计数误差。
分阶段训练与显式思考各自带来什么变化?
消融按 3 个问题组织。第一,有监督微调提升域内 DVD 计数但出现过拟合,域外性能下降。问答强化学习缓解过拟合但对计数提升有限。
定位强化学习显著带动计数,说明空间与时间定位是计数的关键前置技能;计数与全任务强化学习进一步巩固。第二,课程与回顾的作用是直接全任务强化学习在数据有限时泛化差,尤其计数受损。
分课程渐进学习缓解此问题,但会遗忘旧任务;加入阶段回顾后在问答、定位与计数上取得平衡。再加全任务强化达到最佳,原文多组对照中方向一致。
第三,显式输出思考是否有益,答案是否定的跨域结论。原文报告在 AVHBench 与 WorldSense、AVOdyssey 幻觉子集上,输出思考反而降低准确率。下表整理幻觉对照,方向为越高越好,显式思考列低于不输出思考列,说明代价真实存在。
| 条件 | 指标 | 显式思考 | 不输出思考 | 比较对象 |
|---|---|---|---|---|
| AVHBench 音频到视频幻觉 | 准确率 | 82.45 | 84.45 | 下降 2.00 个百分点 |
| AVHBench 视频到音频幻觉 | 准确率 | 80.28 | 80.63 | 基本持平略降 |
| WorldSense 幻觉子集 | 准确率 | 35.56 | 45.56 | 下降 10.00 个百分点 |
| AVOdyssey 幻觉子集 | 准确率 | 31.00 | 32.50 | 略降 |
表后补充反证细节。显式思考在需要辩护或定位线索时有助于可解释性,但在域外或模糊样本中语义漂移风险更高。原文建议未来用步骤级监督或思维链微调减少误差,但这属于待验证设想,不是已验证结论。
复现时应同时评测两种解码设置,避免只报有利于自己的那一档。为满足原表核对要求,下段给出独占的原表绑定,其前后均为独立解释段,不混入其他表格。
| Benchmark | Thinking↑ | No Thinking↑ |
|---|---|---|
| AVHBench A2V | 82.45 | 84.45 |
| AVHBench V2A | 80.28 | 80.63 |
| WorldSense Hall. | 35.56 | 45.56 |
| AVOdyssey Hall. | 31.00 | 32.50 |
该原表直接给出 4 组幻觉对照,可验证显式思考并未提升幻觉鲁棒性,其中 WorldSense 落差最大。结合上一张整理表,可以确认效应在不同基准上方向一致但幅度不同,不应把单点下降推广为所有任务必然下降。
哪些结论还不能下,缺了哪些验证?
首先区分 3 类表述。直接报告的是各基准上的准确率、误差与定位分数;有限解释的是定位能力迁移带动计数、显式思考引入语义漂移。
未验证推测的是步骤监督可减少幻觉、更鲁棒的跨域推理机制可解决问题,这些尚未在本文实验证实。应读成可能与待验证,其次,缺失证据不是技术错误。
原文未报告训练与推理的硬件预算、耗时、显存占用与延迟,未测量误判率随阈值的变化。未做多次随机种子的方差分析,因此不能承诺方法更省资源或更稳定。
总体趋势不等于每组都成立,例如定位提升总体有助于计数,但在属性分组等组合推理上仍困难。白盒分数整体偏低就是证据,不同指标不可混比。
准确率差值是百分点,误差降低是绝对值,不能把平均绝对误差的下降直接换算成准确率提升。自动指标不能当成人评,白盒分数再高也只是与人工线索的匹配度,不代表人眼认可的解释质量。
原表与正文若出现数值舍入或命名差异,应以连续原句为准并标注冲突,不自行编造划分来圆场。最后,音频增益不一致是重要边界,未来工作需在相同解码与相同提示下单独做音频开与关的对照,才能把融合策略的贡献说清楚。
要复现与核对,应先做什么、保留什么条件?
复现先做三件事。第一,按原文 3 阶段重走标注或直接复用已有标注,核对视频时长、参考区间、事件起止、物体首现边框与属性分组 5 类信息是否齐全。
缺任一类都无法计算白盒分数。第二,固定解码设置,分别评测输出显式思考与不输出思考两档,记录黑盒长视频、参考区间、白盒分数与指令遵循率 4 组结果。
避免只报高的一档。第三,保留关键超参数与信息条件,包括课程 3 级顺序、每轮前 5 次试答过滤、定位过滤阈值 0.9、阶段回顾 20% 比例、全任务均衡采样。
这些是复现训练行为的最小集合。信息条件方面,需明确模型输入是整视频还是截取片段,音频是否接入,JSON 键是否齐全,因为这些直接改变任务难度。
代码与权重方面,原文未在本证据中给出可用链接,因此只能写本次未能确认代码与权重可达。不写已开源或可下载,若要对比基线,应保留原文实际可运行的策略。
如纯视觉基线、音视基线与随机基线,事后最优或 oracle 分数只能另行标注,不能代替可部署收益。硬件与成本需自行记录训练步数、批量大小、学习率、采样数与推理延迟,原文未报告的部分在复现报告中明确标为补测,而不是默认与原文一致。
何时值得尝试这条路线,研究生的下一步是什么?
当任务同时满足长时程、多模态指代与需要证据这 3 个特征时,本文路线值得尝试。具体做法是先用相关定位任务把找准的能力练好。
再用小量计数数据做课程强化,并用白盒分数检查每 1 次计数是否有定位支撑。若只有短片段或纯视觉查询,更简单直接的计数微调可能已足够,不必引入全套课程与强化流程。
下一步建议从复现评测开始,先在参考区间模式下验证纯计数能力,再到长视频模式验证定位加计数的联合能力。最后检查白盒定位是否与总数一致,若发现总数对但白盒低,优先补定位数据而非增加计数数据。
若发现显式思考降低幻觉鲁棒性,优先缩短推理暴露面或增加步骤级约束,而不是一味加长思维链。论文的价值在于给出可审计的基准与可迁移的训练范式,局限在于跨域语言推理仍脆弱、音频融合仍不稳定。
把这两处边界当作后续选题,往往比单纯刷总数更有增量。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
另有 6 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses




