共分析 1 篇论文


⚡ 今日概览

✅ 筛选入选 1 篇 → 🔬 深度分析完成

🏷️ 标签说明:本期使用新版受控 taxonomy;站点标签页暂时兼容展示历史标签与新标签。

🏷️ 热门方向

方向数量分布
#音视频问答1 篇█

📊 论文评分排行榜(1 篇,按分数降序)

排名论文总分分档文档类型主任务
🥇AVTrace: Diagnosing Audio-Visual Temporal Reasoning in…7.0前50%数据集与基准#音视频问答

📋 论文列表

🖼️ 有图的论文会在这里展示首张原论文图;点击图片可打开 arXiv 原图。

🥇 能说出事件不等于能定住时间:AVTrace 如何拆解音画时间推理

原论文 Figure 1:Test component analysis (n=1,000 per category).

英文题目:AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models

标签:#音视频问答 | #基准设计 | #音视频 | #基准测试 | #模型评估

评分:7.0/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5

排名:前50% | 文档类型:数据集与基准 | arXiv 原文

👥 作者与机构

  • Longyin Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Parth Sakhare Mahendra:机构信息未在 arXiv HTML 中可靠披露
  • Chengwei Wei:机构信息未在 arXiv HTML 中可靠披露
  • Ning Zhang:机构信息未在 arXiv HTML 中可靠披露
  • Lim Ming Chong:机构信息未在 arXiv HTML 中可靠披露
  • Sirui He:机构信息未在 arXiv HTML 中可靠披露
  • Ai Ti Aw:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该基准面向全模态模型(Omni Model)的音视频时间推理,输入为音视频片段与任务问题,输出涵盖时刻点、起止区间、同步二分类、下一步动作、跨模态区间加描述、有序步骤链及锚点目标加答案。构建链先由公共视频源导出候选时间信号,再经 Qwen3-Omni-30B 做开端检测、跨模态定位与银答案构建并由 Qwen3-235B 生成问题与校验,最后施加确定性结构门控并按上游数据集加原始视频标识分组切分。评测链先经严格 JSON 解析诊断格式,再由无参考归一器抽取结构化答案并以时间交并比(temporal Intersection over Union, tIoU)与文本重叠等原语确定性计分。与已有音视频问答相比,该设计强制输出时间坐标与有序结构,使语义重叠无法冒充定位成功。在7000条类别均衡测试集上,仅有两个后训练变体在同步验证中以0.576和0.571超过0.556的多数类基线,链解析精确率仍近乎为零。结论仅刻画固定输入配置下的系统行为,不支持内部机制推断与跨语言文化外推。原文未披露训练、推理或部署成本。

🔗 开源资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。