英文题目:LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

会议身份:conference:aaai:2026:conference-paper-id:39859

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准测试 #基准设计 #指令微调 #检索增强 #音视频问答

评分:7.6/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Xiaodong Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Langling Huang:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhirong Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xu Zhao:机构信息未能从会议 PDF 纯文本可靠映射
  • Teng Xu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xuhong Xia:机构信息未能从会议 PDF 纯文本可靠映射
  • Peixi Peng:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

交互直播视频理解以同步视频、音频、语音与海量实时评论为输入,以24类多选题准确率为输出,难点在于多人连麦、表演动作与送礼弹幕交织且高度依赖时序与跨模态上下文。为此先以多智能体系统生成细粒度视频描述并筛选形成多模态视频池,上一步的视频描述与人工清洗后的种子问题共同进入批量问答生成,再经人工复看过滤改写得到3175道高质量题目。接着以37953条机器合成样本做第一阶段指令微调实现直播领域对齐,再以11180条人工精修样本做第二阶段精调提升精度与鲁棒性。经两阶段微调后的模型在推理时由Chinese-CLIP计算均匀采样帧嵌入与评论嵌入相似度,按时间排序选取top-k相关评论与问题共同输入融合视频音频表征的大模型。与仅评测电影录播等非互动内容的Video-MME等基准不同,该工作把音频、语音与评论纳入统一全模态评测,并把视频到评论检索作为显式信息瓶颈以缓解评论过载与上下文溢出。在LiViBench基准下,LiVi-LLM-7B的准确率为64.4%,高于Qwen2.5-VL-72B的准确率62.3%。该结论适用边界受限于中文娱乐类直播与选择题协议,尚未验证开放生成、跨语言直播与实时交互的外推性。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

为什么直播理解不能只测电影和短视频?

输入是这篇论文的原文证据与官方原图像素,目标是让刚进入语音音乐音频领域的研究生能核对并复述方法,必须保留的关键信息是任务定义、数据规模与模态、标注流程、模型训练与检索的安排、实验条件与主数字,输出是 1 篇按学习依赖展开的中文技术解读。论文研究的不是通用短视频描述,而是以人为中心的互动直播视频理解。电影、录播和离线短视频大多是单向呈现,问题可以只问看见了什么。

直播则持续存在双向信号,主播说话唱歌,多人连麦,观众实时发评论、送礼、点赞,主播又根据评论改变行为。如果评测只给画面帧,模型就缺了判断互动的关键依据。论文因此强调全模态,也就是每个被测视频都同时带有视频、音频、语音和实时评论。白话说,全模态基准就是规定每次考试都发四份材料,缺一不可,分数才反映互动理解。

交互式直播视频 × 全模态基准: 交互式直播视频指主播与观众通过实时评论、连麦、送礼和语音对话持续互相影响的视频,全模态基准指同时提供画面、音频、语音转写和实时评论并要求模型联合使用的评测;前者分工是提出被测对象,后者分工是固定输入条件与打分口径,二者搭配是因为只看画面无法判定互动是否被理解,组合意义是把互动能力变成可复现的多选题分数。

从复述角度,先记住论文的规模锚点。基准包含 3168 个直播视频,时长从 14 秒到 33 分钟,配 3175 道高质量多选题。视频主要来自唱歌、跳舞、聊天等娱乐向直播,覆盖 9 个垂直域。任务侧共有 24 个子任务,归为 5 大类。数据侧除画面外,每个视频都有音频、语音转写和评论,全集约 1,450,000 条评论,平均长度 12.15 个汉字。

这些数字是后文一切比较的分母,换数据集或换切分都会改变含义,因此先固定下来。代码当前可用,资源状态显示代码链接可达,地址为论文给出的 GitHub 仓库,这意味着方法与评测脚本层面可核对,但不等于视频原数据可随意下载复用,复现时要区分代码可用与数据可得。

同输入同目标的已有路线差在哪里?

按同输入、同目标、同监督和同运行阶段对照,相关工作分 3 条线。第一条是多模态大语言模型本身。早期用查询变换器压缩视觉 token,后来用多层感知机直接投影,再到相邻帧融合与压缩、显式时间提示和旋转位置编码建模帧间关系,训练多用单图、多帧序列与视频混合,推理后还常用偏好优化提升推理。白话说,查询变换器就是可学习的挑帧器,多层感知机就是直接翻译器,时间编码就是给帧加钟表。

这些模型在通用视频上很强,但论文指出它们对直播场景的适配尚未被系统检验,为非互动短视频优化的模型难以直接处理互动直播。第二条是视频基准。短视频理解、时间定位、视频推理、长视频理解各有代表,近年也出现视听基准。另一些聚焦特定域,如第一视角、电影语言、视频评论、画质审美、短视频内容审核和快手离线短视频。它们的输入多为画面加文本问答,目标是通用感知推理,与本文同目标但输入缺实时互动环。

第 3 条是本文要补的缺口。直播在社交平台占比上升,带来多模态长时互动任务,现有基准主要覆盖非互动视频。教学例子是同样问人物在做什么,短视频基准只看动作,直播基准还要看该动作是对哪条评论的回应。类别差异不能当成同条件胜负,本文的贡献正在于把互动条件固定下来再比较。

要测什么互动?任务与数据如何划界?

论文把 24 个任务分为 5 组。4 个粗粒度通用感知任务测整体场景,6 个细粒度通用感知任务测细节,3 个知识型问答测领域常识,4 个通用推理任务测因果与行为推理,7 个直播专有任务测互动特性,例如多人互动与行为推理。白话说,粗粒度是看大意,细粒度是看细节,知识型是考背景,推理是考为什么,直播专有是考懂不懂直播间规矩。这种划分让失败可定位,是看不清还是不懂互动。数据划界分两层。

候选阶段从公开可得的直播视频出发,先过滤静态简单视频,用专有模型给时空复杂度打 1 到 10 分,低于 3 分去掉,同时排除网页游戏与电商带货类。原文报告过滤 3 万多个视频后保留 5245 个 20 秒到 60 分钟的视频作为基础。最终基准是 3168 个视频与 3175 道题,时长 14 秒到 33 分钟,并按极短、短、中、长四档呈现分布。每个视频都要求有音频、评论与自动语音识别信息,这是全模态的硬约束。问题组织上,每道题是多选题,评测时按 5 组分别平均再算总体,指标方向是准确率越高越好。

需要提醒的是,视频数多于题数不多,平均每视频约一题,不能把题数当成密集标注。

从原视频到可评分问答的全景是什么?

全景分 3 段。第一段是视频筛选与多智能体描述。为降低单一模型偏见,论文用多个大参数多模态模型组成多智能体系统,包括视频模型与通用视觉语言模型,按各自特长写不同侧面,再合并成详细视频描述。第二段是种子问题驱动出题。先为每个任务定义指令,用专有模型从已有工作抽取提问模式生成候选种子问题,人工剔除不合理或过简并改写增补,形成种子问题库。

再结合详细描述与种子库为每个视频生成候选问题,人工看视频筛掉模糊、过简或无关项。第 3 段是答案与干扰项制作。模型与人工分别给选定问题作答并提干扰项,再由标注员对照视频核对答案正确性,删改误导性干扰项,最后做多选题质量控制。

下图是论文给出的生成管线,展示从直播平台到过滤、多智能体描述、种子问题出题、标注与质检的走向。

看图路径: 1. 先沿从左到右主链找到过滤视频、多智能体、详细描述、种子问题出题、标注与质检的顺序;2. 再看虚线框内四个机器人图标表示多模型并行,箭头最终汇成一份详细描述文档;3. 最后看下分支从候选多选题经模型与人工标注再经质量控制回到带答案的视频问答

原论文 Figure 1:Dataset generation pipeline.

论文图 1。原论文 Figure 1:“Dataset generation pipeline.”。

该管线值得复述的细节是人机在多处介入。种子库要人工审,出题后要人工筛,答案与干扰项要人工对照视频验,终检还要查清晰性、正确性与相关性。先前工作或缺透明度或完全自动,单模型描述加语言模型出题容易让题干变长并带模型偏好。本文用多模型描述稀释偏见,用种子库约束题型可控。沿一个样本走一遍就是原始直播加 4 模态进入过滤,合格者进入多智能体得到长描述,长描述加某任务的种子问题得到候选问答,人工筛留与视频核对后得到带干扰项的多选题。目标是每题都能回放视频判定对错,输出是可直接用于打分的视频加多选题集合。

多智能体与种子问题各自解决什么偏差?

先讲白话。所谓多智能体就是请几个各有所长的模型分别看同一视频,一个擅长人物动作,一个擅长场景文字,一个擅长声音线索,各写自己被要求的部分,最后拼成一份更全的说明。所谓种子问题库就是每个任务先准备好规范例题,规定问什么、怎么问、多难,后续出题必须仿照这些范式,避免天马行空。

多智能体描述 × 种子问题库: 多智能体描述指用多个大模型按不同指令分别写视频细节再合并,分工是扩大视觉覆盖并稀释单一模型的偏好,种子问题库指先为 24 个任务人工修订出可复用的出题范式,分工是约束题型、难度和可比性,二者搭配理由是先有更全的事实再按固定范式出题,组合意义是让候选问题既 grounded 到视频又不被出题模型的语言偏好带偏。

计算上没有给出融合公式,原文明确的是流程与分工。为每个智能体写专用指令,只生成其任务所需内容,避免重复与冗余。种子库的来源是专有模型从已有工作抽取总结提问模式,再经人工修订增补。出题时以详细描述加种子库为条件生成任务相关候选问题。质量控制时人和模型都答题并提干扰项,人对照视频验答案并修干扰项。

若要复述实现,必须说明原文未报告各智能体权重、合并时的冲突解决规则与提示词全文,这些是缺项,不能从模型名字推定。若把该组件理解成集成投票也是误读,它集成的是描述文本而非分数,目标是更全的事实基础,不是直接提高准确率。

LiVi-LLM 如何训练与推理?两阶段加检索如何分工?

模型侧的输入是一个直播视频,做法是分别抽视频帧与音频流。连续帧用视觉编码器做时空编码转成视频 token,音频流用音频编码器转成音频 token,再用变换器解码器融合两类特征,与问题的文本 token 一起送入大语言模型。参数从全模态基座初始化。原文只说明编码器选型与融合方式,未报告冻结与更新范围、学习率、梯度路径与重置时机,这些缺项在复现时必须标出,不能默认全参微调。

2 阶段指令微调 × 视频到评论检索: 2 阶段指令微调分工是用大规模机器标注数据先把模型对齐到直播域,再用小规模人工精标数据做精细校正,视频到评论检索分工是在推理时用视频帧特征从海量评论中筛出与当前画面相关的时间有序子集,二者搭配是因为微调解决领域知识不足而检索解决上下文过长与噪声,组合意义是训练管知识、推理管信息供给。

训练数据直接复用标注管线扩展。收集 10 万以上 1 到 5 分钟直播视频,用多模态模型看场景数,只保留多于一个场景的视频以保证内容丰富。每个选中视频由一个或多个模型生成 1 到 3 个问答。抽一部分做人工复核标注,得到 37953 个未经人工复核的合成样本与 11180 个人工精修样本。第一阶段用合成样本加通用视频数据做领域对齐,兼顾泛化。

第二阶段用人工数据做精细调优。推理侧处理评论过多的挑战。做法是均匀采样帧,用中文图文模型取帧嵌入,用文本编码器取全部评论嵌入,算相似度为每帧取前相关评论,按时间排序后与问题一起送入微调后模型。白话说,检索就是先按画面捞出可能相关的弹幕,再按时间排好一起给模型看,避免把几 1000 条评论全塞进上下文。

下图对比了训练与推理结构,左为 2 阶段数据指向大语言模型,右为新增的视频到评论检索分支。

看图路径: 1. 先对比左图训练与右图推理共用的视觉编码器加音频编码器加大语言模型主干;2. 再看左图顶部第一阶段合成数据与第二阶段人工数据的两段箭头都指回大语言模型;3. 最后看右图新增的视频到评论检索框如何把海量评论变成排序后的文本上下文与问题一起输入

原论文 Figure 5:LiVi-LLM architecture. (a) Training process: In the first stage, the model is aligned to the…

论文图 5。原论文 Figure 5:“LiVi-LLM architecture. (a) Training process: In the first stage, the model is aligned to the interactive video domain using synthetic data; in the second stage, it undergoes…”。

从图中可执行地看到,主干左右一致,都是直播分出视频与音频两路进入编码器,区别只在文本侧。左侧文本是具体问题示例,顶部 2 阶段箭头都指回模型。右侧文本是问题加排序后评论,底部海量评论经视觉与文本编码器进入检索框再向上汇入。这种安排的理由在原文是明确的,微调补领域知识,检索补信息供给,二者缺一都会在直播专有任务上受损。

用什么数据、怎么切分、怎么打分才公平?

数据与协议按原文交代。基准共 3175 个视频问答,评测 24 个模型,每个模型用其最合适的帧数推理并保证上下文不溢出。分组就是前述 5 组,报告每组平均与总体平均。比较条件上,专有模型与开源模型同跑多选题准确率,音频语音评论的消融通过加减模态实现,评论影响按评论数分四档。指标方向一致是越高越好,但不同组分数不能直接比绝对难度,因为题量与题型不同。聚合对象是组内平均,不是按视频加权,复述时要保留这一点。

下图展示语音词长与评论数的分布,是理解切分与上下文压力的关键。

看图路径: 1. 先确认左图横轴为视频语音词长、右图横轴为视频评论数,纵轴均为视频计数;2. 再观察左图在零附近的高柱与中段鼓包,右图在中段与最右端的高柱,理解长尾分布;3. 最后把这种偏态与后文按评论数分四档评测的设计对应起来

原论文 Figure 2:The ASR and comment distribution.

论文图 2。原论文 Figure 2:“The ASR and comment distribution.”。

左为视频语音词长分布,横轴为词长,右为视频评论数分布,横轴为评论数,纵轴都是视频数。像素可见两图都不是正态,左图零附近有高柱且中段鼓起,右图在中段与最右端各有高峰,说明存在无语音视频与超多评论视频的长尾。这种偏态支持后文把评论按数量分档,以及用检索而非直接拼接的动机。硬件与统计方面,原文未报告置信区间、显著性检验与训练推理耗时,复现时只能报告单次准确率,不能声称统计显著。

下表提出要回答的规模问题。在相同全模态约束下,基准到底有多大、多长、多密,公平条件是都用最终保留的视频与题量口径,指标方向是规模越大覆盖越广但标注成本越高。

条件指标基准规模评论规模适用对象
候选过滤口径过滤前与保留3 万以上过滤,保留 5245 个20 秒到 60 分钟构造起点
任务口径任务分组24 任务分 5 类4 加 6 加 3 加 4 加 7分项诊断
指令数据口径合成与人工37953 合成,11180 人工3175 基准问答训练复用

该表的主要收益是把分母固定,后续所有准确率都以此为条件。具体代价是过滤掉了静态简单与电商游戏类视频,结论不能推广到那些域。未胜出项是长视频与无语音视频在分布尾部占比不小,直接拼接评论的模型在这些尾部更容易溢出,这正是检索要解决的边界。

主结果测什么?谁在什么条件下赢了多少?

主问题是互动直播理解的总体与分项准确率。与谁比,论文同时测专有模型与开源模型,包括不同参数规模的视频模型与全模态模型,条件一致是同题多选、同组平均。关键数字上,专有侧最高为 Seed 系列,最优总体 66.2%,开源侧 LiVi-LLM-7B 总体 64.4%,与 78B 规模的开源模型持平,并超过 72B 参数的开源大模型与部分专有模型。分项趋势是粗粒度和细粒度感知普遍高于知识、推理与直播专有,直播专有对所有模型最难。支持的判断是领域指令数据与评论利用缩小了与最优专有的差距,限制是仍未反超,且通用感知强的模型不一定直播专有强。 下图是两道定性例题,可对照题型理解分数来源。

看图路径: 1. 先看左右两组各四帧的直播截图,左为跳舞加猫特效,右为孙悟空扮装加麦克风;2. 再读每组下方的问题与四个选项,注意正确答案在原文中以绿色标出;3. 最后对比题干问的是特效功能与服装是否符合角色,体会细粒度与知识推理的差别

原论文 Figure 6:Qualitative examples of multi-choice questions from our LiViBench.

论文图 6。原论文 Figure 6:“Qualitative examples of multi-choice questions from our LiViBench. The correct options are marked in green.”。

左题问猫图案的功能,右题问主播模仿孙悟空的服装是否符合角色,正确选项在原文以绿色标出。像素可见左图有跳舞人物与白色猫特效叠加,右图有黄衣黄帽人物与麦克风及顶部横幅。这类题需要同时看画面细节与直播间功能知识,不是单靠物体识别能答对。教学例子是若只看黄衣就选金甲,会错过虎皮裙与道袍的区分,这正是知识与细粒度交叉处。

下表回到可核对的主数字比较。比较问题是同基准下实际可运行的开源小模型能否接近最优专有,公平条件是同为 LiViBench 总体准确率,指标方向越高越好。

条件指标最优专有本方法比较对象
LiViBench 总体总体准确率66.2%64.4%78B 开源持平
基准规模视频问答数3168 视频3175 问答同一基准
训练条件指令样本37953 合成11180 人工2 阶段使用
任务覆盖任务分组24 个任务5 大类含 7 个直播专有

表后解释是主要收益与代价。收益是 7B 模型用领域数据与检索达到 64.4%,在开源侧未被更大参数拉开,并逼近 66.2% 的专有最优。代价是差距依然存在,尤其直播专有组原文报告所有模型都低,说明互动推理仍是短板。未胜出项必须点名,部分专有模型与大参数开源模型在粗细粒度上仍有优势,总体趋势不等于每组都赢。不同指标的差值不能混放,百分点差与相对提升是两回事,这里只报告准确率本身,不换算相对百分比。

粗粒度感知 × 直播专有任务: 粗粒度感知指对场景、人物数量和整体事件的判断,分工是检验基础看懂,直播专有任务指多人互动、行为推理、送礼打断和评论关联等只有直播才高频出现的判断,分工是检验互动理解,二者搭配是因为前者是后者的前提,组合意义是论文用 5 组分数同时报告,说明模型是卡在看不清还是卡在不懂互动。

音频语音评论各自带来什么?失败条件是什么?

按问题组织消融。音频影响方面,论文测全模态模型加音频前后的分项。部分模型加音频后前 4 组下降,可能因音频处理能力不足,而基座较强的全模态模型与 LiVi-LLM 在多数组提升,且 3 个被测模型在直播专有组都显著提升。这支持音频在互动域重要的判断,但属于有限解释,不是因果证明。语音影响方面,用语音转写代表语音模态,所有模型在多数类与总体提升,但在细粒度与推理上有时下降,提示转写噪声会干扰细节理解。比较二者,原文称音频模态帮助更大,这仍是报告层面的比较,未测误判率与延迟,不能承诺实时性改善。

语音转写 × 音频: 语音转写指自动语音识别得到的文字,分工是提供可直接拼进文本上下文的语义,音频指波形编码后的声学表征,分工是保留语调、音乐、掌声等非词信息,二者搭配理由是直播中说话内容与现场声音常常互补,组合意义是论文分别测加音频与加转写后的分项变化,用以判断哪类任务更依赖声音。

评论影响方面,按评论数分四档,直接拼原始评论多使多数模型下降,只有用帧数较少因而上下文余量大的模型例外。用视频到评论检索后,多好于仅视频,缓解了海量评论的负作用。失败条件很具体,当评论上 1000 条时直接拼接易溢出或淹没关键信息,检索通过每帧取前相关再按时间排序来降噪。训练数据消融方面,第一阶段只用合成数据在 LiViBench 更好,加入通用数据会降 LiViBench 但提升通用长视频分数,第二阶段再加人工数据则 LiViBench 继续提升并保持泛化。

这说明互动与通用存在权衡,第二阶段对直播知识关键。原文未给出每档精确可引的连续句数字,复现时应以原表为准核对分档口径,不硬写像素辨不清的柱高数值。

下表把指令数据的构成固定下来,用于复述训练条件的公平性。比较问题是 2 阶段各用什么量级的数据,公平条件是同为直播域问答,指标方向是人工占比越高越精但越贵。

条件指标合成数据人工精修基准问答
指令微调样本数37953 个11180 个3175 个
基准规模视频数3168 个5245 候选3 万以上过滤
模态输入视频音频视频音频文本视频音频语音评论
阶段用途第一阶段对齐第二阶段精调评测打分

表后解释是收益与反例。收益是合成管量、人工管质,2 阶段各取所长。反例是只加通用数据不加人工精修时,LiViBench 会回落,说明领域对齐不能被通用数据替代。未评测边界是单场景视频在训练时被过滤,模型对单场景长直播的稳定性待验证。

哪些结论不能下?缺了什么验证?

先区分 3 层表述。直接报告的是分数与分布,例如总体 66.2% 与 64.4%、约 145 万评论与平均 12.15 汉字、37953 与 11180 的样本构成。有限解释的是音频更有助于互动理解、检索缓解海量评论负作用、第二阶段强化直播知识,这些有对照支持但仍受模型选型与分档口径影响。未验证推测是拿掉某组件必然怎样、延迟与成本必然改善,原文未测训练资源、推理开销、帧率与实际延迟,不能承诺。缺失证据不是技术错误,但复述时要用可能与待验证表达。

相关性不是因果,例如评论相关度高与答对同时出现,不能反推评论导致答对。总体趋势不等于每组每步成立,粗粒度赢不代表直播专有赢。冲突与缺项要明示。原文对冻结更新、梯度路径、超参数与硬件预算未报告,不能从模型名推定实现。时长口径存在候选与最终两套,引用时必须注明是 5245 候选的 20 秒到 60 分钟还是 3168 最终的 14 秒到 33 分钟,避免混用。

适用条件是娱乐向、以人为中心、多场景直播,电商游戏与静态视频已被过滤,结论外推需补验证。

要复现先做什么?按什么顺序核对?

复现分 4 步。第一步核对资源。代码链接当前可用,先拉仓库看评测脚本、任务划分与打分逻辑,确认 24 任务到 5 组的映射与平均方式。第二步核对数据口径。按 3168 视频、3175 题、14 秒到 33 分钟、每视频含音频语音评论、约 145 万评论平均 12.15 汉字重建清单,区分候选 5245 与最终 3168,不自行编造划分。

第三步核对标注流程。按过滤、多智能体描述、种子库生成、候选出题、人工筛、模型与人工答题提干扰项、对照视频验答案的顺序走通,保留种子库版本与质检记录。第 4 步核对模型。按视觉加音频编码加变换器融合加大语言模型的输入到输出走一遍样本,再分别实现第一阶段合成对齐、第二阶段人工精调与推理时视频到评论检索,检索需固定采样帧数、中文图文编码器、相似度取前数与时间排序规则。关键超参与信息条件以原文为准,未报告则留空待补。

区分代码开源、权重可得与系统可运行,代码可用不等于权重与视频可下载。先跑通仅视频基线,再加音频、加转写、加原始评论、加检索,逐档记录 5 组分数,避免把末步结果推广全程。

何时值得尝试这套方法?还需补哪项验证?

当任务本身含实时互动环时值得尝试,例如直播问答、连麦行为分析、弹幕关联推理。此时应保留全模态输入与直播专有任务的分组报告,训练时优先补领域问答而非只加通用视频,推理时对海量评论先检索再拼接。当任务是离线短视频或无互动长视频时,不必照搬检索,重点应放在通用感知与时间建模。还需补的验证有三项。一是统计稳健性,给出多次采样与置信区间,避免单次准确率偶然。

二是成本与延迟,补训练算力、检索耗时与上下文长度的实测,区分输出质量与实际延迟。三是误判分析,对直播专有失败按缺音频、缺评论、转写噪声、视觉遮挡分类,说明哪类错误被哪种模态修复。回到中心矛盾,直播不是更长的短视频,互动才是新增的理解负担。论文用可核对的基准把负担固定为分数,用 2 阶段与检索给出可复现的解法,64.4% 对 66.2% 的差距既是进展也是边界,后续工作应在固定口径下继续缩小直播专有组的差距。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总