英文题目:M^3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
会议身份:
conference:cvpr:2026:conference-paper-id:Park_M3KG-RAG_Multi-hop_Multimodal_Knowledge_Graph-enhanced_Retrieval-Augmented_Generation_CVPR_2026_paper
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#多模态学习 #检索增强 #音视频 #音视频问答
评分:6.5/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.1/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Hyeongcheol Park:机构信息未能从会议 PDF 纯文本可靠映射
- Jiyoung Seo:机构信息未能从会议 PDF 纯文本可靠映射
- Jaewon Mun:机构信息未能从会议 PDF 纯文本可靠映射
- Hogun Park:机构信息未能从会议 PDF 纯文本可靠映射
- Wonmin Byeon:机构信息未能从会议 PDF 纯文本可靠映射
- Sung June Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Hyeonsoo Im:机构信息未能从会议 PDF 纯文本可靠映射
- JeungSub Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Sangpil Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为同步音频、视频与文本问题,输出为开放式自由回答,难点在于音频时序因果与视觉空间细节难以在统一嵌入中联合对齐,单跳图文图更无法支撑多跳推理。该方法先以多智能体改写语义稀薄字幕并抽取上下文富集三元组,实体规范化后链接开放知识库获取描述并重写,形成多跳多模态知识图谱。随后按模态分别在同模态物品索引中检索近邻并扩展为多跳子图,避免跨模态共享空间的错位检索。最后经 grounded剪枝先用视觉与音频接地模型验证存在性,再用轻量大语言模型剔除与答题无关三元组,将保留子图拼接入多模态大语言模型生成答案。相对VAT-KG等已有方法,关键差异在于模态内检索加多跳扩展与两阶段问答效用剪枝,其实质是只保留查询可见且答题有用的证据以抑制冗余噪声。在AudioCaps-QA基准下,M3KG-RAG的M.J.得分为60.77,高于VAT-KG基线的M.J.得分51.30。结论适用边界受限于AudioCaps-QA、VideoChatGPT与VALOR三个问答评测,尚未验证长视频、强噪音频或跨域分布,原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,读完要能复述什么?
本文的输入是一个多模态查询,查询中可以同时包含视频流、音频流和用自然语言写出的问题,目标是让多模态大语言模型给出忠实于画面与声音的自由文本回答。输出不是分类标签,而是一段需要同时经得起视觉核对与听觉核对的描述或答案。读者读完应当能复述两条主线。
第一条是知识源的构造线:从原始多模态语料出发,经过改写、抽三元组、归一化、查外部知识、选描述、按原文措辞改写,并用检查器重跑可疑输出,最终得到每个三元组都连到至少一个音频或视觉条目的多跳多模态知识图。
第二条是检索增强线:先在查询所在模态内找邻近条目并提升为初始多跳子图,再用视觉与音频接地模型验证实体或三元组是否真的出现在查询中,最后用轻量语言模型按是否有助于回答问题做保留或丢弃,只把精简子图连同实体描述拼接到查询后送给模型生成。必须保留的信息包括三处原文安排:构造只用各评测基准的训练切分,检索与剪枝阈值按基准分别设定,所有实验固定在单卡上运行。
资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开,项目网址的可达性本次未能确认。
已有路线在音视频问答上卡在哪里?
先把相关工作按同输入、同目标、同运行阶段对照。第一类是纯文本图增强检索,例如从局部到全局做图索引与社区摘要的方法,以及做双层检索或个性化游走的方法,它们的输入是文本语料与文本查询,目标是提升组合推理的连贯与覆盖,但在本文任务中输入多了随时间变化的音频与画面,直接迁移会丢失模态内在语义。
第二类是图文多模态知识图,例如把图文语料组织成以概念为中心的知识库并做图感知检索,或做视觉文本表示学习,它们能处理图片线索,但对声音的时间性与音画同步关系覆盖不足。第三类是已有的音视频知识图工作,论文点名其把视觉、音频与文本整合成知识图并给出面向音视频模型的检索增强流程,这与本文输入与目标最接近,区别在于其图多为概念层单跳,检索主要靠共享嵌入空间的相似度,容易带入离题邻居与冗余上下文。
第四类是通用多模态大语言模型,从早期只做视觉语言理解的模型,到加入音频编码器的模型,再到同时处理音视频双分支的模型与商业闭源模型,它们是本文的生成底座而非检索方案。本文的判断是:已有工作要么缺音频视觉覆盖,要么缺多跳连接,要么缺查询条件化的细粒度过滤,因此需要在知识源与检索过滤两端同时改动。
共享嵌入检索与单跳事实为什么不够?
论文用 3 个音视频场景把失败模式讲具体。第一种失败是缺乏多模态覆盖时的错位检索。查询是一段地面上的红色银色旋转物体的视频加尖锐声音,参考答案指出那是高速旋转的空袭警报器,而共享嵌入空间检索找回的是花瓶、陶瓷、静物写生这类文本知识,模型于是把物体说成放在地上的大音箱并描述音箱声音很响,错把听觉线索套到视觉外形相近但声音机制完全不同的实体上。第二种失败是知识不足时的无改善。
查询是舞台上几男几女用长号、小号、圆号与打击乐器演奏欢快音乐的场景,模态内检索虽然对上了模态,但找回的只是人物在体育场、5 个人演奏铜管五重奏这类单跳概念事实,模型仍输出 5 个人每人拿一件铜管乐器,漏掉了打击乐器与人员构成。
第 3 种是本文期望的形态:对 2 人在房间里打康加鼓、邦戈鼓等打击乐器的查询,模态内多跳检索找回以人物为中心连向房间、演奏、曲调、康加鼓与打击乐的多跳邻域,模型于是能说出 2 人在工作室演奏多种打击乐器并点名康加鼓与鼓。这 1 对比说明两个教学要点:跨模态距离在统一空间中不可比,单跳事实即使沾边也不足以支撑需要时间与因果链的答案。
看图路径: 1. 先看三行各自的左侧查询输入与右侧预测框颜色;2. 再对比中间检索框是共享嵌入还是模态内单跳还是多跳;3. 最后核对每行底部参考答案与预测在实体上的出入
论文图 1。原论文 Figure 1:“Illustration of multimodal RAG scenarios.”。
图中有三行,每行左侧都是胶片样式的视频缩略图加波形音频,中间是检索得到的知识子图,右侧是模型预测框,底部是参考答案。第一行中间子图节点稀疏且关系多为材质与用途,右侧红色标出音箱误判。第二行中间子图是 3 条平行单跳边,右侧红色标出每人拿铜管乐器的以偏概全。第三行中间子图是以人物为中心的多跳网状结构,右侧蓝色标出打击乐器、康加鼓与鼓等与参考一致的细节。读图时不要把波形形状当成可读数值,波形只表示该查询带音频,真正的判断依据是底部参考与右侧预测在实体与动作上是否一致。
端到端流程如何从原始语料走到模型回答?
沿一个样本走完全程有助于建立依赖顺序。假设原始语料中有一条样本,包含一段语义较泛的文本标题、一声音频与一段视频。第一步把泛标题改写成知识密集的上下文富集标题,例如把一架飞机慢慢滑出跑道的泛描述,补上具体型号与机场等外部标题与描述信息,再从改写后文本中抽出头实体、关系与尾实体组成的三元组。
第二步把头尾实体中的修饰词去掉并统一为单数名词短语得到可搜索概念,再到开放知识库中搜候选描述,搜不到时用轻量语言模型回调补写一条中性通用描述。第三步以上下文富集标题为依据选出最贴切的一条候选,再按原始头尾措辞改写,使描述既保留选中内容又贴合原文说法。检查器对依赖模型内部知识的步骤打分复核,不通过则重跑。所有三元组再连回各自来源的音频或视觉条目,形成多跳多模态知识图。
推理时给定新的音视频查询,先在同模态条目索引中找邻近项并提升为初始多跳子图,再用视觉与音频接地打分过滤掉未在查询中出现的三元组,最后用轻量语言模型去掉对回答无帮助的三元组,把剩余三元组的关系与头尾实体加描述拼接到查询后送给多模态大语言模型。
看图路径: 1. 沿步骤一到步骤三的主箭头走完语料到精炼描述的路径;2. 观察归一化器、搜索器与回调在步骤二如何分工;3. 确认底部检查器在何处给出通过或重跑信号
论文图 2。原论文 Figure 2:“An overview of the M3KG construction pipeline.”。
该图从左到右分为三列。第一列从多模态语料与语义层标题出发,经外部知识与改写器得到上下文富集标题,再经抽取器得到图。第二列上方是归一化器把原始概念变为可搜索概念,下方是搜索器分可搜索与不可搜索两路分别走外部知识与语言模型回调,底部是检查器对描述做零到十分的百科意义匹配评估并决定通过或重跑。
第三列上方是选择器结合上下文富集标题从候选描述中选最相关一条,下方是精炼器结合原始概念改写为精炼描述,底部同样有检查器。图中以小型飞机例子贯穿,左侧标题与外部知识都围绕同一型号展开,便于跟踪改写前后实体如何从带修饰的原始说法变为可检索的规范说法。
构造与检索剪枝的每个组件具体做什么?
构造侧有 4 个具名智能体加一个检查器。改写器的动作是把语义泛化的原始文本连同爬虫抓到的标题与描述一起改写为知识密集文本,目的是让后续抽取能碰到长尾或非常见实体。抽取器的动作是解析改写后文本并返回数量随输入变化的三元组集合,关系中常带有时间与跨模态线索。归一化器的动作是去修饰、保词序、统一单数名词短语,解决小棕狗与狗这类表面形式不一致导致的查不到问题。
搜索器的动作是查开放知识库并用爬虫取紧凑候选集,缺失时触发语言模型回调。选择器的动作是以上下文富集标题为指导挑最贴切描述,过滤离题义项,例如区分金融机构与河岸。精炼器的动作是把为归一化概念写的描述改写回原始头尾措辞,保留选中内容的同时注入原始语义。检查器的动作是对回调与改写这类依赖模型内部知识的输出打零到十分并决定通过或重跑,这是保证图质量的自反循环。
多跳多模态知识图 × 模态内检索: 多跳多模态知识图负责把文本三元组与音频条目和视觉条目用链接连成可扩展的多跳邻域,提供跨样本可达的证据结构,模态内检索负责先在查询所在的同一模态内找最邻近的音频或视觉条目再提升为三元组,二者搭配的理由是先用同模态距离避开跨模态共享空间的尺度不可比,再靠图的链接把单条命中扩展成时间与因果相关的多跳上下文,组合后新增的作用是让检索候选既对齐查询模态又自带可推理的关系链。
检索侧分为模态内检索与接地选择性剪枝。模态内检索的动作是先用视频与音频基础模型分别编码查询与图中的音频视觉条目,在向量索引中按欧氏距离取每查询前五邻近项,再去掉距离超过阈值的离题项,若音视频同时存在则做向量拼接后同样搜索,最后把选中的条目经链接提升为三元组得到初始图。这一设计直接对应覆盖性质,即每个三元组至少连到一个音频或视觉条目,因此所有事实都可经模态命中被找回。
接地选择性剪枝的动作分两步,先用现成接地模型验证出现性,再用轻量语言模型验证答案有用性。视觉侧在查询视频均匀采样 4 帧并取实体在各帧检测置信度的最大值作为存在分,三元组分取头尾之和,低于阈值则剪。音频侧把三元组转成自然语句后度量其在查询音频中的接地强度,低于阈值则剪,音视频双流时分数相加后统一阈值。
知识接地 × 上下文感知描述精炼: 知识接地负责把归一化后的可搜索概念连到开放知识库取得候选百科描述并对缺失项做轻量回调补写,上下文感知描述精炼负责以上下文富集标题为依据选出最贴合当前多模态语境的一条并改写回原始头尾实体的措辞,二者搭配的理由是接地解决从图连接到外部知识的覆盖问题而精炼解决一词多义与措辞漂移的准确问题,组合后每个实体得到既有外部依据又与当前样本一致的精炼描述。
视觉接地 × 音频接地: 视觉接地负责用 GroundingDINO 在均匀采样的查询视频帧上对初始图中的每个实体打存在分并取帧间最大值再加和为三元组分,音频接地负责把每个三元组转成自然语句后用文本到音频接地模型度量其在查询音频中的接地强度,二者搭配的理由是视频与音频不可互相替代且音频不宜切成独立快照直接比实体,双流分数相加后按阈值过滤,组合后得到同时经受画面出现性与声音对应性检验的接地子图。
选择性剪枝 × 图增强生成: 选择性剪枝负责用轻量大语言模型在接地子图上做保守的保留或丢弃二值判断,去掉与回答问题无关的三元组,图增强生成负责把保留子图中每个三元组连同头尾实体的精炼描述拼接到多模态查询之后送给多模态大语言模型,二者搭配的理由是接地只保证出现在查询中而剪枝进一步保证对答案有用,组合后模型看到的是既被感知证据支撑又被问题需求过滤的紧凑上下文。
看图路径: 1. 先看左侧模态内检索如何从查询向量到多跳子图;2. 再看右侧视觉与音频接地分数如何相加得到三元组总分;3. 最后看剪刀与保留提示如何把接地子图压缩为输入模型的子图
论文图 3。原论文 Figure 3:“Overview of the Multimodal RAG framework.”。
该图左侧展示查询图片与波形经多模态编码器做相似度搜索并得到以肉、狗与木地板为核心的多跳子图,右侧上方展示视觉接地方框与实体分数以及音频接地语句分数,下方展示三元组总分如何把离题节点剪掉,中间剪刀图标表示丢弃,最右侧把精简子图与问题一起送入多模态大语言模型。图中给出的示例分数可作为执行动作的核对点,例如观察狗与肉的高分如何保留而负鼠相关低分边如何被剪,但不要把示例分数当成全局阈值,阈值按基准另行设定。
没有梯度训练时,真正的计算与人力过程是什么?
本研究没有报告对多模态大语言模型或检索编码器的梯度训练与参数更新,因此该节不讲反向传播,而讲实际发生的构造、检索与推理计算。构造计算全部基于单个骨干语言模型搭建的轻量多智能体栈完成,只用各评测基准的训练切分做知识源,不动评测用的问答对。检索计算包括用视频与音频基础模型做编码、用向量索引做最近邻搜索、用接地模型做存在性打分、用轻量语言模型做二值保留判断,这些都是前向调用与搜索,没有梯度路径。
生成计算是把查询与图上下文拼接后调用多模态大语言模型做条件生成。原文未报告学习率、优化器、训练轮数与梯度冻结范围,这些缺项应当明确指出,不能从模型名称推定实现。同样不能把参数冻结等同于输出确定,因为生成仍受采样与检索候选变化影响。复现时应把重点放在爬虫与知识库快照、智能体提示与重跑阈值、向量索引与距离阈值、接地模型的版本与采样帧数上,而不是寻找训练脚本。
在哪些数据与模型上测,与谁比才算公平?
评测按 3 个任务组织。音频问答用基于音频标题语料构建的人工标注问答集,视频问答用基于活动视频构建的基准,音视频问答用明确要求对同步音画流联合推理的基准。这样的选择覆盖了只听、只看与又听又看 3 种输入形态,便于检验模态内检索是否在各形态下都有效。生成底座选了两个能联合处理音频与视觉流的开源模型,另选一个具有较强内部知识的商业模型,用来检验外部多跳证据对高容量模型是否仍有增益。
基线包括 5 种可运行策略:不检索直接回答、用文本知识图加共享嵌入朴素检索、用图文知识图加视觉与音频文本空间检索的两种实现,以及已有的音视频知识图与其自带检索流程。公平条件是同一底座配不同知识与检索,其余生成设置保持一致。指标分两层,第一层是模型裁判打分,对开放式自由回答由裁判模型对照参考打分,分数越高越好。第二层是胜率偏好比较,由裁判同时看到参考答案后在全面性、多样性与赋能性等维度上二选一,避免只比冗长。
实现上构造栈基于单个轻量骨干模型,检索取每查询前五邻近并扩展为多跳子图,距离与存在阈值按基准分别设定,实验固定在单张高性能图形处理器上运行,更多细节见补充材料。
主结果在什么条件下成立,代价与反例是什么?
比较的问题是:在同一底座与同一评测协议下,多跳模态内检索加接地剪枝是否比不检索、文本图谱检索、图文图谱检索与已有音视频图谱检索更能提升开放式问答质量,指标方向是模型裁判分数越高越好,胜率中本方法占比越高越好。下表把检索与剪枝的运行配置整理成可核对的条件表,阅读时先确认每行阈值只适用于对应基准,不能跨基准混用。表前已提出比较问题与公平条件,表后将解释收益与代价。
| 条件 | 含义 | 音频问答取值 | 视频问答取值 | 音视频问答取值 |
|---|---|---|---|---|
| 检索候选数 | 每查询取前邻近条目数 | 5 | 5 | 5 |
| 距离阈值 | 超出则视为离题邻居并丢弃 | 3.0 | 0.15 | 4.5 |
| 存在阈值 | 接地分低于则剪枝 | 0.5 | 1.5 | 1.2 |
表后解释如下。原文报告显示,本方法在两个开源底座与 3 个基准上均取得最大且最一致的增益,尤其在音频问答与音视频问答上拉开差距,而文本图谱加朴素检索时好时坏,有时甚至为负,图文图谱部分考虑视觉但仍错过查询动态,已有音视频图谱虽一致改善但多为边际增益。
论文对此的有限解释是:文本检索忽略音视频的时间性,图文检索仍用共享空间匹配,单跳图只能给局部概念事实,而本方法用多跳邻域聚合时间与语义相关证据并经接地与答案有用性过滤,因此上下文更聚焦。代价是引入了更多超参数与外部模型依赖,不同基准的距离与存在阈值量级差异很大,阈值调得不当会误删或漏剪。
未胜出项也应保留:基线中的已有音视频图谱在各基准上相对其他基线更稳,说明仅把知识源换成音视频本身就有价值,并非只有本方法有效。
定性例子进一步支撑判断,音频场景中基线只答餐厅或公园,本方法能说出家中聚会或有鸭子的池塘湿地,视频场景中基线误说蓝衣男子发球,本方法能说出一群人打躲避球,音视频场景中基线把圆柱体误判为音箱或漏掉打击乐器,本方法能纠正为吹风机与两种鼓,但这些例子是单样本展示,不能推广为全程每题都如此。
看图路径: 1. 对比每组基线回答与本方法回答在关键实体上的差异;2. 观察音频问答中场景词如何从单个词扩展为具体环境描述;3. 核对音视频问答中乐器数量与圆柱体对象判定的修正
论文图 4。原论文 Figure 4:“Qualitative results on various Question Answering tasks.”。
该图分上下两大区,上区左为两个音频问答,中区为视频问答,下区为两个音视频问答。每组都给出问题、基线回答与本方法回答。可见的修正包括把餐厅扩展为家中友好聚会,把公园扩展为有鸭子的自然栖息地,把发球误判修正为躲避球,把 4 人编制与键盘误判修正为 2 人吹苏格兰风笛加 2 人打鼓,把圆柱体音箱误判修正为黄色地毯上的银色吹风机。读图时以蓝色充分回答与红色不足回答的标注为准,不要把波形长度或视频缩略图数量当成性能度量。
拿掉模态内检索或剪枝后会发生什么?
消融的问题是:在需要联合音视频推理的基准上,模态内检索与接地选择性剪枝是否互补且缺一不可。原文的对照做法是:去掉模态内检索时,断开三元组与多模态条目的链接得到纯文本图,把每个三元组转成自然语句后用文本编码器在共享空间中检索;去掉剪枝时,只保留相似度检索的初始图。比较条件固定为同一底座与同一基准,指标仍是模型裁判分数。
下表整理消融所需的运行要素,表中数值均来自原文连续句中的运行配置,阅读时注意该表是条件表而非分数表,分数结论放在表后文字中。
| 运行要素 | 含义 | 取值 | 适用处 | 来源说明 |
|---|---|---|---|---|
| 候选数 | 每查询前邻近数 | 5 | 全部基准 | 模态内检索 |
| 视频采样 | 查询视频均匀采样帧数 | 四 | 视觉接地 | 接地模型输入 |
| 距离阈值 | 音视频基准的距离上限 | 4.5 | 音视频问答 | 初始图过滤 |
| 存在阈值 | 音视频基准的融合分下限 | 1.2 | 音视频问答 | 接地过滤 |
| 音频存在阈值 | 音频基准的音频分下限 | 0.5 | 音频问答 | 接地过滤 |
表后解释如下。
原文报告显示,只用模态内检索能把检索限定在查询模态内并减少错配,但仅靠相似度无法验证实体级相关与答案有用性,增益有限。只用剪枝能在忠实性上改善,但初始图若来自共享空间的纯文本检索,与音画线索对齐本来就弱,可剪的起点质量不高,改善也有限。两者结合时取得最高分,支持二者互补的判断。
限制是该消融只在一个音视频基准与一个底座上报告,未验证在纯音频或纯视频基准上是否同样互补,也未测量剪枝前后的上下文长度、延迟与调用成本,因此不能承诺剪枝一定降低开销。另一个未评测边界是接地模型本身的误检率, grounding 错误会直接传导为误删或漏剪,原文未给出误判率分解。
哪些结论不能下,哪些边界尚未评测?
首先区分 3 层表述。论文直接报告的是在给定底座、给定基准切分与给定裁判模型下的分数与胜率提升。有限解释是多跳邻域提供更丰富的证据链而剪枝去除离题重复,从而在全面性、多样性与赋能性上占优。未验证推测是把这种提升推广到任意音视频分布、任意接地模型或任意裁判模型上,原文没有提供这类泛化证据,应当用可能或待验证来表达。其次明确缺项。
原文未报告统计显著性方法、多次运行方差、人工评价与自动裁判的一致性,也未报告构造与检索的耗时、显存与调用费用,因此不能声称误判率、延迟或成本得到改善。训练资源与推理开销应分开讨论,总体趋势不等于每组每步都成立。第三是指出冲突与脆弱点。阈值按基准分别设定且量级差异大,说明方法对分布敏感,换新领域需重调。构造依赖爬虫抓到的标题描述与开放知识库快照,若快照变化或标题缺失,改写与接地质量都会漂移。
检查器的零到十分评估本身由模型打分,评估者与被评估者同源可能带来自证偏好。最后是误解澄清。无训练不等于确定性求解,检索候选与生成采样都会带来波动。多跳不等于跳数越多越好,跳数过大可能引入更多噪声,原文靠阈值与剪枝控制半径而非无限制扩展。
要复现应当先固定什么,再补哪项验证?
复现先做四件事。第一是固定知识源切分,只用各基准的训练切分构造图,不混入评测问答,避免泄露。第二是固定编码与索引,明确视频与音频编码器版本、向量索引类型与距离度量,按基准分别记录距离阈值与存在阈值,不跨基准复用。第三是固定接地与剪枝,明确视觉接地采样帧数与取最大值再求和的聚合方式、音频接地先转语句再打分的流程,以及轻量语言模型的保守保留或丢弃策略,记录被剪比例以便诊断。
第四是固定裁判协议,明确裁判模型版本、是否提供参考答案、评分维度与胜率统计口径,同一底座下对比不检索、文本图谱、图文图谱与已有音视频图谱等可运行策略,搜索最优或事后最优只能另行标注,不能代替可部署收益。还需补的验证包括:在新领域上重调阈值的灵敏度曲线,报告多次运行的均值与波动,抽样做人工核对以检验裁判偏好,测量端到端延迟与调用成本,并对接地模型的误检做分层分析。
由于本次未确认代码与数据的公开状态,复现应按论文文字与图注从零搭建,不预设可下载权重或一键脚本。
何时值得尝试这种多跳加剪枝的方案?
当任务同时满足 3 个条件时值得尝试:查询自带时间延续的声音或画面,答案需要点名具体实体并讲清动作与环境,仅靠模型内部知识容易出现以外形代声音或以局部代整体的幻觉。此时先构造可连回音视频条目的多跳图,再做模态内检索,比直接在共享空间中跨模态匹配更稳。接地剪枝适合作为第二道闸,尤其当初始召回偏大、离题邻居多时,先验证是否出现在查询中,再验证是否有助于回答问题,可以减少模型被冗余上下文带偏。
若查询多为单图单句且无需时间推理,单跳图文检索可能已够用,不必承担多智能体构造与双路接地的复杂度。教学上记住一条依赖链:上下文富集改写决定抽取能否碰到长尾实体,归一化与接地决定外部描述能否查到且查准,模态内检索决定候选是否对齐查询模态,接地与选择性剪枝决定最终上下文是否既出现又有助回答,任何一环阈值失配都会削弱整条链的增益。
📐 原文公式与排版
以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。
区域 1 · 查看论文原页
区域 2 · 查看论文原页
另有 11 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses





