英文题目:SciMKG: A Multimodal Knowledge Graph for Science Education with Text, Image, Video and Audio

会议身份:conference:aaai:2026:conference-paper-id:38574

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#教育 #数据集 #多模态学习 #音视频 #音频检索

评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.4/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Tong Lu:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhichun Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Yaoyu Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Yiming Guan:机构信息未能从会议 PDF 纯文本可靠映射
  • Zhiyong Bai:机构信息未能从会议 PDF 纯文本可靠映射
  • Junsheng Du:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

输入为开放慕课视频字幕与幻灯片、课程标准、习题及ConceptNet与Wikipedia等异构资源,输出为覆盖生物、物理、化学的学科层、知识点层、概念层三级四模态教育知识图谱SciMKG,难点是在零人工标注下准确抽取学科概念并维持文本、图像、视频、音频的跨模态语义一致。抽取阶段由GPT-4o等多大语言模型逐步推理产生候选概念,其输出直接进入验证阶段接受自我反馈与自我精炼的逐轮核查剪枝并附删留解释。集成增强阶段以自洽投票合并多模型结果形成精炼概念集,再用ConceptNet与Wikipedia补足覆盖并生成讲解文本。对齐组织阶段基于共享结构与语义特征将四模态数据挂载到同一概念,再按课程标准分层索引并存为跨表互引与RDF。与依赖人工标注训练命名实体识别的已有方法不同,该框架以自我精炼加自洽投票替代人工标注,并以免训练轻量对齐替代监督配准,从而降低标注依赖并保障跨模态一致性。在覆盖100课时4479个概念的子图评测下,本方法的F1-score为0.803,高于LinkNER的0.734。该结论适用边界受限于中文中学理科语料,对其他学科、语言与真实课堂噪声的外推尚未验证。硬件方面实验仅说明在单块NVIDIA GeForce RTX 3090服务器上运行,大规模部署的推理开销与延迟仍受限。

🔗 开源与复现资源

  • 代码相关资源:https://github.com/kg-bnu/SciMKG — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,要解决什么,能复述到什么程度

本文解读的对象是标题为 SciMKG 的多模态教育知识图谱工作,面向中国初中阶段自然科学的生物、物理、化学。输入是公开课平台上的视频、幻灯片、习题,加上课程标准文本,以及外部的 ConceptNet 和 Wikipedia。目标是自动抽出学科概念,再把文本、图像、视频、音频 4 种模态挂到同一概念上,最后按学科、知识点、概念 3 层组织成可检索的知识图谱。需要保留的关键信息是构造管线的 4 个步骤、每种模态的对齐做法、图谱规模数字、评估子图与指标设置,以及代码当前可用这个事实。

资源状态显示代码链接可用,因此可以写已公开。读完本解读,研究生应能复述数据从哪里来、概念如何抽取与过滤、图像视频音频如何挂载、图谱如何存储,以及实验如何证明抽取与对齐有效。教学例子在下文会明确标为例子,不代表论文报告的效果数字。

已有路线卡在哪里,本文站在哪条线上

做教育知识图谱,传统做法是靠人工标注训练命名实体识别或排序模型,例如用门控循环单元抽句子级概念,或用改进的 RoBERTa 给候选概念排序,或用远监督缓解标注噪声。这条线的问题是标注贵、换学科换教材适应慢,且主观偏置难消除。另一条线是用大语言模型零样本抽取,但论文指出已有工作仍部分依赖手工搭好的图谱骨架,缺少指令调优与纠错。

模态方面,多数教育知识图谱是纯文本,即使从多模态资源抽知识,也常转写成文本存起来,丢失了图像、视频、音频本身。通用域有多模态知识图谱尝试 4 模态,但依赖人工做对齐。本文的选择是全自动管线加多模态保留:用多个大语言模型做抽取与验证,用多模态大语言模型做对齐,用课程标准做层级组织。可以把已有工作按同输入、同目标、同监督来对照:同为慕课输入的教育数据仓库只做数据存档而不做知识图谱推理。

同为教育知识图谱的工作多为单模态文本;同为多模态知识图谱的工作多在通用域且需人工对齐。本文的差异是有源可核对的 4 模态教育图谱与配套构造工具。

任务的形式化输入与输出是什么

先把任务说成可执行的形式。设从视频字幕抽到的段落集合为 P,每个段落记为 pi,指定学科为 d,例如生物。概念抽取的目标是从 P 中得到与 d 相关的概念集 C,每个元素记为 cj。这是一个受学科约束的实体识别问题,不是把所有名词都留下。再设多模态资源集合为 A,包含文本、图像、视频、音频 4 类。

多模态对齐的目标是把 A 中的各模态属性映射到 C 中对应的概念上,使同一概念的 4 种模态语义一致。举一个教学例子:若某段字幕讲肌肉组织收缩,抽取应留下肌肉组织而去掉上课口头语,对齐应把幻灯片里的肌肉显微图、该时间段的视频片段、由解释文本合成的音频都挂到肌肉组织这个节点上。论文还要求图谱可组织:学科在上,知识点在中,概念在下,知识点来自课程标准与慕课大纲,概念通过相关关系挂到知识点,习题通过习题关系挂到知识点。

四步管线如何从资源走到可存的图

论文框架分为数据获取与预处理、概念抽取、多模态对齐、知识组织与存储 4 个部分。数据侧从慕课拿视频、幻灯片与习题,视频字幕作为抽概念的文本,幻灯片抽图像,用多模态大语言模型改写文本后生成音频,并记录原视频地址。概念侧用抽取、验证、整合、增强管线得到概念集,再链接外部知识库扩大覆盖。对齐侧分别处理图像、视频、音频与概念的对应。组织侧按 3 层结构存成跨索引的表格,并提供资源描述框架格式。

知识点 × 概念: 知识点是按课程标准和慕课大纲组织的中层结构,如动物体结构层次,概念是挂在知识点下的基础层单元,如肌肉细胞,知识点负责提供学科层级和习题归属,概念负责承载 4 模态解释与关联,组合后实现学科-知识点-概念 3 层可检索结构。

下面这张总览图把 4 个部分摆成了顺时针闭环,适合先建立全局动作顺序再看细节。

看图路径: 1. 先看左上数据资源框确认课程标准、幻灯片、习题、视频四类输入;2. 再看右上抽取概念框注意时间戳与概念名的对应行;3. 接着看右下多模态对齐框确认同一概念如何并排挂图、视频波形与文本;4. 最后看左下组织存储框确认概念与知识点两个 JSON 的字段清单

原论文 Figure 1:Construction pipeline of SciMKG.

论文图 1。原论文 Figure 1:“Construction pipeline of SciMKG. Multimodal data (text, image, video, and audio) are processed by the pro- posed pipeline to identify disciplinary concepts, which are then…”。

从像素看,左上框列出课程标准、幻灯片、习题、视频 4 类输入,右上框列出带时间戳的概念行,例如同一时间段出现受精卵、囊胚、动物细胞等,右下框对每个概念并排展示图像缩略图、视频条带与文本解释,左下框给出概念表与知识点表的字段清单,包括概念编号、时间戳、文本、视频地址、图像编号表、知识点编号、音频编号等。这种摆法说明管线不是单向抽词,而是抽取后必须经过对齐再落到可索引的存储结构。

概念如何抽出来又不把无关词留下

概念抽取管线按抽取、验证、整合、增强顺序执行。抽取阶段引导大语言模型先按句法标出所有短语,再从名词与名词短语中筛出候选学科概念,目的是先保证句法完整再做学科过滤。验证阶段用迭代自我求精,让每个大语言模型自己判断候选概念是否属于给定学科,对可能剪掉的概念给出简短理由,再基于累积反馈做精确过滤。整合阶段把多个大语言模型的验证结果做自洽投票,每个概念的自洽分随迭代累加,达到置信阈值才进入最终集合,否则剪掉。

论文使用的模型包括 GPT-4o、Gemini-1.5-flash 与 DeepSeek-V3,验证迭代次数设为 5,阈值设为 0.7。增强阶段以每个已抽概念为入口对接 ConceptNet,用 8 种语义关系经正则规则找候选扩展概念,再用大语言模型按学科过滤与交叉验证,然后链接 Wikipedia 取详细描述并压缩成简短解释,再转成音频。

概念抽取 × 多模态对齐: 概念抽取负责从视频字幕文本中找出属于指定学科的概念集合,多模态对齐负责把文本、图像、视频、音频 4 种资源挂到同一概念上,二者搭配是因为只抽文本概念无法支撑多模态应用,只对齐而无准确概念会错挂资源,组合后形成以概念为中心、以 4 模态为属性的知识图谱节点。

沿一个样本走一遍会更清楚。设输入是一段讲上皮组织与肌肉组织的字幕,抽取先给出包含组织、细胞、结构等名词的候选表,验证把非生物学意义的日常用词去掉并留下上皮组织、肌肉组织等,整合比较 3 个模型的保留投票,只有多模型都认可的概念才留下,增强再从肌肉组织出发在外部库中找到相关细胞类型并补上解释文本。

自我求精 × 自洽投票: 自我求精指单个大语言模型对候选概念做反馈再剪枝,用于去掉学科归属模糊的概念,自洽投票指多个大语言模型各自验证后按出现频次计分并用阈值过滤,二者搭配是因为单模型自查能提精确率但仍有模型偏置,多模型投票能补召回并压住偶然错误,组合后得到更稳的最终概念集。

需要提醒的是,论文未给出抽取提示词全文与正则细节,复现时只能按上述动作搭流程,不能假定与原文完全一致。

四种模态分别用什么信号挂到概念上

对齐部分对 4 种模态用了不同依据。概念与图像对齐靠多模态大语言模型的跨模态理解,一个模型为每张图像生成语义描述并映射到概念,另一个模型结合文本评估置信度,只有超过 0.8 才算有效。概念与视频对齐同时用语义相似与时间结构,把视频片段与其共现概念按文本语义与时间戳一起对应,并保留原视频地址方便回看。概念与音频对齐不是直接配原声,而是把来自 Wikipedia 的文本解释改写后用语音合成生成音频,以缓解大语言模型幻觉带来的解释噪声。

结构对齐 × 语义对齐: 结构对齐利用视频时间戳等结构特征把共现的视频片段与概念对应,语义对齐利用多模态大语言模型生成的描述与文本解释判断图像与概念是否同义,前者分工是解决视频切段归属,后者分工是解决图像内容理解,组合后论文称之为基于共享结构与语义特征的跨模态对齐。

可以这样理解分工:视频有天然时间戳,适合用结构共现先定大框再用语义确认;图像没有时间信息,必须靠内容描述转成文本再比;音频是派生的,先保证解释文本可靠再合成,避免把错误解释固化成语音。这种不对称设计是论文的一个实际选择,也是复现时要保留的:不要把 3 种对齐都换成同一套相似度阈值。

本研究训练了什么,没有训练什么

本研究没有训练新的神经网络抽取器,也没有微调对齐模型,论文未报告梯度路径、优化器、冻结与更新安排,因此不能从模型名称推定实现细节。真实计算过程是调用既有模型做推理与生成:用大语言模型做候选抽取、自我反馈剪枝、多模型投票与外部概念过滤与解释压缩,用多模态大语言模型做图像描述与置信度判断,用语音合成由改写后的解释生成音频。

ConceptNet 扩展 × Wikipedia 解释: ConceptNet 扩展以已抽概念为入口按 8 种语义关系找候选新概念并用大语言模型按学科过滤,Wikipedia 解释为保留的概念拉取详细描述再用大语言模型压缩成简短解释并转语音,二者搭配是因为慕课覆盖不全需要外部补全,而补全后仍需可读解释与音频,组合后扩大概念集并补齐文本与音频模态。

从复现角度,这意味着成本不在训练而在调用:多模型、每概念多轮验证、图像逐张打分都会产生接口开销。论文报告实验机为 Ubuntu 系统、Xeon 中央处理器、128 GB 内存与单张 RTX 3090,软件为 Python 3.7 与 PyTorch 环境,但该配置主要支撑评测与数据处理,不是训练大模型的配置。缺项要明确指出:提示词模板、ConceptNet 正则规则、改写与压缩的具体指令、语音合成引擎型号均未在证据中给出,复现时需自行记录并做敏感性检查。

评测子图、基线与指标如何摆才公平

概念抽取评测用从 SciMKG 随机取的子图,覆盖生物、物理、化学 100 个课时的知识点,共 4479 个概念及其 4 模态数据。基线包括分解问答、GPT 命名实体识别、LinkNER、UniversalNER、自改进等零样本或弱监督方法,为公平起见所有基于大语言模型的基线都以 GPT-4o 为骨干。指标用精确率、召回率、F1、准确率、马修斯相关系数与曲线下面积,方向都是越高越好,但要注意准确率在实体稀疏时易虚高,需结合 F1 与召回一起看。

多模态对齐评测聚焦概念与图像,因为视频可用结构信息而图像更依赖语义视觉推理,自动指标用 CLIP 分数、BLIP 匹配分、X-VLM 匹配分与问答分数,另加 5 位专家按 0 到 1 打分,1 为完全对齐。超参数方面,大语言模型温度设为 0.0、最大长度 1000、top-p 为 0.1、频率惩罚为 0.5、随机种子为 42,验证迭代 5 次、置信阈值 0.7。比较公平性的关键是同一子图、同一骨干模型、同一指标集合,论文还做了不同规模开源模型组合与不同迭代阈值的对照,以检验对前沿模型能力的依赖。

主结果证明了什么,代价在哪里

为回答抽取是否更准且更均衡,需要同时看精确率与召回率而非只看单项。表前的问题是:在同一子图与同一骨干条件下,本方法相对已有零样本抽取基线是否在综合指标上占优,方向是精确率、召回率、F1、准确率与曲线下面积越高越好。

Modality# Modality data% Concepts covered
Image10,5270.39
Video10,4250.80
Audio34,6301.00

上表是原文直接给出的模态数据量与概念覆盖率,说明音频覆盖全部概念而图像覆盖约三成九,视频覆盖约 80%,这决定了对齐评测为何单看图像更有区分度。模态不均衡本身就是代价:不是每个概念都有原生图像与视频,部分模态需靠生成或结构共现补齐。 为回答图谱规模是否达到可用量级,需要看知识点、概念、三元组与各模态文件数。下表把论文报告的总量整理成五列,避免只看单一数字。

图谱范围知识点数量概念数量关系三元组数量习题与多模态文件
初中生物物理化学合计1,356 knowledge points34,630 multimodal concepts403,400 relational triples763 exercises
其中文本解释与音频1,356 knowledge points34,630 concepts403,400 triples34,630 audios

表后解释:总量显示这是一个十万级三元组、万级概念的图谱,音频与概念一一对应,习题量相对少,说明图谱更偏向概念讲解与检索而非题库。未胜出项是图像与视频覆盖不全,复现时若只看总量会高估每个概念的多模态完整度。 为回答抽取综合性能是否领先,需要把本方法与基线放在同一指标下比较。

下表聚焦论文明确用连续原句报告过的数字。

评估对象指标本方法值对照方法值原文对照结论
概念抽取准确ACCACC (0.986)高于基线准确率报告为最优
概念抽取排序AUCAUC (0.985)高于基线报告为最优
基线取舍示例precisionhigh precision (0.935)对应 recall 偏低显示单项高不等于综合优
基线取舍示例recallat the cost of recall (0.570)与高精确率同组出现显示权衡存在

表后解释:本方法在 F1、准确率与曲线下面积上报告为最优,支持抽取管线有效的判断。

代价是基线常在精确率与召回率之间取舍,例如分解问答精确率高但召回低,GPT 命名实体识别相反,本方法通过多模型验证与投票拿到更均衡的结果,但这依赖前沿模型的语义理解,不是小模型能免费复制的。 下面这张子图把 3 层结构与 4 模态挂载画成了可核对的实例。

看图路径: 1. 先找到顶部生物学科节点再沿 related to 箭头看到知识点节点;2. 再看肌肉细胞节点向外发出的四条 has 边分别指向解释、图像、视频、音频;3. 对比左右两侧概念节点的挂载完整度差异

原论文 Figure 4:Visualization of a subgraph from SciMKG.

论文图 4。原论文 Figure 4:“Visualization of a subgraph from SciMKG.”。

从像素看,顶部黄色椭圆为生物学科,经相关关系指向绿色知识点的动物体结构层次,再经相关关系指向粉色概念肌肉细胞,该概念向外以具有解释、具有图像、具有视频、具有音频 4 条边分别指向文本句、显微图、视频条带与波形,右侧有机体概念同样挂解释与图像。这种一概念多属性的扇出是复现时要检查的存储形态:每个概念是否真有 4 条边,还是只有部分边。

拿掉验证或投票会发生什么

为回答管线中哪个部件不可少,论文做了消融。去掉多模型只留单模型时召回明显掉,去掉自我反馈时精确率明显掉,同时去掉两者时 F1 掉到 0.312,支持两者协同且缺一不可的判断。另一组对照换用不同规模的开源组合,例如 Qwen 与 Gemma 与 Phi 的小中大搭配,最好的开源组合 F1 为 0.741,仍比主力方法低 0.062,支持前沿模型能力不可或缺的解释,但也说明框架本身对中小模型仍有提升作用。迭代与阈值对照显示阈值低利召回、高利精确,中等阈值最均衡,迭代 5 次加阈值 0.7 为最优点。

看图路径: 1. 先按图例确认五类错误缩写与百分比的对应关系;2. 比较无效输出与格式错误两块合计占比与语义错误两块占比的大小

原论文 Figure 5:Error distribution. FE = Fomat Error, IO = Invalid Output, CE = Concept Error, CO = Concept…

论文图 5。原论文 Figure 5:“Error distribution. FE = Fomat Error, IO = Invalid Output, CE = Concept Error, CO = Concept Omission, NR = No Response.”。

从像素看,环形图按图例分为格式错误约 26%、无效输出约 34%、概念错误约 11%、概念遗漏约 9%、无响应约 10%。解释是语义类错误合计仅约 20%,支持语义推理有效的说法,但格式与无效输出合计超 60%,说明主要失败不在学科判断而在输出可控性。复现时应优先加格式约束与重试解析,而不是只调学科提示。

还不能承诺什么,边界在哪里

论文直接报告的是抽取综合指标与图像对齐的人评 0.73 及 CLIP 分数 0.83 等自动分,支持对齐有效的判断,但未测量误判率、延迟、接口成本与教学效果,因此不能承诺更快、更便宜或更能提分。相关性不等于因果:对齐分数高不代表学生理解更好。未评测边界包括:视频与音频对齐未做同等强度的人评,跨学科泛化只在理化生三科内验证,中文初中场景外的迁移待验证。

原文表头与算术若有冲突应标注冲突,本文证据中未发现需要编造口径来圆的冲突,但学科分表数字只出现在表格中,引用时需注明来自表格而非正文连续句。总体趋势不等于每组都成立:阈值与迭代的最优点是在该子图上取得,换教材或换模型需重调。

先做什么才能重跑出可比结果

复现先做三件事。第一,按论文动作搭数据流:取慕课视频字幕为文本、幻灯片抽图、记录视频地址,用多模态大语言模型改写文本并合成音频,字段按概念表与知识点表的清单保留编号与跨索引。第二,搭抽取管线:先做名词短语候选,再做单模型自我求精,给出剪枝理由,再做多模型投票,迭代 5 次、阈值 0.7 起步,用温度 0.0、top-p 0.1、种子 42 保证可比。

第三,搭对齐与存储:图像逐张生成描述并打分,阈值 0.8 起步,视频按时间戳共现加语义确认,音频由解释改写后合成,存储同时保留表格与资源描述框架格式。验证补项包括:记录提示词全文与正则规则,报告精确率召回率 F1 与准确率的完整六指标,图像对齐同时报告自动分与多人打分,并公开失败样本中格式错误的占比。代码已公开可作为起点,但权重与接口依赖需自行确认,不能把代码可用等同于开箱可运行。

何时值得用这个方案,何时换别的

当任务是把开放课程快速整理成可检索的多模态知识结构,且能承担前沿模型多轮调用成本时,这个方案值得尝试,因为它把抽取准确与模态保留放在同一管线里,并用课程标准保证层级可用。当只能用小模型或离线环境时,应降低预期或改用远监督加词典的轻量路线,并接受召回或覆盖的损失。当应用只做纯文本问答时,不必为每个概念补全 4 模态,优先保证文本解释质量。常见误解是把音频当成原声录音,实际是解释文本合成的派生语音。

把视频对齐当成内容理解,实际很大程度依赖时间戳共现;把总量数字当成每个概念都有全模态,实际图像覆盖不足 40%。记住这三点,就能更稳地复述与复现本文方法。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 aaai-2026 论文汇总