K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
Hao Liang, Qihan Lin, Zhaoyang Han, Xiaochen Ma, Zhen Hao Wong, Meiyi Qiang, Linzhuang Sun, Wentao Zhang
cs.CL
2026-05-11
团队从人教版教材抽出覆盖 9 节点 14 关系的课程知识图谱,派生出 23,640 题的基准,最强模型也只到 57%,并用 7335 条训练数据缩小差距。
现有的教育评测(C-Eval、CMMLU、GaokaoBench、EduEval)主要考模型能不能答对考题,却不考它懂不懂得课程知识是怎么组织起来的。作者把后者称为「课程认知」,包括先修关系链、概念分类、实验与概念的关联、教学顺序,以及把概念定位到课本插图里的能力。一个能考高分的模型未必具备做辅导所需的这种结构化理解,这就是这篇要补的缺口。
K12-KGraph 从人教版教材抽取,覆盖数学、物理、化学、生物四个学科,横跨小学、初中、高中。图里有 9 种节点(书、章、节、概念、技能、实验、习题、图、视觉元素)和 14 种关系,文本部分有 6579 个概念、1364 个技能、652 个实验、1171 道习题,多模态部分有 7388 张图、10203 个视觉元素。
在这个图上派生出三样东西。K12-Bench 是 23,640 道多选题,分五个任务族:Ground(知识落地,概念、技能归属)、Prereq(先修推理)、Neighbor(邻近推荐,如上下位、相关)、Evidence(实验证据链)、Locate(跨章节定位)。K12-Train 是 7335 条训练样本,其中 2267 条纯文本问答、5068 条多模态视觉问答,都是沿着图谱的节点和边合成出来的。
即便很强的模型,在课程认知上也撑不住。
| 模型 | 整体 EM | 整体 F1 |
| Gemini-3-Flash | 57.1% | 73.0% |
| Gemma-4-31B-IT | 46.4% | 69.5% |
| GPT-5.2 | 42.8% | 68.0% |
| 随机基线 | 6.7% | 36.4% |
Prereq 和 Neighbor 最难,即便 Gemini-3-Flash 的 EM 也低于 35%;LLaMA-3-8B 基本和随机猜一样(7.2%)。
训练实验说明领域监督有用。在 Qwen3-4B-Base 上、用约 2300 条样本的同等预算下,K12-Train-Text 在 GaokaoBench 拿到 1009.96,高于 DataFlow 的 985.91 和 WizardLM 的 922.75。多模态方面,K12-Train-Full 在 Gaokao-MM 上 39.9%,高于基线的 32.4% 和全量 DataFlow 的 33.3%,而且明显优于纯文本或纯多模态变体,说明文本和视觉监督互补。
对做教育大模型的人,这是一个新维度的诊断工具:不只看能不能做题,还看懂不懂得知识的结构。K12-Train 用很少的样本(7335 条)就能在几个高考基准上超过更大的通用指令数据子集,说明课程结构化的监督密度很高,值得在垂直教育模型里用。
作者承认了几条。图谱只覆盖一个出版社(人教版)的四个理科,文科和其它版本没纳入,代表性有限。多模态部分主要是图表,几乎没有视频或交互内容。验证依赖人工标注者,虽然标注者间一致性不错(Fleiss κ=0.84)。训练收益也可能混杂了样本质量和领域特异性,不全是「课程落地」本身的功劳。另外,合成问答式基准难免有模板痕迹,模型可能学到部分模板规律而非真正的结构理解。