北大开源 K12-KGraph:面向教育 LLM 的 2.36 万题基准
PekingUniversity · hf · 2026-07-24
北大团队提出 K12-KGraph:一个按课程体系对齐的知识图谱,数据来自人教版小学、初中和高中数学、物理、化学、生物教材。
他们基于该图谱构建了两类资源:
- K12-Bench:23,640 道多选题,覆盖 Ground、Prereq、Neighbor、Evidence、Locate 五类任务
- K12-Train:7,335 条监督样本,其中包括 2,267 条纯文本 QA 和 5,068 条多模态 VQA
论文的核心观点是,现有教育类基准大多只测“会不会答题”,而真实的教育能力还包括作者称为 curriculum cognition 的能力:理解先修关系、概念层级、实验与概念的关联、教学顺序,以及图文中的视觉 grounding。
实验结果显示:
- Gemini-3-Flash 在 K12-Bench 上的 exact match 只有 57%
- Gemma-4-31B-IT 只有 46%
- Prereq 和 Neighbor 是最难的任务
- 在相同 2,300 样本预算下,K12-Train-Text 在 GaokaoBench 和 EduEval 上稳定优于 8 个主流 instruction-tuning 数据集的等规模子集
- 对视觉语言模型而言,K12-Train-Full 在 Gaokao-MM、MDK12-medium、K12Vista 上都取得最好结果,并且优于纯文本或纯多模态版本,说明文本监督与视觉监督是互补的
作者同时放出了图谱、基准、训练数据和完整构建流程。
「多模态」频道最新
- Codex 生成体素世界原型的概念美术图 — Dimillian · 2026-07-24
- FLUX 3 把图像视频音频和动作预测统一进一个模型 — robrombach · 2026-07-24
- 作者提前搭建 Seedance 2.5 提示词库,想跳过下次模型换代成本 — Practical_Low29 · 2026-07-24
- 疑似新 Opus 一次生成出高细节 voxel 寺塔 — cedric_chee · 2026-07-24
- Swiss AI 发布 Apertus v1.5 开放多模态模型 — jacek2023 · 2026-07-24
- Wan2.2 的 INT8 Convrot 在 3090Ti 上反而更慢 — Fun-Class3451 · 2026-07-24