能力均衡微调让27B课标EM从52%升到63%

OmniEdu: Open Foundation Models for Learning and Teaching

Hao Liang, Qihan Lin, Meiyi Qiang, Linzhuang Sun, Hengyi Feng, Mingrui Chen, Sizhe Qiu, Wentao Zhang

cs.CL

2026-09-19

四类能力筛出7万条数据微调4B/9B/27B。27B课标EM 63.12%,脚手架胜率78.74%,教学均分3.02。

这篇在解决什么

现有教育大模型大多只做一件事:要么刷题给答案,要么做对话辅导。训练数据也按来源或科目堆,很少按「这条样本到底在教模型什么行为」来配比。结果是模型会解题,但找不到对应知识点,看不出学生错在哪,一开口就把答案漏完。

真正能用的 K-12 助手要同时做四件事:把题做对、把题放到课标结构里、从学生作答里诊断缺口、再选一个合适的教学动作(提问、提示、补前置、或直接讲)。北大、国科大、中关村学院的 OmniEdu 把这四件事写成能力分类,用同一套后训练数据把 4B、9B、27B 一起拉起来。

方法

监督不按学科切,按四种能力切:

数据管线从 100 多个来源的约 134 万条教育样本筛到 60951 条:

再加 9048 条通用指令(DataFlow-Instruct-10K 7431、Tulu-3-SFT 1495、MathV360K 122),总盘 69999 条、1596 万监督回复 token。底模是 Qwen3.5-4B-Base、Qwen3.5-9B-Base、Qwen3.8-27B,LLaMA-Factory 全参 SFT,学习率 5e-6,3 个 epoch,上下文 32768。

结果

课标侧,三个尺度相对各自底模都涨。27B 的 K12-Bench EM 从 52.11% 到 63.12%,F1 从 73.48% 到 76.69%;MathFish 准确率 83.54% 到 85.89%;EDUMATH 的 MaC(课标对齐出题)从 70.60% 到 86.95%,只低于 Kimi-K3 的 90.00%。课标定位子任务 EM 从 29.85% 拉到 48.77%,正例对齐从 45.95% 拉到 67.60%。4B 的 EDUMATH MaC 从 47.60% 跳到 68.40%。

解题侧:

模型GAOKAO 满分率EXAMS-VMDK12
OmniEdu-4B90.46% (底模 88.98%)57.62% (44.69%)46.36% (35.43%)
OmniEdu-9B93.66% (92.94%)66.40% (63.00%)50.80% (44.50%)
OmniEdu-27B94.87% (91.55%)69.52% (68.65%)57.76% (46.04%)

27B 在 MDK12 开放题正确率从 62.08% 到 78.77%,GAOKAO 语文从 55.10% 到 94.26%。开源教育模型 Confucius3-Math、EduChat 在课标和多模态考试上经常接近崩盘,对照意义有限。闭源里 Claude-Opus-5 的高考满分率 97.22%、Kimi-K3 的 EXAMS-V 87.29% 仍明显更高。

辅导侧涨得最狠。MathTutorBench 脚手架胜率:4B 从 20.42% 到 75.79%,9B 从 14.00% 到 75.26%,27B 从 57.16% 到 78.74%;难集上 27B 到 83.59%。GPT-5.4 脚手架只有 6.32%,典型「直接给答案」;Claude-Opus-5 仍以 87.89% 领先。LongTutor 证据利用 27B 从 36.80% 到 78.20%,教学均分 3.02,评测集里最高。知识状态诊断准确率最高也只有 54.04%。TutorBench 几乎没动,27B 从 58.58% 到 59.42%,Kimi-K3 仍是 63.65%。

通用能力没有被教育特化吃掉:IFEval prompt-strict 27B 从 80.59% 到 82.07%,GPQA Diamond 从 74.24% 到 77.78%,MMMU-Pro 从 64.97% 到 67.98%。

为什么重要

这是一套可复现的开源 K-12 后训练配方,数据、模型、代码都放出来了。对要做教育产品的人,关键动作是把「解题 / 课标 / 诊断 / 教法」拆开配比,并用系统指令把互相冲突的回复策略说清楚。7 万条、1600 万 token 的体量,中小团队用开源 4B/9B 就能跟。脚手架上的跃迁说明,底模其实会解题,缺的是「先别把答案说出来」的行为约束。

这仍是渐进的数据工程,不是新架构。TutorBench 几乎不动、诊断准确率卡在 54%,「会教」还远没做完。

局限与存疑

正文没有独立的局限节。能看出的硬缺口有这些。没有能力消融,也没有管线各阶段的对照,说不清四类能力、token 预算、20 条系统指令各自贡献多少。诊断准确率作者自己也写了「仍然困难」。MathFish 总体只涨 2.35 个点,部分负例对齐反而掉(27B 的 ATC 邻居负例从 88.31% 到 79.07%)。4B 高考语文从 90.89% 掉到 59.30%,科目级数字不稳定,不宜当产品指标。只做了 SFT,没有教法向的 RL 或偏好优化。推理时必须选对系统指令,产品层还得自己编排。评测大量依赖 LLM 裁判的胜率,没有教室里的真人教师实验。开源教育基线在若干任务上接近失效,拉大了表面上的差距。27B 底模是 Qwen3.8,4B/9B 是 Qwen3.5,家族都不统一。

术语

原文与代码

相关论文

全部论文解读