开源教育模型 OmniEdu 发布:27B/9B/4B,60 项指标 51 项领先专有模型

Puzzleheaded_Box2842 · reddit · 2026-09-23

团队发布面向 K-12 教学的开源基础模型家族 OmniEdu,含 27B/9B/4B 三个版本,基于 Qwen3.5-4B-Base、Qwen3.5-9B-Base 和 Qwen3.8-27B 做全参数监督微调。

训练设置:LLaMA-Factory,最大序列长 32768,学习率 5e-6,3 个 epoch,BF16,DeepSpeed ZeRO-3。

数据:合并 100+ 教育资源与通用指令数据,最终 69,999 条样本(60,951 条教育专用 + 9,048 条通用),1596 万监督 token;从约 134 万候选经六阶段管线(清洗去污染、语义审计、质量过滤、多样性筛选等)筛出。教育监督围绕四能力:学科解题、课程定位(知识点/年级/难度/前置关系)、诊断推理(识别错误与误区)、教学行动与脚手架(提示、提问、复习或直讲),并配 20 种任务级系统指令。

评测:在 60 项指标级对比中 51 项领先五个专有模型。OmniEdu-27B 的 K12-Bench EM 63.12%、MathFish 85.89%、MathTutorBench Scaffold 78.74%(基线 57.16%)、LongTutor Evidence 从 36.80% 提升至 78.20%;4B 版 Scaffold 胜率从 20.42% 升至 75.79%;MMMU-Pro 从 64.97% 升至 67.98%。作者强调这些是基准成绩,不代表学生学习效果的直接证据。

所属事件:北大开源教育模型 OmniEdu,多项指标超专有模型(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →