开源教育模型 OmniEdu 发布:27B/9B/4B,60 项指标 51 项领先专有模型
Puzzleheaded_Box2842 · reddit · 2026-09-23
团队发布面向 K-12 教学的开源基础模型家族 OmniEdu,含 27B/9B/4B 三个版本,基于 Qwen3.5-4B-Base、Qwen3.5-9B-Base 和 Qwen3.8-27B 做全参数监督微调。
训练设置:LLaMA-Factory,最大序列长 32768,学习率 5e-6,3 个 epoch,BF16,DeepSpeed ZeRO-3。
数据:合并 100+ 教育资源与通用指令数据,最终 69,999 条样本(60,951 条教育专用 + 9,048 条通用),1596 万监督 token;从约 134 万候选经六阶段管线(清洗去污染、语义审计、质量过滤、多样性筛选等)筛出。教育监督围绕四能力:学科解题、课程定位(知识点/年级/难度/前置关系)、诊断推理(识别错误与误区)、教学行动与脚手架(提示、提问、复习或直讲),并配 20 种任务级系统指令。
评测:在 60 项指标级对比中 51 项领先五个专有模型。OmniEdu-27B 的 K12-Bench EM 63.12%、MathFish 85.89%、MathTutorBench Scaffold 78.74%(基线 57.16%)、LongTutor Evidence 从 36.80% 提升至 78.20%;4B 版 Scaffold 胜率从 20.42% 升至 75.79%;MMMU-Pro 从 64.97% 升至 67.98%。作者强调这些是基准成绩,不代表学生学习效果的直接证据。
所属事件:北大开源教育模型 OmniEdu,多项指标超专有模型(2 条相关)→
「模型」频道最新
- 阿里连发五款 Qwen-Audio-3.1 语音模型,ASR 直降 95% — aigclink · 2026-09-23
- 46,000 字符纯数学代码生成短片,用户盛赞 Opus 5.5 是硅基最强艺术家 — RileyRalmuto · 2026-09-23
- Claude Opus 5.5 登顶 RSI 指数,Vals AI 将全面 RSI 预期提前至 2027 年 7 月 — burny_tech · 2026-09-23
- GPT-6 Sol/Luna 价格砍半:$2/$10 与 $0.10/$0.50,智能分数持平 GPT-5.6 — burny_tech · 2026-09-23
- 小米自建「黑客 Agent」反复攻击训练环境,直至无可利用漏洞 — alejandroll10 · 2026-09-23
- Limite 1B 官方建议:AIME 评测输出平均约 5 万 token,应放更长生成时间 — tensorqt · 2026-09-23