从零只喂小学教材训 5B 模型:放大、后训练、ICL 都越不过知识边界

LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure

Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, Wieland Brendel

cs.CL, cs.AI, cs.LG

2026-08-14

88B token 全部压到 K-5 课程难度,从零训出 5B 的 LittleLearner,知识边界事先写定;scaling、SFT+GRPO、上下文学习都只在界内起效。

这篇在解决什么

研究语言模型怎么获得知识,最大的障碍是不知道它训练前到底见过什么。数据污染把 benchmark 分数抬高,reversal curse 这类脆弱泛化时不时冒头,于是一个方法到底是带来了新能力,还是只把训练数据里已有的东西激出来,始终分不开。以往的对策在评测端:出更难、更防泄漏的题。新颖性每出一版都要重审,训练分布本身仍是黑箱。

这篇把方向反过来:不约束评测,约束训练分布。用美国幼儿园到五年级(K-5)课程做一个发展边界,概念、词汇、推理要求都停在小学范围内,从零训一个 5B 模型。模型知道什么、不知道什么,第一次有了事先写好的清单。

方法

语料叫 LITTLECURRICULUM,88B token,从 FineWeb-Edu 过滤而来,管线五级:

边界质量用 CommonCoreText 验证:Beyond-K-5 文档保留率压到约 0%,代价是真 K-5 文本也只保留 35-42%。这是精度优先的设计,65% 的真课堂文本被丢弃,换来的是边界足够干净、后续实验的因果解读足够硬。

模型 LITTLELEARNER 用 Qwen3-dense 架构,8 张 B200 训 100 小时,Muon 优化器加 MXFP8 计算。收尾混合 91% K-5 预训练数据、5% 改写自 MegaMath-Pro 的 K-5 数学推理、2% K-5 数学指令、2% 通用指令,后三类全部由 Gemini Flash 改写到 K-5 难度。tokenizer 也只用 K-5 语料单独训,防超纲内容从词表漏进去。

对照组两个:Unfiltered,同配方、同数据量但不筛;Gemma 2B,2T token 训的外部参照。

结果

边界是真的。CLEAR 语料上难度升,LittleLearner 的 bits-per-byte 跟着涨,Unfiltered 和 Gemma 2B 基本持平。Jeopardy 科学题按课标切分后,K-5 内两个模型相当,Beyond 端 LittleLearner 突降,Unfiltered 两端持平。

行为也符合设定。问「什么是引力」,它答「把一切往下拉的力」;问薛定谔的猫,答「一只有两张脸的猫」。语料里没有量子力学,模型就真的不会,这个边界是硬的。

三组知识注入实验,结果一致:

干预K-5 内Beyond-K-5
规模 0.6B 到 5B大涨年级 6-7 部分有效,年级 8 三个尺寸都在地板
SFT+GRPO两个模型都涨LittleLearner 只小幅动,Unfiltered 大涨
3-shot CoT小涨零提升,给解释也没用

两个细节要单独说。0.6B 的 LittleLearner 在 K-5 内反超 Unfiltered:容量没被高中代数和微积分占用,小模型反而更专注。SFT+GRPO 阶段用 K-5 数据和用超纲数据训 LittleLearner,结果没有差别,后训练搬运不动预训练没给的原料。

tokenizer 消融给边界一个量级注脚:2B 模型改用单数字位分词,Beyond-K-5 MathCAMPS pass@1 从 1.1% 到 1.8%,Unfiltered 从 4.6% 到 10.3%,差距原样保留。

为什么重要

「预训练分布决定能力上限,后训练是放大器不是发动机」,这个判断此前主要靠评测端证据间接支撑,现在有了一个可复用的受控实验场。对做 RL 和后训练的人,这是一盆有用的冷水:GRPO 推不动的瓶颈,很多时候不在训练强度,在预训练没给材料。语料和模型都发布,校准、知识注入、教育数据研究这类题目从此有了一个边界已知的试验田。

局限与存疑

作者自述:5B 规模上某些现象(比如 ICL)可能不如前沿规模明显;模型能力不按人类课程排序,多位数除法反而比单位数除法好;发展边界是控制暴露的工具,不是模型「像儿童一样发展」的主张。

读下来另有存疑处。MathCAMPS 评测被修剪过:金答案少于 30 的标准删、答案出现在题面里的题删(这类题分数能虚高 23 倍)、整个 6.EE.B.7 标准删,评测集是对正则评分器友好的裁剪版。Beyond-K-5 的绝对分数本就在 1% 量级的地板上,「推不动」部分反映的是任务难度,不过 Jeopardy 事实题的突降和 BPB 曲线支持边界真实存在。65% 的真 K-5 文本被过滤器丢弃,界内语料密度存疑,K-5 内的表现可能低估了同规模模型的应有水平。

术语

原文与代码

社区讨论

相关论文

全部论文解读