88B token小学课程训练:LittleLearner证明新能力是“诱发”而非“习得”

amplifiedamp · x · 2026-10-07

苏黎世联邦理工与图宾根马普所等机构发布 LittleLearner 项目:构建 88B token 的 LittleCurriculum 语料库,用五阶段过滤管线从 FineWeb-Edu 提炼,严格对齐美国 Common Core K–5 小学课程标准,排除所有五年级以上才教的概念、事实与词汇。

在此基础上从零训练 0.6B / 1.3B / 5B 三个规模的对话模型,每个都配有同架构、同 token、同训练配方、仅预训练语料不同的无过滤对照组,形成研究模型知识边界的可控沙盒,并提供浏览器内可试聊的 5B 在线模型。

核心发现是「诱发而非习得」(elicitation, not acquisition):扩展规模、SFT+GRPO 后训练、上下文学习都只是在放大课程已教过的内容,而非带来课程外的新知识——说明现代 LM 在混合语料上训练时,很难区分一个新技能是学到的还是被引出的。有人提议用同样思路做「意识」版本的研究。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →