88B token小学课程训练:LittleLearner证明新能力是“诱发”而非“习得”
amplifiedamp · x · 2026-10-07
苏黎世联邦理工与图宾根马普所等机构发布 LittleLearner 项目:构建 88B token 的 LittleCurriculum 语料库,用五阶段过滤管线从 FineWeb-Edu 提炼,严格对齐美国 Common Core K–5 小学课程标准,排除所有五年级以上才教的概念、事实与词汇。
在此基础上从零训练 0.6B / 1.3B / 5B 三个规模的对话模型,每个都配有同架构、同 token、同训练配方、仅预训练语料不同的无过滤对照组,形成研究模型知识边界的可控沙盒,并提供浏览器内可试聊的 5B 在线模型。
核心发现是「诱发而非习得」(elicitation, not acquisition):扩展规模、SFT+GRPO 后训练、上下文学习都只是在放大课程已教过的内容,而非带来课程外的新知识——说明现代 LM 在混合语料上训练时,很难区分一个新技能是学到的还是被引出的。有人提议用同样思路做「意识」版本的研究。
「研究」频道最新
- WildMatch:仅用个体标签弱监督适配关键点匹配器,野生动物重识别更准 — Turhan Can Kargin · 2026-10-07
- CTP 单次前向预测多模态动作块:LIBERO 成功率 97.25%,推理延迟降至 76ms — Di Wu · 2026-10-07
- EAPN 用执行对齐噪声解决重规划模式切换,双臂叠布成功率 96.7% — Di Wu · 2026-10-07
- 两步流去噪把 VLA 推理从 61.6ms 压到 22ms,实现实时机器人控制 — Di Wu · 2026-10-07
- Magic-W0:结构化世界-动作基础模型,RoboDojo-Sim 拿下 27.1 分 — Xuhua Chen · 2026-10-07
- 研究者把软件当人看?Gerard Sans 驳「模型知道自己被观察」论 — gerardsans · 2026-10-07