论文揭示仅预训练小学知识,RL 也无法跨越推理鸿沟

mathemagic1an · x · 2026-08-20

研究论文《 LittleLearner 》训练了一个仅接触过 K-5(小学五年级及以下)内容的 5B 模型。实验发现,即使使用扩展、少样本提示或 SFT+GRPO 等后训练技术,模型在超出预训练知识范围的推理任务上依然表现糟糕。这表明底层的“思维算法”或解题技巧必须在预训练阶段存在,后训练主要只是放大已有能力而非创造全新能力。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →