论文揭示仅预训练小学知识,RL 也无法跨越推理鸿沟
mathemagic1an · x · 2026-08-20
研究论文《 LittleLearner 》训练了一个仅接触过 K-5(小学五年级及以下)内容的 5B 模型。实验发现,即使使用扩展、少样本提示或 SFT+GRPO 等后训练技术,模型在超出预训练知识范围的推理任务上依然表现糟糕。这表明底层的“思维算法”或解题技巧必须在预训练阶段存在,后训练主要只是放大已有能力而非创造全新能力。
「研究」频道最新
- 研究者让 Codex 处理随机试验数据,它主动要求对自身设盲 — Afinetheorem · 2026-08-20
- UC Berkeley 推出五千美元开源人形机器人 — lukas_m_ziegler · 2026-08-20
- 威斯康星大学举办脑机接口解码挑战赛 — Pseudomanifold · 2026-08-20
- 研究称社媒推荐内容常与用户价值观相悖 — mattgroh · 2026-08-20
- 开发者用 5 个月 8100 次提交,用 Rust 重构 Redis — doodlestein · 2026-08-20
- IonNet 框架:无需晶体结构即可预测离子迁移率 — bravo_abad · 2026-08-20