论文:从预训练到后训练的推理能力演进
Jingyan Shen · hf · 2026-07-20
当前大模型普遍采用强化学习(RL)来提升复杂推理能力,但 RL 后训练通常与预训练阶段割裂。为了探究“预训练选择如何影响 RL 收益”以及“RL 到底如何改变模型”,研究人员引入国际象棋作为受控测试床。
实验设计与发现:
- 流程:在人类棋局上预训练 5M 至 1B 参数的语言模型,进行 SFT,并在具有可验证奖励的棋类谜题上运行 RL。
- 预训练决定 RL 上限:特定 RL 算力下的性能表现可以通过预训练损失来预测,且 RL 奖励曲线的斜率随预训练 token 数量的增加呈近似线性提升。
- RL 的实质作用:RL 并非单纯锐化 SFT 策略。在简单谜题上,它会放大 SFT 已偏好的正确动作;但在困难谜题上,它能挖掘出 SFT 阶段几乎不存在的正确动作。
- 跨域迁移:在数学语料上训练的 1B 模型中也出现了相同的规律:预训练越久的检查点,在 RL 后达到的性能越高、提升越快。
所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→
「研究」频道最新
- Agent 工作流不是死循环,得用图来编排 — alex_verem · 2026-07-21
- 新博士论文梳理强化学习到基础模型的演进 — chaumian · 2026-07-21
- Ken Ono:AI 正在重塑数学发现的方式 — soumitrashukla9 · 2026-07-21
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21