模型从 50M 到 700M,最优 RL 占比升至 30%
Pavel_Izmailov · x · 2026-07-21
## 一篇预训练到 RL 的论文给出可计算的配比规律 这项新研究以国际象棋为可控实验场,讨论了 **预训练、SFT 和 RL** 之间的关系,并发现一个明确趋势:**模型从 50M 增长到 700M 时,最优 RL 计算占比从约 20% 上升到 30%**。 - 在 **容易的谜题** 上,RL 主要是在强化 SFT 已经倾向的高概率正确动作。 - 在 **困难谜题** 上,RL 会把分布尾部的动作也“翻”出来,其中既有新发现的正确解,也会带出错误动作。 - 作者搭建了一个覆盖预训练、监督微调和 RL 的棋类测试框架,提出预训练与 RL 之间的 **缩放规律**:预训练损失和 RL 奖励曲线的斜率都能预测后训练表现。 - 他们还在 **1B 数学模型** 上复现了类似现象:预训练越久,后续 RL 提升越快、最终表现越高。 核心结论是:RL 不只是把 SFT 策略“磨尖”,它还能把那些在 SFT 阶段几乎看不见、但对最终推理有用的动作挖出来。
所属事件:新研究提出预训练与RL联合缩放律(16 条相关)→
「研究」频道最新
- 新论文将 LLM 推理 GPU collective 延迟压到光速下限 7% 以内 — algo_diver · 2026-07-21
- Social Arena 推出用 Risk、Catan、Poker 测 AI 行为的新基准 — AaronBergman18 · 2026-07-21
- 腾讯推出 Hyra-1.0,面向研究与工程任务的智能体 — bdsqlsz · 2026-07-21
- CaRE 用双层路由 MoE 把持续学习推到 300+ 任务 — jiqizhixin · 2026-07-21
- SIGGRAPH 论文展示点云场景的快速 signed distance 计算 — keenanisalive · 2026-07-21
- Andrew Ng 发布 1 小时课程,讲 agentic knowledge graphs 与 Google ADK — blaizedsouza · 2026-07-21