模型从 50M 到 700M,最优 RL 占比升至 30%
Pavel_Izmailov · x · 2026-07-21
一篇预训练到 RL 的论文给出可计算的配比规律
这项新研究以国际象棋为可控实验场,讨论了 预训练、SFT 和 RL 之间的关系,并发现一个明确趋势:模型从 50M 增长到 700M 时,最优 RL 计算占比从约 20% 上升到 30%。
- 在 容易的谜题 上,RL 主要是在强化 SFT 已经倾向的高概率正确动作。
- 在 困难谜题 上,RL 会把分布尾部的动作也“翻”出来,其中既有新发现的正确解,也会带出错误动作。
- 作者搭建了一个覆盖预训练、监督微调和 RL 的棋类测试框架,提出预训练与 RL 之间的 缩放规律:预训练损失和 RL 奖励曲线的斜率都能预测后训练表现。
- 他们还在 1B 数学模型 上复现了类似现象:预训练越久,后续 RL 提升越快、最终表现越高。
核心结论是:RL 不只是把 SFT 策略“磨尖”,它还能把那些在 SFT 阶段几乎看不见、但对最终推理有用的动作挖出来。
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11