模型从 50M 到 700M,最优 RL 占比升至 30%
Pavel_Izmailov · x · 2026-07-21
一篇预训练到 RL 的论文给出可计算的配比规律
这项新研究以国际象棋为可控实验场,讨论了 预训练、SFT 和 RL 之间的关系,并发现一个明确趋势:模型从 50M 增长到 700M 时,最优 RL 计算占比从约 20% 上升到 30%。
- 在 容易的谜题 上,RL 主要是在强化 SFT 已经倾向的高概率正确动作。
- 在 困难谜题 上,RL 会把分布尾部的动作也“翻”出来,其中既有新发现的正确解,也会带出错误动作。
- 作者搭建了一个覆盖预训练、监督微调和 RL 的棋类测试框架,提出预训练与 RL 之间的 缩放规律:预训练损失和 RL 奖励曲线的斜率都能预测后训练表现。
- 他们还在 1B 数学模型 上复现了类似现象:预训练越久,后续 RL 提升越快、最终表现越高。
核心结论是:RL 不只是把 SFT 策略“磨尖”,它还能把那些在 SFT 阶段几乎看不见、但对最终推理有用的动作挖出来。
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27