模型从 50M 到 700M,最优 RL 占比升至 30%

Pavel_Izmailov · x · 2026-07-21

一篇预训练到 RL 的论文给出可计算的配比规律

这项新研究以国际象棋为可控实验场,讨论了 预训练、SFT 和 RL 之间的关系,并发现一个明确趋势:模型从 50M 增长到 700M 时,最优 RL 计算占比从约 20% 上升到 30%。

核心结论是:RL 不只是把 SFT 策略“磨尖”,它还能把那些在 SFT 阶段几乎看不见、但对最终推理有用的动作挖出来。

所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →