象棋测试床揭示:预训练 token 越多,RL 的边际收益斜率越陡

Understanding Reasoning from Pretraining to Post-Training

Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov

cs.LG, cs.AI, cs.CL

2026-07-18

用 5M 到 1B 参数的模型在人类棋局上预训练、再做 SFT 和 GRPO 强化学习,发现给定 RL 算力下的后训练表现可由预训练损失预测,RL 收益斜率随预训练 token 近似线性提升。

这篇在解决什么

强化学习已经成为提升大模型复杂推理的关键手段,但 RL 后训练基本是脱离前面的预训练单独研究的。两个基本问题一直没答案:预训练的选择(模型大小、数据)怎么影响 RL 的算力回报,RL 到底对模型做了什么。在标准 LLM 上没法干净地研究:预训练语料又大又不可控,行为很难归因到预训练还是 RL,而且要在两个阶段同时做系统的算力扫描,成本高到做不起。

这篇用象棋当受控测试床。象棋动作空间小(81 token 词表)、可以用引擎精确验证、数据可精细控制质量,而且专精模型在可负担算力下能达到非平凡水平,适合做系统扫描。

方法

完整复刻标准 LLM 训练管线。预训练:5M 到 1B 参数的模型(Qwen3 dense 架构),在 540 亿 token 的 Lichess 人类快棋和超快棋棋局上训练(2022 年,≥10 步,Elo 800-3000)。SFT:在合成推理轨迹上微调,轨迹是把 K 个续候选并成树、按公共前缀深度优先串行,教模型从树里挑最优续。RL:用 GRPO 在 15.6 万道象棋题上训,二元奖励——只有每一步都和标准答案一致才得 1。测试集 1480 道战术题,分 B1-B4 四个 Elo 档。

结果与发现

给出一条联合 scaling law:给定 RL 算力下的后训练 pass@1,可以被预训练验证损失强预测(Spearman 相关系数绝对值 0.93-0.99);衡量每个 RL 算力量级收益的局部斜率,和预训练 token 数近似线性相关(Pearson r=0.84)。一句话,预训练越充分,RL 越划算。

RL 对模型做了什么,不是简单地把 SFT 策略锐化(那相当于统一调温度)。简单题(B1-B2)上,RL 放大 SFT 已经偏好的正确走法;难题(B3-B5)上,RL 把原本在低概率尾巴(ε=0.05)里的正确走法提升进 top-k,但同时也会放大错误走法。思维链上,模型扩的是搜索宽度不是深度:宽深比和分支因子上升,最大搜索深度基本不动。模型在 5 步以内的续上变强,更长续仍吃力,说明 RL 提升候选生成和选择的速度快于长程搜索。

这套模式也迁移到数学:1B 的 OLMo-2 在 2000 亿 token 上预训练(70% 数学语料),14 个检查点从 100 亿到 2000 亿 token,SFT 后在 GSM8K、MATH 上做 RL,同样的规律重现:预训练损失越低,后训练表现越高,斜率随 log token 线性增长。

算力最优前沿上,最优 RL 占比随总算力上升:50M 模型约 20%,680M 升到 28%(讨论里提到 30%);预训练 token 分配仍大致符合 Chinchilla。低算力区「RL 强烈受初始化限制」。

为什么重要

对做预训练和后训练的人来说,这篇给了一个可量化的接口:预训练损失是 RL 回报的强预测器,而且最优 RL 算力占比随规模上升、不是固定比例。这挑战了「RL 和预训练各管一段」的常见割裂视角,提示在分配总算力时要把两阶段联合优化。RL「扩宽不加深」的发现也解释了为什么模型在长程推理上仍弱。

诚实地说,它的结论边界很窄:模型最大才 1B,象棋和自然语言差别巨大(小词表、精确验证、不掺世界知识),而且 RL 用的是唯一解二元奖励,和语言任务的部分得分、开放奖励不同。把它直接外推到前沿大模型要谨慎。

局限与存疑

作者自述:象棋不是自然语言,推理不和世界知识、流畅度纠缠;题目有唯一指定解和二元奖励,比语言任务的部分得分奖励受限;模型最大 1B,scaling 规律在更大规模可能不同;树状 CoT 格式特定,换格式 CoT 演化可能不同;RL 斜率关联只是所测算力范围内的局部经验趋势,基准未饱和,不是全局关系。这些边界作者说得很清楚,也是这篇诚实的地方。

术语

原文与代码

社区讨论

相关论文

全部论文解读