论文发现 RL 收益可由预训练损失预测,最优算力占比约 20% 至 28%
rohanpaul_ai · x · 2026-07-26
RL 到底能带来多少收益,可从起点 checkpoint 预判
这篇论文把完整 LLM 训练流程搬到了国际象棋任务上:先用 Lichess 对局预训练 500 万到 10 亿参数模型,再用合成推理轨迹做 SFT,最后在可验证奖励的棋牌游戏题目上做 GRPO。作者系统扫了 36 组预训练×RL 组合,发现后训练收益主要由两类预训练信号决定:
- 预训练验证损失 可以非常强地预测 RL 后的 pass@1,随着参考 RL 计算量增加,相关性拟合从 ρ≈0.93 提升到 0.99。
- 每增加 10 倍 RL 计算量的收益,会随着预训练 token 数增加而上升,Pearson 相关系数达到 +0.84。
基于拟合前沿,作者估算 RL 的最优算力占比大约是:
- 50M 参数时约 20%
- 680M 参数时约 28%
也就是说,RL 会随着预算增加而占比提高,但仍然只是训练预算中的少数部分。
论文最值得注意的机制结论是:RL 不是对 SFT 策略做均匀“锐化”。在简单题上,它主要放大 SFT 已经偏好的正确动作;在困难题上,它会把原本几乎看不见的正确动作显著抬出来。这解释了为什么它能提升 pass@1,却未必提升 pass@16。作者进一步在一个 10 亿参数的数学模型上验证了类似规律,并认为未来更重要的方向不是“更强地 sharpen policy”,而是抑制错误模式的放大。
「研究」频道最新
- Orca 开源灵巧手研究栈,打通遥操作与训练 — tensorqt · 2026-07-26
- 本周 AI 论文盘点:世界模型、具身智能体与自改进 agent — _akhaliq · 2026-07-26
- PFNs 从头训练做表格数据,后训练 LLM 很快撞墙 — roydanroy · 2026-07-26
- 2007 年集合通信综述,至今仍适合入门 NCCL — abhi9u · 2026-07-26
- 阿里和港中文用一张图预测机器人场景的 4D 未来 — jiqizhixin · 2026-07-26
- TeaNet 论文对比 RDF 曲线,逼近实验结果 — CatAstro_Piyush · 2026-07-26