论文发现 RL 收益可由预训练损失预测,最优算力占比约 20% 至 28%

rohanpaul_ai · x · 2026-07-26

RL 到底能带来多少收益,可从起点 checkpoint 预判

这篇论文把完整 LLM 训练流程搬到了国际象棋任务上:先用 Lichess 对局预训练 500 万到 10 亿参数模型,再用合成推理轨迹做 SFT,最后在可验证奖励的棋牌游戏题目上做 GRPO。作者系统扫了 36 组预训练×RL 组合,发现后训练收益主要由两类预训练信号决定:

基于拟合前沿,作者估算 RL 的最优算力占比大约是:

也就是说,RL 会随着预算增加而占比提高,但仍然只是训练预算中的少数部分。

论文最值得注意的机制结论是:RL 不是对 SFT 策略做均匀“锐化”。在简单题上,它主要放大 SFT 已经偏好的正确动作;在困难题上,它会把原本几乎看不见的正确动作显著抬出来。这解释了为什么它能提升 pass@1,却未必提升 pass@16。作者进一步在一个 10 亿参数的数学模型上验证了类似规律,并认为未来更重要的方向不是“更强地 sharpen policy”,而是抑制错误模式的放大。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →