新研究提出预训练与RL联合缩放律

一项名为《Understanding Reasoning from Pretraining to Post-Training》的新研究,通过引入受控的国际象棋测试床,将大模型的预训练、SFT和强化学习(RL)整合到了统一的可计算框架中。该工作为长期困扰学界的“算力在预训练与后训练阶段该如何分配”以及“RL究竟如何改变模型”等问题提供了量化依据,论文、代码和模型均已开源。

关键细节与核心规律

研究团队在覆盖20M到1B模型规模的36组组合实验中发现:在给定总算力下,最优算力分配会随预算变化。当算力较低时应优先投入预训练,但随着模型从50M增长到700M、总预算变大,最优策略会逐步向RL倾斜,最优RL计算占比可升至约30%。此外,预训练token数仍大体符合Chinchilla式缩放规律。作者还提出了一个联合缩放律:在高算力区域,RL表现可以由预训练loss很好地预测,且预训练token越多,这种预测关系会变得更强。

RL的作用机制与泛化验证

针对RL的作用机制,作者指出RL在简单任务上主要是将原本就不错的策略变得更“尖锐”(锐化分布),而在更难的任务上,它有时能发现原策略中概率极低的尾部解。这意味着RL不仅限于微调,还能挖掘出极少出现的推理模式。@burny_tech 也曾提出类似的行业疑问,即RLVR是强化已有能力还是激发新推理,该研究对此给出了部分解答。此外,作者将象棋测试床的结论扩展到了OLMo的自然语言数学推理任务上,验证了预训练loss对RL提升的强力预测作用依然成立。

2026-07-20 ~ 2026-07-21 · 17 条相关