新研究提出预训练与RL联合缩放律
一项名为《Understanding Reasoning from Pretraining to Post-Training》的新研究,通过引入受控的国际象棋测试床,将大模型的预训练、SFT和强化学习(RL)整合到了统一的可计算框架中。该工作为长期困扰学界的“算力在预训练与后训练阶段该如何分配”以及“RL究竟如何改变模型”等问题提供了量化依据,论文、代码和模型均已开源。
关键细节与核心规律
研究团队在覆盖20M到1B模型规模的36组组合实验中发现:在给定总算力下,最优算力分配会随预算变化。当算力较低时应优先投入预训练,但随着模型从50M增长到700M、总预算变大,最优策略会逐步向RL倾斜,最优RL计算占比可升至约30%。此外,预训练token数仍大体符合Chinchilla式缩放规律。作者还提出了一个联合缩放律:在高算力区域,RL表现可以由预训练loss很好地预测,且预训练token越多,这种预测关系会变得更强。
RL的作用机制与泛化验证
针对RL的作用机制,作者指出RL在简单任务上主要是将原本就不错的策略变得更“尖锐”(锐化分布),而在更难的任务上,它有时能发现原策略中概率极低的尾部解。这意味着RL不仅限于微调,还能挖掘出极少出现的推理模式。@burny_tech 也曾提出类似的行业疑问,即RLVR是强化已有能力还是激发新推理,该研究对此给出了部分解答。此外,作者将象棋测试床的结论扩展到了OLMo的自然语言数学推理任务上,验证了预训练loss对RL提升的强力预测作用依然成立。
2026-07-20 ~ 2026-07-21 · 17 条相关
- RLVR是强化已有能力还是激发新推理? — burny_tech · 2026-07-20
- 论文:从预训练到后训练的推理能力演进 — Jingyan Shen · 2026-07-20
- 预训练与RL联合缩放规律 — teortaxesTex · 2026-07-20
- 棋类研究拟合预训练与RL缩放律,寻找算力最优分配 — micahgoldblum · 2026-07-21
- 【源头】新论文发现从预训练到后训练的联合 scaling law — Pavel_Izmailov · 2026-07-21
- 研究者用棋类测试床拆解预训练、SFT 与 RL 算力分配 — Pavel_Izmailov · 2026-07-21
- 【源头】象棋测试床发现更多预训练能稳步提升 RL 表现 — Pavel_Izmailov · 2026-07-21
- 联合缩放律把 RL 表现连到模型规模和预训练 token — Pavel_Izmailov · 2026-07-21
- 算力越高,最优分配越从预训练转向 RL — Pavel_Izmailov · 2026-07-21
- RL 会锐化简单题,也能挖出难题尾部解 — Pavel_Izmailov · 2026-07-21
- 【源头】OLMo 结果显示预训练 loss 仍能预测 RL 提升 — Pavel_Izmailov · 2026-07-21
- 棋类测试床要回答学术界的学习与缩放难题 — Pavel_Izmailov · 2026-07-21
- 象棋缩放测试床的论文、代码和模型已公开 — Pavel_Izmailov · 2026-07-21
- 又一条转述统一预训练与 RL scaling law 的论文 — Pavel_Izmailov · 2026-07-21
- 模型从 50M 到 700M,最优 RL 占比升至 30% — Pavel_Izmailov · 2026-07-21
- 新论文追踪 LLM 从预训练到后训练的推理形成 — gerardsans · 2026-07-21
- 新论文笔记指出:预训练决定模型还能被 RL 推多远 — tokenbender · 2026-07-21