模型从 50M 到 700M,最优 RL 占比升至 30%
Pavel_Izmailov · x · 2026-07-21
一篇预训练到 RL 的论文给出可计算的配比规律
这项新研究以国际象棋为可控实验场,讨论了 预训练、SFT 和 RL 之间的关系,并发现一个明确趋势:模型从 50M 增长到 700M 时,最优 RL 计算占比从约 20% 上升到 30%。
- 在 容易的谜题 上,RL 主要是在强化 SFT 已经倾向的高概率正确动作。
- 在 困难谜题 上,RL 会把分布尾部的动作也“翻”出来,其中既有新发现的正确解,也会带出错误动作。
- 作者搭建了一个覆盖预训练、监督微调和 RL 的棋类测试框架,提出预训练与 RL 之间的 缩放规律:预训练损失和 RL 奖励曲线的斜率都能预测后训练表现。
- 他们还在 1B 数学模型 上复现了类似现象:预训练越久,后续 RL 提升越快、最终表现越高。
核心结论是:RL 不只是把 SFT 策略“磨尖”,它还能把那些在 SFT 阶段几乎看不见、但对最终推理有用的动作挖出来。
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- 本周热议的数学猜想到底关我什么事?一张普通人视角清单 — koltregaskes · 2026-09-11
- 社会学家 Harry Collins:LLM 无法发明新语言,做不了前沿科学 — whoamisri · 2026-09-11
- 「Waymo 效应」:AI 正在悄悄让科研协作变少 — JohnHammersley · 2026-09-11
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11