论文:从预训练到后训练的推理能力演进
Jingyan Shen · hf · 2026-07-20
当前大模型普遍采用强化学习(RL)来提升复杂推理能力,但 RL 后训练通常与预训练阶段割裂。为了探究“预训练选择如何影响 RL 收益”以及“RL 到底如何改变模型”,研究人员引入国际象棋作为受控测试床。
实验设计与发现:
- 流程:在人类棋局上预训练 5M 至 1B 参数的语言模型,进行 SFT,并在具有可验证奖励的棋类谜题上运行 RL。
- 预训练决定 RL 上限:特定 RL 算力下的性能表现可以通过预训练损失来预测,且 RL 奖励曲线的斜率随预训练 token 数量的增加呈近似线性提升。
- RL 的实质作用:RL 并非单纯锐化 SFT 策略。在简单谜题上,它会放大 SFT 已偏好的正确动作;但在困难谜题上,它能挖掘出 SFT 阶段几乎不存在的正确动作。
- 跨域迁移:在数学语料上训练的 1B 模型中也出现了相同的规律:预训练越久的检查点,在 RL 后达到的性能越高、提升越快。
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11