论文:从预训练到后训练的推理能力演进

Jingyan Shen · hf · 2026-07-20

当前大模型普遍采用强化学习(RL)来提升复杂推理能力,但 RL 后训练通常与预训练阶段割裂。为了探究“预训练选择如何影响 RL 收益”以及“RL 到底如何改变模型”,研究人员引入国际象棋作为受控测试床。

实验设计与发现:

所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →