象棋测试床发现更多预训练能稳步提升 RL 表现
Pavel_Izmailov · x · 2026-07-21
象棋测试床显示:预训练 token 越多,RL 缩放越稳
作者在一个基于象棋的受控测试床上做了 36 组组合实验,覆盖 20M 到 1B 的模型规模,并同时变化预训练 token 数和 RL 计算量,用来研究预训练到后训练的缩放关系。
要点包括:
- 更多预训练会持续提升 pass@1 随计算量增长的斜率,也提升最终 RL 表现。
- pass@16 同样受益于更多预训练,但在 RL 阶段整体 基本趋于平坦。
- 他们还在 OLMo 的自然语言数学推理任务上验证了类似结论。
- PT loss 仍然能 高度预测 RL 表现,而且预训练 token 越多,这种相关性越强。
- RL 大体是在 增强容易任务上的策略;在更难任务上,偶尔会找到原策略里概率极低的 尾部解。
作者把这个象棋设置看作一种适合学术研究的缩放测试床,用来更系统地研究数据、训练方法和 scaling laws。
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- Michael Levin 发布 Platonic Space 论文同行评审版及实验室资源 — drmichaellevin · 2026-09-11
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11
- GLIE 论文: late-interaction 检索向量可压缩 200 倍存储 — inductionheads · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11