象棋测试床发现更多预训练能稳步提升 RL 表现

Pavel_Izmailov · x · 2026-07-21

象棋测试床显示:预训练 token 越多,RL 缩放越稳

作者在一个基于象棋的受控测试床上做了 36 组组合实验,覆盖 20M 到 1B 的模型规模,并同时变化预训练 token 数和 RL 计算量,用来研究预训练到后训练的缩放关系。

要点包括:

作者把这个象棋设置看作一种适合学术研究的缩放测试床,用来更系统地研究数据、训练方法和 scaling laws。

所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →