棋类研究拟合预训练与RL缩放律,寻找算力最优分配

micahgoldblum · x · 2026-07-21

一篇论文把“预训练 vs RL”算力分配做成了缩放律

作者在一个受控的国际象棋测试床里,尝试回答一个很现实的问题:当算力继续增加时,应该更多投入预训练,还是强化学习(RL)?

论文把这件事拆成三部分:

作者进一步拟合了一个预训练–RL 缩放律,用来追踪不同算力规模下的最优分配。配图里的机制分析还指出,RL 并不只是简单“把模型变尖锐”,它在简单题和难题上的作用不一样:对难题的尾部发现能力更强。

所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →