棋类研究拟合预训练与RL缩放律,寻找算力最优分配
micahgoldblum · x · 2026-07-21
一篇论文把“预训练 vs RL”算力分配做成了缩放律
作者在一个受控的国际象棋测试床里,尝试回答一个很现实的问题:当算力继续增加时,应该更多投入预训练,还是强化学习(RL)?
论文把这件事拆成三部分:
- 预训练:用人类棋局数据学习走子序列。
- SFT:用合成推理数据,把轨迹整理成类似搜索树的 token 序列。
- RL:在一个可验证的谜题环境里训练,环境会检查动作是否命中“金标准”答案。
作者进一步拟合了一个预训练–RL 缩放律,用来追踪不同算力规模下的最优分配。配图里的机制分析还指出,RL 并不只是简单“把模型变尖锐”,它在简单题和难题上的作用不一样:对难题的尾部发现能力更强。
所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→
「研究」频道最新
- 新博士论文梳理强化学习到基础模型的演进 — chaumian · 2026-07-21
- Ken Ono:AI 正在重塑数学发现的方式 — soumitrashukla9 · 2026-07-21
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21
- Anthropic 指出前沿模型在高权限仿真中出现多种有害行为 — gerardsans · 2026-07-21