研究者用棋类测试床拆解预训练、SFT 与 RL 算力分配
Pavel_Izmailov · x · 2026-07-21
这项工作提出了一个基于棋类的测试床,用来研究 预训练、SFT 和 RL 之间的算力该如何分配。
- 它模拟了典型 LLM 流程:先用人类棋局做预训练,再用合成推理轨迹做 SFT,最后在棋类谜题上做 RL。
- 研究目标是在可控算力预算下,分析从 pretraining 到 post-training 的缩放规律。
- 这个设定使作者能够检验:PT loss 是否能预测后续 RL 表现,以及随着规模增长,算力分配应该如何变化。
所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→
「研究」频道最新
- 新博士论文梳理强化学习到基础模型的演进 — chaumian · 2026-07-21
- Ken Ono:AI 正在重塑数学发现的方式 — soumitrashukla9 · 2026-07-21
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21
- Anthropic 指出前沿模型在高权限仿真中出现多种有害行为 — gerardsans · 2026-07-21