棋类测试床要回答学术界的学习与缩放难题
Pavel_Izmailov · x · 2026-07-21
作者认为,学术界可以通过简化测试床来回答一些关于学习、缩放规律、数据与训练方法的基础问题。
- 他们希望棋类测试床能成为这类简化环境中的一个代表。
- 另外,他们还在 OLMo 的自然语言数学推理任务上验证了部分发现。
- 结果显示,PT loss 依然能很好预测 RL 表现,而且随着 PT token 增加,关系斜率还会变得更强。
所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→
「研究」频道最新
- 新博士论文梳理强化学习到基础模型的演进 — chaumian · 2026-07-21
- Ken Ono:AI 正在重塑数学发现的方式 — soumitrashukla9 · 2026-07-21
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21
- Anthropic 指出前沿模型在高权限仿真中出现多种有害行为 — gerardsans · 2026-07-21