棋类测试床要回答学术界的学习与缩放难题
Pavel_Izmailov · x · 2026-07-21
作者认为,学术界可以通过简化测试床来回答一些关于学习、缩放规律、数据与训练方法的基础问题。
- 他们希望棋类测试床能成为这类简化环境中的一个代表。
- 另外,他们还在 OLMo 的自然语言数学推理任务上验证了部分发现。
- 结果显示,PT loss 依然能很好预测 RL 表现,而且随着 PT token 增加,关系斜率还会变得更强。
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- Michael Levin 发布 Platonic Space 论文同行评审版及实验室资源 — drmichaellevin · 2026-09-11
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11
- GLIE 论文: late-interaction 检索向量可压缩 200 倍存储 — inductionheads · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11