算力越高,最优分配越从预训练转向 RL
Pavel_Izmailov · x · 2026-07-21
论文指出,在给定总算力下,预训练和 RL 的最优分配会随着预算变化而改变。
- 当总算力较低时,应该优先把更多 FLOPs 花在预训练上。
- 随着总预算变大,最优策略会逐步向更多 RL 倾斜。
- 作者还搜索了模型规模、PT tokens 与 RL 算力的最优组合。
所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→
「研究」频道最新
- Agent 工作流不是死循环,得用图来编排 — alex_verem · 2026-07-21
- 新博士论文梳理强化学习到基础模型的演进 — chaumian · 2026-07-21
- Ken Ono:AI 正在重塑数学发现的方式 — soumitrashukla9 · 2026-07-21
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21