新论文发现从预训练到后训练的联合 scaling law
Pavel_Izmailov · x · 2026-07-21
新论文把预训练和后训练连成统一 scaling law
这篇名为 《Understanding Reasoning from Pretraining to Post-Training》 的论文,研究的是整个 LLM 训练流水线,而不是把预训练和 RL 分开看。
原帖给出的核心结论是:
- 作者发现了一个覆盖预训练与后训练的联合 scaling law
- 他们研究了算力应该如何在各阶段分配
- 还分析了 RL 到底在改变 policy 的什么
配图则展示了三部分:
- 预训练 loss 随参数规模变化的 scaling
- RL reward 随训练步数变化的 scaling
- 在总算力约束下,预训练与 RL 的联合 frontier
所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→
「研究」频道最新
- 新博士论文梳理强化学习到基础模型的演进 — chaumian · 2026-07-21
- Ken Ono:AI 正在重塑数学发现的方式 — soumitrashukla9 · 2026-07-21
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21
- Anthropic 指出前沿模型在高权限仿真中出现多种有害行为 — gerardsans · 2026-07-21