新论文发现从预训练到后训练的联合 scaling law
Pavel_Izmailov · x · 2026-07-21
新论文把预训练和后训练连成统一 scaling law
这篇名为 《Understanding Reasoning from Pretraining to Post-Training》 的论文,研究的是整个 LLM 训练流水线,而不是把预训练和 RL 分开看。
原帖给出的核心结论是:
- 作者发现了一个覆盖预训练与后训练的联合 scaling law
- 他们研究了算力应该如何在各阶段分配
- 还分析了 RL 到底在改变 policy 的什么
配图则展示了三部分:
- 预训练 loss 随参数规模变化的 scaling
- RL reward 随训练步数变化的 scaling
- 在总算力约束下,预训练与 RL 的联合 frontier
所属事件:新研究提出预训练与RL联合缩放律(18 条相关)→
「研究」频道最新
- GameWorld 获 ECCV 2026 多模态数字代理研讨会最佳论文亚军 — MikeShou1 · 2026-09-11
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11