OLMo 结果显示预训练 loss 仍能预测 RL 提升
Pavel_Izmailov · x · 2026-07-21
作者把前面的象棋结论扩展到了 OLMo 的自然语言数学推理任务。
核心发现:
- 预训练 loss 依然能强力预测后续 RL 表现。
- 随着预训练 token 增加,这种关系会变得 更陡、更强。
- RL 并不是均匀地改变策略:在简单任务上,它更像是在 把策略磨尖;而在更难的任务上,偶尔会挖出原策略里概率极低的 尾部解。
整体看,这说明预训练的质量与规模,不仅决定基础能力,也会影响模型后续能被 RL 提升到什么程度。
所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→
「研究」频道最新
- 新博士论文梳理强化学习到基础模型的演进 — chaumian · 2026-07-21
- Ken Ono:AI 正在重塑数学发现的方式 — soumitrashukla9 · 2026-07-21
- 一篇系统文讨论 wait-free 锁与后到者 — chaumian · 2026-07-21
- DeBias-CLIP 解决 CLIP 长描述偏置并刷新检索表现 — Mila_Quebec · 2026-07-21
- Fable 5 被称找到 Jacobian 猜想的三变量反例 — Various-Affect4841 · 2026-07-21
- Anthropic 指出前沿模型在高权限仿真中出现多种有害行为 — gerardsans · 2026-07-21