OLMo 结果显示预训练 loss 仍能预测 RL 提升

Pavel_Izmailov · x · 2026-07-21

作者把前面的象棋结论扩展到了 OLMo 的自然语言数学推理任务。

核心发现:

整体看,这说明预训练的质量与规模,不仅决定基础能力,也会影响模型后续能被 RL 提升到什么程度。

所属事件:新研究提出预训练与RL联合缩放律(17 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →