Yacine 转述:OpenAI 数学突破靠 Lean RL 环境,后训练是富人的推理

yacineMTB · x · 2026-10-09

OfirPress 推测 OpenAI 数学能力提升的做法:为大量数学题构建 Lean 形式化证明的 RL 训练环境。早期可能靠人工创建简单环境,后来模型足以自主生成环境,便可基于 arXiv 论文规模化生产海量题目。Yacine 转发并点评「后训练是富人的推理」,意指这套玩法本质是推理,但需要巨额资源投入。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →