Yacine 转述:OpenAI 数学突破靠 Lean RL 环境,后训练是富人的推理
yacineMTB · x · 2026-10-09
OfirPress 推测 OpenAI 数学能力提升的做法:为大量数学题构建 Lean 形式化证明的 RL 训练环境。早期可能靠人工创建简单环境,后来模型足以自主生成环境,便可基于 arXiv 论文规模化生产海量题目。Yacine 转发并点评「后训练是富人的推理」,意指这套玩法本质是推理,但需要巨额资源投入。
「模型」频道最新
- 前端审美类任务仍需切 Claude 和 Kimi,博主盛赞 Kimi 审美好 — vista8 · 2026-10-10
- 「活体权重」随 TensorFold 发布:本地模型边用边更新自身权重 — EAccelerate_42 · 2026-10-10
- 用户充值当晚烧掉 25% 周额度,Claude Opus 5.5 视觉创意任务领先一代 — AlchainHust · 2026-10-10
- Google Astra 国际象棋 15:4 碾压 Opus,Elo 反而低 360 分 — pvncher · 2026-10-10
- GPT 6.1 Sol 争议:被批最差当期模型,实测者称性价比尚可 — dotey · 2026-10-10
- GLM-5.3-Flash 引来多人写专属推理引擎,「一模型一引擎」时代将至 — lxfater · 2026-10-10