OpenAI RLSlow 团队复盘:RL 推理如何从信念走到规模化

lukaszkaiser · x · 2026-09-07

前 OpenAI 研究员 Lukasz Kaiser 致谢并回顾 RLSlow 团队的历史:名字取自《思考,快与慢》,核心理念是语言模型已具备「快思考」(即时给出答案),而用 RL 教会它「慢思考」——投入更多算力的、多 token 的审慎推理。TrapitBansal 补充回忆:团队很早就建立起方向信心,经历了大量夜以继日盯训练、分析结果、设计对照实验的过程,早期讨论多与 Ilya Sutskevik 进行,后来是 Jakub Pachocki。当时的经验证据已让他们确信「RL for reasoning 会 scale」,模型能学会把更多算力花在解题上。Kaiser 列出了从奠基阶段(后来的 berry 项目)到后期的完整团队成员名单,包括 Suchir Balaji 等,并向所有队友致谢。

所属事件:前 OpenAI 研究员 Kaiser 长文告别 RLSlow 推理团队(2 条相关)→

原文链接 →

「公司和人」频道最新

更多「公司和人」频道 AI 资讯 →