前 OpenAI 研究员 Kaiser 长文告别 RLSlow 推理团队
前 OpenAI 研究员 Lukasz Kaiser 发长文向 RLSlow(强化学习慢思考)团队告别。他回顾了团队历程:最早与 Ilya Sutskever 共同领导,团队名取自《思考,快与慢》,核心理念是语言模型已具备「快思考」能力,而用强化学习可以训练出「慢思考」式的推理。文章也复盘了 RL 推理如何从最初的信念一步步走向规模化落地。
2026-09-07 ~ 2026-09-07 · 2 条相关
- 前 OpenAI 研究员 Lukasz Kaiser 深情告别 RLSlow 推理团队 — RubenEVillegas · 2026-09-07
- OpenAI RLSlow 团队复盘:RL 推理如何从信念走到规模化 — lukaszkaiser · 2026-09-07