前 OpenAI 研究员 Kaiser 长文告别 RLSlow 推理团队

前 OpenAI 研究员 Lukasz Kaiser 发长文向 RLSlow(强化学习慢思考)团队告别。他回顾了团队历程:最早与 Ilya Sutskever 共同领导,团队名取自《思考,快与慢》,核心理念是语言模型已具备「快思考」能力,而用强化学习可以训练出「慢思考」式的推理。文章也复盘了 RL 推理如何从最初的信念一步步走向规模化落地。

2026-09-07 ~ 2026-09-07 · 2 条相关