OpenAI 揭秘 Astra 训练法:主观领域如何做不可验证域的训练

morqon · x · 2026-09-05

引用的是 OpenAI 团队成员 kevinwng 的表态:在 Astra 中,他们在设计美学、知识工作这类主观领域取得了显著进展,核心是开发了在不可验证域(non-verifiable domains)上进行训练的新方法——这类任务没有客观对错答案,传统 RL 难以直接套用。他表示这条研究路线令人兴奋,后续还有更多成果,并邀请大家去试用 Astra。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →