ChatGPT联合作者称RLHF目标错误,TypeSafe发布Jev推校准决策

AI Engineer 大会上,ChatGPT/GPT-4/InstructGPT 联合作者 Diogo Almeida 提出系统性批评:RLHF 的目标是错的,出路在于校准决策。其公司 TypeSafe 已于 9 月 15 日发布实现这一理念的产品 Jev。博主 ccerrato147 以长线程形式转述了这套论证,值得关注的点是:它同时解释了为何当前 LLM 应用难以自主决策、以及一个前 OpenAI 核心人物正在给出的工程解法。

已确认

观点与论证

为什么重要

这是来自 RLHF 体系内部(InstructGPT 联合作者)的批评,直接指向当前主流对齐方法的根本缺陷,并已落到具体产品(Jev)上,为「如何让 AI 在企业场景中安全自主决策」提供了一条与 RLHF/RLVR 不同的工程路线。

2026-09-20 ~ 2026-09-20 · 9 条相关

一手来源