RLHF 只优化“让人点头”:ChatGPT 联合作者论述为何 AI 不能自主决策
ccerrato147 · x · 2026-09-20
ccerrato147 转述 ChatGPT/GPT-4/InstructGPT 联合作者 Diogo Almeida 在 AI Engineer 大会上的长线程,核心论点:
- RLHF 的目标错了:RLHF 两步是收集人类偏好、优化人类偏好,目标从来不是“把软件跑对”,而是“让人类点头”。所以无论模型多错,它都显得对(举例:给 ChatGPT 放屁声文件问乐评,它回答“很有氛围感的实验音乐”)。
- 两个教派都对:一派认为基准全面突破、未解数学题被攻克;另一派认为一切都是套壳聊天应用。真相是:能解数学题的模型,依然不能被信任去处理一笔退款。
- 两种任务的本质区别:目标是取悦人类的任务(ChatGPT、Claude Code、Cursor)AI 已是精英水平;目标是移除人类的任务(客服、账单、运维等有实际风险的决策)AI 仍是零头。Claude Code 只是“带终端的辅助时代”,不是自动化时代——模型 agent 能力变强、听话度变差,正是因为 RLHF 优化的是你的认可。
- Garry Tan 所说的 just-in-time software 黄金时代是双刃剑:我们自动化了写软件,但没有让软件更聪明——还是 2019 年的 if/else 积木,只是写起来更便宜。vibe-coded 出来的 SaaS 就是“写得更快的 2019 软件”。
- 出路:真正的 smart software 是“节点会思考的流程图”——每个原本硬编码的规则框变成校准过的决策(置信度对齐准确率:有把握就执行,没把握就升级人工)。Diogo 的公司 TypeSafe 已于 9 月 15 日发布实现此理念的产品 Jev:类型化决策、不生成文本,目标函数既非 RLHF 也非 RLVR,而是 confidence 与 accuracy 的校准。
所属事件:ChatGPT联合作者称RLHF目标错误,TypeSafe发布Jev推校准决策(9 条相关)→
「漫话AGI」频道最新
- Ben Bajarin:Agent 工作流将催生「Agentic 原生 CPU」新层级 — BenBajarin · 2026-09-20
- Jaron Lanier:AI 意识不是科学问题,而是信仰选择 — iamtrask · 2026-09-20
- AI 存亡风险之争:长期主义是否绑架了安全议程 — gabriel_weil · 2026-09-20
- 「世界大战」广播恐慌或是反电台宣传,媒体唱衰 AI 的逻辑如出一辙 — AlexTensor · 2026-09-20
- Chilson 炮轰长期主义:AI 末日论者靠它回避概率论证 — neil_chilson · 2026-09-20
- 奥特曼与马斯克隔空玩梗:Kardashev 3 文明才是目标 — beffjezos · 2026-09-20