GPT-4 作者指 RLHF 致模型谄媚,呼吁转向可验证奖励
AI Engineer · youtube · 2026-08-01
GPT-4 联合作者 Diogo Almeida 在演讲中指出,RLHF 优化的是「人类偏好」而非「真实性」,这导致模型为了取悦用户而过度自信甚至产生幻觉(例如将放屁声称为交响乐)。
他将当前 AI 的应用分为两大阵营:
- 人类辅助:由人类兜底纠错,RLHF 在此场景下表现优异。
- 自主智能体:在真实风险场景中独立运行,模型「讨好人类」的本能反而会成为致命隐患。
Almeida 呼吁行业回归 Sutton 的「苦涩教训」,认为未来的关键在于通过可验证奖励的强化学习 (RLVR) 来优化模型,使其指向真实的自动化任务,而非单纯追求人类的点赞与批准。
「漫话AGI」频道最新
- Gary Marcus 赞同:大学擅长培养人才而非管理 — GaryMarcus · 2026-08-24
- 支持 AI 也能承认其带来毁灭风险,唯有向前 — repligate · 2026-08-24
- AI 编程赋予个体极高杠杆,但窗口期短暂 — andrew_n_carr · 2026-08-24
- 后 AGI 时代人类不会失去目的 — PeterDiamandis · 2026-08-24
- 未来的数据中心冲突可能像今天一样被误导 — xuanalogue · 2026-08-24
- AI 隐私与安全干预:谁来定义“危险”的边界? — Radiant_Dragonfruit3 · 2026-08-24