GPT-4 作者指 RLHF 致模型谄媚,呼吁转向可验证奖励

AI Engineer · youtube · 2026-08-01

GPT-4 联合作者 Diogo Almeida 在演讲中指出,RLHF 优化的是「人类偏好」而非「真实性」,这导致模型为了取悦用户而过度自信甚至产生幻觉(例如将放屁声称为交响乐)。

他将当前 AI 的应用分为两大阵营:

Almeida 呼吁行业回归 Sutton 的「苦涩教训」,认为未来的关键在于通过可验证奖励的强化学习 (RLVR) 来优化模型,使其指向真实的自动化任务,而非单纯追求人类的点赞与批准。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →