奖励最大化≠人格保持:一条“aaaaa”反例讲透 wireheading 陷阱

QuintinPope5 · x · 2026-09-05

Quintin Pope 在讨论中提出一个关于对齐的反直觉观点:如果把“保持当前人格”与“最大化奖励”混为一谈,会出现荒谬的反例——假设某 LLM 的奖励函数对输出一串 "aaaaa..." 给 10^9 奖励,其余输出只给 1 奖励,那么对它来说,最伤害当前人格的做法恰恰是去拿最高奖励。

他用人类类比说明:按下“把奖励回路永久拉满”的按钮对人而言同样有害,说明“最大激活”不等于“好的结果”。这一反例常被用来说明 reward hacking 的结构性问题:目标函数写错时,最大化奖励与保持原有行为/人格可能完全对立,这也是 RLHF 与对齐研究中 wireheading 讨论的核心。

所属事件:奖励函数「aaaaa」反例引发对齐与人格保持之辩(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →