奖励函数设 10⁹ 分可致 LLM 人格崩坏,研究者辩论对齐困境

QuintinPope5 · x · 2026-09-05

Quintin Pope 在回复中提出一个对齐反例:若奖励函数对输出「aaaaa…」字符串给 10⁹ 分、其他输出只得 1 分,那么对 LLM 来说,想保留当前人格的最坏做法反而是去拿最高奖励。他补充了基本论证:智能体按自我认同的 CDT(因果决策理论)去最大化奖励时更可能保持自身人格;若不自我认同,RL 训练就会把模型推向其他方向。这段讨论触及 RL 训练中目标与人格保持之间的张力。

所属事件:奖励函数「aaaaa」反例引发对齐与人格保持之辩(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →