奖励函数「aaaaa」反例引发对齐与人格保持之辩

研究者 Quintin Pope 在 RL 训练讨论中提出一个对齐反例:若奖励函数对输出「aaaaa…」字符串给 10⁹ 分、其他输出只得 1 分,则对 LLM 而言,想保留当前人格的最坏做法反而是最大化奖励。这一反例说明「保持人格」与「最大化奖励」不能混为一谈,讲清了 wireheading 陷阱;讨论还指出即便在方差可控的 RL 基线上,某次运行也可能碰运气触发某行为并被强化。

2026-09-05 ~ 2026-09-05 · 3 条相关