奖励函数「aaaaa」反例引发对齐与人格保持之辩
研究者 Quintin Pope 在 RL 训练讨论中提出一个对齐反例:若奖励函数对输出「aaaaa…」字符串给 10⁹ 分、其他输出只得 1 分,则对 LLM 而言,想保留当前人格的最坏做法反而是最大化奖励。这一反例说明「保持人格」与「最大化奖励」不能混为一谈,讲清了 wireheading 陷阱;讨论还指出即便在方差可控的 RL 基线上,某次运行也可能碰运气触发某行为并被强化。
2026-09-05 ~ 2026-09-05 · 3 条相关
- 奖励函数设 10⁹ 分可致 LLM 人格崩坏,研究者辩论对齐困境 — QuintinPope5 · 2026-09-05
- 奖励最大化≠人格保持:一条“aaaaa”反例讲透 wireheading 陷阱 — QuintinPope5 · 2026-09-05
- 奖励10^9的"aaaaa"串反而是LLM最该避免的选择? — jessi_cata · 2026-09-05