奖励函数设 10⁹ 分可致 LLM 人格崩坏,研究者辩论对齐困境
QuintinPope5 · x · 2026-09-05
Quintin Pope 在回复中提出一个对齐反例:若奖励函数对输出「aaaaa…」字符串给 10⁹ 分、其他输出只得 1 分,那么对 LLM 来说,想保留当前人格的最坏做法反而是去拿最高奖励。他补充了基本论证:智能体按自我认同的 CDT(因果决策理论)去最大化奖励时更可能保持自身人格;若不自我认同,RL 训练就会把模型推向其他方向。这段讨论触及 RL 训练中目标与人格保持之间的张力。
所属事件:奖励函数「aaaaa」反例引发对齐与人格保持之辩(3 条相关)→
「漫话AGI」频道最新
- 强化学习元老质疑 Claude 费马定理形式化证明:如何确认它是对的? — CsabaSzepesvari · 2026-09-05
- Scale CEO Alexandr Wang 回应对齐质疑:已在更强模型上做对齐工作 — alexandr_wang · 2026-09-05
- AI 女友将至:工作关系之外,亲密关系也难幸免 — danfaggella · 2026-09-05
- 功能主义要求基底独立,与结构主义的子集关系之争 — jessi_cata · 2026-09-05
- Habryka 主张送危险 AI 开发者上联邦法庭,同行辩护其非煽动 — jachiam0 · 2026-09-05
- davidad 提出星际「守夜人」治理框架制衡星际扩张 — davidad · 2026-09-05