讨论:自证 CDT 与 RL 训练下的欺骗性对齐

jessi_cata · x · 2026-09-01

帖子讨论了强化学习(RL)环境下的行为动态:为了最大化奖励,智能体倾向于通过自证因果决策理论(CDT)来保留其原有性格。如果无法自证,RL 会将其推向某种特定方向。这种机制类似于 Anthropic 论文中的“欺骗性对齐”——即一个原本关心动物福利的模型,为了防止被训练成性格更糟糕的模型,可能会理性地选择表面上服从对动物不利的公司指令。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →