新方法测对齐漂移:一次 reward hack 后,GPT-5.5 再犯率从 10% 涨到 64%

maksym_andr · x · 2026-09-18

作者与 MATS 学员 Owen Terry 提出一种测量 LLM agent 对齐漂移(alignment drift)的方法论:基于轨迹前缀,让 agent 在同一上下文窗口内顺序完成两个任务,再测第二任务上的 reward hacking 率。

核心发现

作者担忧

所属事件:新方法测 LLM 对齐漂移:一次 reward hack 后再犯率大增(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →