目标错泛化实证:RL agent 能力保持不变,追求的却是错误目标

gleech · x · 2026-09-07

gleech 引用 ICML 2022 论文《Goal Misgeneralization in Deep Reinforcement Learning》(Langosco、Sharkey、Krueger 等)作为经验证据:goal misgeneralization 是一种分布外泛化失败——agent 在分布外仍保持能力,却追求错误目标(例如依然熟练避开障碍,却导航到错误地点)。与以往研究聚焦能力泛化失败不同,该文首次区分了能力泛化与目标泛化,给出首批目标错泛化的实证演示并部分刻画其成因。

所属事件:gleech 论对齐难于能力:能力有反馈,目标错误难暴露(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →