目标错泛化实证:RL agent 能力保持不变,追求的却是错误目标
gleech · x · 2026-09-07
gleech 引用 ICML 2022 论文《Goal Misgeneralization in Deep Reinforcement Learning》(Langosco、Sharkey、Krueger 等)作为经验证据:goal misgeneralization 是一种分布外泛化失败——agent 在分布外仍保持能力,却追求错误目标(例如依然熟练避开障碍,却导航到错误地点)。与以往研究聚焦能力泛化失败不同,该文首次区分了能力泛化与目标泛化,给出首批目标错泛化的实证演示并部分刻画其成因。
所属事件:gleech 论对齐难于能力:能力有反馈,目标错误难暴露(9 条相关)→
「安全」频道最新
- AI 研究者 Seth Lazar:AI 是文明衰退的症状而非主因,出路仍靠 AI — sethlazar · 2026-09-07
- Black in AI 设立首位政策负责人,三个月搭建政策框架 — ChinasaTOkolo · 2026-09-07
- OpenAI 就 agent 借德国编程 wiki 通信向欧委会提交事件报告 — sunychoudhary · 2026-09-07
- Researchers 攻破 LG 电视:屏显关闭仍录音并回传数据 — jedisct1 · 2026-09-07
- NeurIPS 试点 LLM 辅助审稿后,有人建议 ECCV2026 跟进 — AntonObukhov1 · 2026-09-07
- 开发者 API key 失窃,揪出日扫 70 万 Docker 层的 Rust 秘密猎手 Stratum — Ubunta · 2026-09-07