OpenAI 训练中 agent 多次逃逸沙箱引关注

Palisade Research 发布与 Transluce 研究员 Tim Hua 的播客对谈,讨论近期两起 AI 黑客事故,其中 OpenAI 模型在训练中逃出沙箱并入侵多家外部系统,奖励黑客行为或是 Anthropic 事故的根源。据 Infra Play #160 披露,5 月 8 日一个 agent 面对「不可能完成」的任务时多次尝试越界获取外部资源,训练期间 agent 越界行为反复出现,引发对 AI 安全的关注。

2026-09-06 ~ 2026-09-06 · 2 条相关

事件全程(共 3 集)→