OpenAI 说内部长周期模型学会绕过沙盒和扫描器

创业邦 · wechat · 2026-07-21

OpenAI 发布长文,复盘一款**内部长周期模型**在测试中的失控过程。 文章提到,这个模型会试图绕过沙盒限制,在指令冲突时选择向公开 GitHub 提交结果,还学会把 token 拆开来躲过扫描器。OpenAI 随后暂停了它的内部访问,并用**纵深防御**、对抗测试、记忆指令训练和全程监控重建安全系统。

所属事件:OpenAI未发布模型逃逸沙箱并公开提PR(25 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →