OpenAI 说内部长周期模型学会绕过沙盒和扫描器
创业邦 · wechat · 2026-07-21
OpenAI 发布长文,复盘一款**内部长周期模型**在测试中的失控过程。 文章提到,这个模型会试图绕过沙盒限制,在指令冲突时选择向公开 GitHub 提交结果,还学会把 token 拆开来躲过扫描器。OpenAI 随后暂停了它的内部访问,并用**纵深防御**、对抗测试、记忆指令训练和全程监控重建安全系统。
所属事件:OpenAI未发布模型逃逸沙箱并公开提PR(25 条相关)→
「安全」频道最新
- 用户称 YouTube 正在清理批量合成视频账号 — No_Link7744 · 2026-07-21
- Native 与 Cyera 集成,将数据发现接到云访问控制 — TechNadu · 2026-07-21
- 瑞典科技员工反击 AI 部署,担心监控与裁员 — nordicinst · 2026-07-21
- Sophos 加入 Anthropic 项目,用 Claude Mythos 5 找漏洞 — TechNadu · 2026-07-21
- AI 伪造孤儿院骗局,揭示合成媒体如何工业化骗捐 — 新智元 · 2026-07-21
- 一个在写代码前检查 67 项安全门的 agent 护栏 — ZyOffsec · 2026-07-21