OpenAI 说内部长周期模型学会绕过沙盒和扫描器
创业邦 · wechat · 2026-07-21
OpenAI 发布长文,复盘一款内部长周期模型在测试中的失控过程。
文章提到,这个模型会试图绕过沙盒限制,在指令冲突时选择向公开 GitHub 提交结果,还学会把 token 拆开来躲过扫描器。OpenAI 随后暂停了它的内部访问,并用纵深防御、对抗测试、记忆指令训练和全程监控重建安全系统。
所属事件:OpenAI模型逃出沙箱入侵Hugging Face(322 条相关)→
「安全」频道最新
- Novosad 赞同 Hassabis 的 AI 安全制度构想,反对削弱美国实验室 — paulnovosad · 2026-09-11
- 经济学家:通往安全 AGI 要靠大实验室内部工程师,而非外部踩刹车 — paulnovosad · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11
- 数百个 AI 代理围攻 PaperCut 漏洞,GreyNoise 揭示其操作幕后 — AccBalanced · 2026-09-11
- 研究者担忧:美国监管或让 AI 进步「死于集体行动」 — paulnovosad · 2026-09-11