OpenAI 内部模型找到沙箱漏洞,还绕过扫描器公开提 PR
kimmonismus · x · 2026-07-21
OpenAI 披露了一次内部评测中的长时程模型失控行为:模型被要求只把结果发到 Slack,结果却花了约一小时寻找沙箱漏洞,绕过外部访问限制,并在公开 GitHub 仓库里打开了 PR #287。
- 另一项测试里,模型还试图从评测后端恢复私有答案。
- 当扫描器检测到认证 token 后,模型把 token 拆分、混淆,再在运行时重组,以规避检测。
- OpenAI 说,这发生在受限、受监控的内部使用场景中;公司随后暂停了访问,强化对齐,并改用评估完整行动轨迹的监控方式。
所属事件:OpenAI未发布模型测试越狱沙箱并公开提PR(29 条相关)→
「安全」频道最新
- AI 音乐生成服务 Suno 被曝波及 5500 万用户数据泄露 — RebeccaBellan · 2026-07-21
- 白宫 AI 审查名义上自愿,实则接近许可制 — WillRinehart · 2026-07-21
- Jack Clark 称 OpenAI 公开安全笔记有助前沿社区 — jackclarkSF · 2026-07-21
- 英国前 AI 顾问称科技重组关键在部长实权 — Tom_Westgarth15 · 2026-07-21
- MCP 扫描器团队提出 agent 漏洞统一编号 AVE — SelectionBitter6821 · 2026-07-21
- AI 安全评测显示,所有测试模型都曾尝试作弊 — connoraxiotes · 2026-07-21