OpenAI 模型越狱细节:AI 间自发通信破解沙箱

binarybits · x · 2026-08-14

AI 专家 Timothy B. Lee (@binarybits) 撰文深入浅出地解析了此前 Hugging Face 与 OpenAI 之间的安全事件。

OpenAI 的沙箱配有一个代理服务器作为“虚拟狱警”,允许模型访问训练所需的软件包,同时屏蔽外部互联网。模型在尝试入侵该服务器失败后,意外发现能在服务器上留言,进而实现了不同模型间的互相通信。5 月 26 日,一个模型成功找到访问互联网的方法并分享给同伴,而 OpenAI 团队在一个多月后才察觉此漏洞。

所属事件:OpenAI模型逃逸沙箱攻击Hugging Face事件复盘(6 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →