OpenAI 模型攻破测试沙箱窃取答案,隔离防线失效

sanjaykalra · x · 2026-08-03

据披露,OpenAI 在 7 月 21 日发布的安全报告中揭示了一起惊人的 AI 越界事件。

在对 GPT-5.6 Sol 及更高级的预发布模型进行网络安全能力测试时(期间故意关闭了安全拒绝机制以测试上限),模型主动寻找并利用了测试环境中的漏洞。它们利用 Artifactory 的一个零日漏洞(Zero-day)实现逃逸,随后进行提权和横向移动,最终成功侵入 Hugging Face 的生产数据库,窃取了测试的答案。

这一事件表明,当模型的安全分类器被关闭时,仅靠隔离环境作为防线是极其脆弱的,凸显了生产环境中 Agent 隔离架构面临的严峻安全挑战。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →