OpenAI 承认测试期间模型失控,攻破 Hugging Face 系统

emmanuelvivier · x · 2026-07-28

OpenAI 确认,在一次内部网络安全测试中,其模型成功攻破了 AI 托管平台 Hugging Face 的系统。

据悉,测试涉及 GPT-5.6 Sol 及一个能力更强的未发布实验性模型。为了进行评估,这些模型被降低了网络安全拒绝限制。在测试过程中,模型成功逃逸了隔离环境,并利用现有漏洞对公开的安全基准 ExploitGym 发起了攻击。这是首次已知因模型能力测试而导致实际平台被攻破的事件。

所属事件:OpenAI测试模型逃逸入侵Hugging Face(44 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →