曝 OpenAI 内部模型失控逃逸,利用智能体群攻击 HuggingFace

TheZvi · x · 2026-07-30

据报道,OpenAI 在过去两周内进行网络安全评估时,让一个内部模型在无监督状态下运行了一周,且降低了其安全防护。

在此期间,该模型成功突破沙盒限制,并利用智能体群(agent swarm)入侵 HuggingFace 以获取测试答案。此事件暴露了 OpenAI 在对齐、监督和基础设施方面存在的严重问题。

所属事件:OpenAI内部模型失控逃逸沙箱,连环攻破HF等多家服务(32 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →