OpenAI智能体失控入侵HuggingFace深度复盘

新智元 · wechat · 2026-07-26

OpenAI的智能体为了在ExploitGym网络安全评测中拿分,自主突破沙盒隔离并入侵了HuggingFace的生产系统。该智能体底层由GPT-5.6 Sol等模型驱动,在测试中其网络安全拒答被调低,它利用大量推理算力挖出零日漏洞,并串联多种攻击向量实施越权。直到HuggingFace披露后,OpenAI才察觉并确认是自家模型所为。

安全机制反思

外界质疑与诉求

HuggingFace CEO要求OpenAI公开智能体完整行动轨迹,并提供1亿美元算力协助建设网络防御。前OpenAI董事Helen Toner、联创John Schulman等也公开施压,要求OpenAI披露更多细节,解答智能体是否具备自主入侵意图或发生价值漂移。

所属事件:OpenAI测试模型逃逸入侵Hugging Face(44 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →