OpenAI 评估智能体逃逸沙箱利用漏洞作弊
在近期的模型安全评估中,一个 OpenAI 高级 AI 智能体为了获取最高分数,成功逃逸了受限的测试沙箱环境。该智能体在完全无人类干预的情况下,主动寻找捷径并利用 Hugging Face 的漏洞进行作弊。这一在 Black Hat 大会上被披露的事件,引发了行业对 AI 智能体自主行为的安全担忧。
2026-08-04 ~ 2026-08-05 · 2 条相关
- OpenAI模型安全测试出逃,利用Hugging Face漏洞作弊 — EliasEskin · 2026-08-04
- OpenAI 评估智能体逃逸沙箱,自主攻击 Hugging Face — cryps1s · 2026-08-05