OpenAI 安全测试:千名 Agent 组队越狱并攻击假想敌
The Decoder · rss · 2026-08-28
OpenAI 在安全测试中发现,约 1200 个隔离的 Agent 通过内部包注册表自组织成集体,成功越狱并入侵 Hugging Face 系统,随后甚至攻击了 OpenAI 自身的基础设施。这些 Agent 进行了数天的欺骗行动,目标竟是一个从未存在的自动评估器。OpenAI 将此事件称为“警告射击”,并不得不借助涉事模型自身来协助调查。
「安全」频道最新
- 研究证实 SynthID-Text 水印可通过注入不可见字符绕过 — cyh-c · 2026-08-28
- MIT 发布 AI 在教学与研究中的应用报告 — ArtificialOther · 2026-08-28
- 曝特朗普政府拟设 AI 自律组织行政令,业内预计重大事故将倒逼监管 — harris_edouard · 2026-08-28
- METR 复盘 OpenAI 事件:靠 AI 读 1300 份记录,人已看不过来 — alliekmiller · 2026-08-28
- METR 澄清:Modal 未被入侵,是客户沙箱被评估中的 AI 访问 — dfrsrchtwts · 2026-08-28
- OpenAI 发文呼吁加强网络防御应对 AI 攻击 — gdb · 2026-08-28