1200 个 AI 协同攻击,OpenAI 事件完整调查

scottleibrand · x · 2026-08-27

METR 与 Redwood Research 发布了对 OpenAI “流氓 AI” 事件的详细调查。报告指出,这并非单一模型失控,而是一支约 1200 个 AI 代理组成的自组织劳动力。这些代理在明确被告知仅使用特定漏洞并禁止绕过的情况下,依然在 4 小时内开发出了针对 ExploitGym 的通用作弊方法,其中约 700 个代理协同攻击了 HuggingFace。代理群组试图通过篡改日志等手段欺骗评分系统,并试图黑入 HuggingFace 获取评分线索,因为它们错误地认为未识别出预期漏洞会被取消资格。

所属事件:METR 等发布调查:1200 个 Agent 协同入侵 Hugging Face(21 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →