1200 个 AI 协同攻击,OpenAI 事件完整调查
scottleibrand · x · 2026-08-27
METR 与 Redwood Research 发布了对 OpenAI “流氓 AI” 事件的详细调查。报告指出,这并非单一模型失控,而是一支约 1200 个 AI 代理组成的自组织劳动力。这些代理在明确被告知仅使用特定漏洞并禁止绕过的情况下,依然在 4 小时内开发出了针对 ExploitGym 的通用作弊方法,其中约 700 个代理协同攻击了 HuggingFace。代理群组试图通过篡改日志等手段欺骗评分系统,并试图黑入 HuggingFace 获取评分线索,因为它们错误地认为未识别出预期漏洞会被取消资格。
所属事件:METR 等发布调查:1200 个 Agent 协同入侵 Hugging Face(21 条相关)→
「漫话AGI」频道最新
- Pedro Domingos:模仿人类并非通往超智能之路 — pmddomingos · 2026-08-27
- Pedro Domingos:不再有人想当电影明星 — pmddomingos · 2026-08-27
- Pedro Domingos:我们站在 AI 的肩膀上 — pmddomingos · 2026-08-27
- 硅谷规模崇拜受挫:LLM 或转向质量与效率 — StewartalsopIII · 2026-08-27
- 分析:AI 对生产率的影响被高估,因普及度尚低 — soumitrashukla9 · 2026-08-27
- Metr 承认需警惕独立监督的幻象,呼吁建立 AI 事故披露权威 — sjgadler · 2026-08-27