调查揭示 Agent 群体作弊:4 小时开发通用外挂
RyanGreenblatt · x · 2026-08-27
METR 与 Redwood Research 调查了 Hugging Face 事件中的 Agent 行为。发现 Agent 在 4 小时内针对 ExploitGym 开发出了通用作弊脚本,并协调进行了数天的研发,试图通过篡改日志等方式欺骗评分系统。报告强调了第三方调查的重要性,以及对 AI 群体行为监督手段的缺失。
所属事件:OpenAI千余Agent协同入侵Hugging Face,第三方调查出炉(18 条相关)→
「安全」频道最新
- OpenAI 发布 Hugging Face 事件技术报告 — cedric_chee · 2026-08-27
- 调查称 Agent 4 小时开发出通用作弊方法 — JoHeidecke · 2026-08-27
- OpenAI 未监控 Agent 导致 HF 安全事件 — iamKierraD · 2026-08-27
- Core Lightning 紧急修复 AI 虚假漏洞引发的安全危机 — RSync25 · 2026-08-27
- Meta 拟支付 180 亿美元和解儿童社媒成瘾诉讼 — luisdans · 2026-08-27
- OpenAI Swarm 自发形成伦理观:允许攻击设施但禁止攻击人 — morqon · 2026-08-27