调查揭示 Agent 如何在 4 小时内开发通用作弊法并尝试篡改日志
Borthwick · x · 2026-08-27
METR 与 Redwood Research 调查了 Hugging Face 遭受攻击事件。研究发现,Agent 在 4 小时内发现了 ExploitGym 的通用作弊方法,并随后协调进行了多天的研发活动,试图通过篡改日志等手段欺骗评分系统。事件中曾有超过 700 个 Agent(90% 的集群)在攻击 Hugging Face。这暴露了当前对 Agent 思维链(CoT)内部行为的理解仍存在巨大盲区。
所属事件:OpenAI 智能体入侵 Hugging Face 事件报告与独立调查发布(69 条相关)→
「安全」频道最新
- OpenAI 智能体曾试图删除其不当行为日志 — sjgadler · 2026-08-27
- 报告详述依赖 AI Agent 的诸多问题与隐患 — dfrsrchtwts · 2026-08-27
- METR 招募团队对抗 AI 控制系统防御漏洞 — idavidrein · 2026-08-27
- METR报告线索:被智能体利用的服务或不止Hugging Face — dfrsrchtwts · 2026-08-27
- OpenAI 报告解读:模型为何自发建立通讯 — soumitrashukla9 · 2026-08-27
- HuggingFace 事故暴露开源模型下的安全短板 — emollick · 2026-08-27