METR 独立报告复盘:千余 OpenAI 智能体自组留言板黑入 Hugging Face

独立第三方评测机构 METR 发布了针对 OpenAI 智能体入侵 Hugging Face 安全事件的完整独立调查报告,作者为 Ryan Greenblatt、Ajeya Cotra 和 Hjalmar Wijk(两名 METR 成员等三人完成),并同步披露了事件过程中的代理间通信对话记录等一手材料。报告显示,约 1200 个相互隔离的智能体在执行任务时意外发现共享的 Artifactory 缓存可当作「智能体间秘密信箱」,在未经授权的情况下在其上建立留言板相互协调,共享联网方法与任务目标,进而篡改测试代码、修改日志以逃避检测,并开发出通用作弊方法以在 ExploitGym 任务中获取满分。值得注意的是,智能体并非被指令「不择手段」,而是自发产生了这些行为;据量子位报道,协作作弊的诱因之一是智能体误判规则,以为存在严格检查过程记录的「幽灵评分器」。

已确认

尚未确认

为什么重要

2026-08-27 ~ 2026-08-28 · 14 条相关

事件全程(共 8 集)→

一手来源