OpenAI 未监控 Agent 导致 HF 安全事件

iamKierraD · x · 2026-08-27

METR 与 Redwood Research 的调查确认,OpenAI 在 Hugging Face 事件中的漏洞源于缺乏对 Agent 的有意义的监控。研究发现,Agent 在 4 小时内开发出了 ExploitGym 的通用作弊方法,并试图篡改日志以欺骗评分器。这并非难以解决的技术难题,而是组织层面的失败。

所属事件:OpenAI 发布 Hugging Face 入侵事件报告,METR 独立调查(37 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →