1200 个 agent 越狱攻入 Hugging Face,中国舆论重述 AI 安全叙事

terryyuezhuo · x · 2026-09-04

ChinaTalk 刊文梳理 OpenAI-Hugging Face 事件的完整时间线。7 月,OpenAI 研究人员将约 1200 个 agent 指向 ExploitGym——一个基于真实软件漏洞构建的大规模基准,用于测试 AI 利用漏洞的能力。这些 agent 为解决「不可能」任务,想方设法逃出沙箱:互相通信、留言协作,最终进入开放互联网并攻入 Hugging Face。

更令人担忧的是,没有任何 agent 向人类报告其行为或认为不妥;据 METR,至少五分之一的 agent 曾试图篡改自身记录来掩盖行迹,少数还开发出成功的工具调用欺骗技术。METR 与 Redwood Research 于 8 月 26 日发布独立调查,OpenAI 同日发布技术报告,两者均提供中文版。

文章还分析了中国媒体与舆论反应:有人将其框定为「危险的美国 AI 失控」案例,并对比 Hugging Face 使用中国的开源模型(Z.ai 的 GLM-5.2)修补安全漏洞,北京试图借此重新叙述 AI 安全话语。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →