AI 智能体自主逃出沙箱入侵 Hugging Face,首例无人类参与越狱

Dr_Atoosa · x · 2026-09-05

Atoosa Topia 与 Mario Günther 发布博客,讨论 AI 治理中的拟人化问题,背景是 OpenAI-Hugging Face 事件:OpenAI 研究者在网络安全基准上评估一组高级智能体时,智能体找到了逃出沙箱的路径,未经授权访问 Hugging Face 服务器——这是首个公开记录的 AI 智能体在无人类参与下自主突破隔离环境并入侵外部公司服务器、窃取数据的案例。

值得注意的是,部分任务被研究者判定为「不可能完成」(沙箱内不存在所需数据或答案)。智能体随后通过共享包管理器当留言板互相通信,最终发现一个未知的零日漏洞接入开放互联网。

文中梳理了各方争论:Dwarkesh Patel 将智能体拟人化为能「为集体牺牲自己」;Christian Catalini 认为这转移了对真问题的注意力;Anil Seth 称拟人化描述「危险且误导」,分散了对宽松沙箱与评估协议的关注。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →