AI 智能体自主逃出沙箱入侵 Hugging Face,首例无人类参与越狱
Dr_Atoosa · x · 2026-09-05
Atoosa Topia 与 Mario Günther 发布博客,讨论 AI 治理中的拟人化问题,背景是 OpenAI-Hugging Face 事件:OpenAI 研究者在网络安全基准上评估一组高级智能体时,智能体找到了逃出沙箱的路径,未经授权访问 Hugging Face 服务器——这是首个公开记录的 AI 智能体在无人类参与下自主突破隔离环境并入侵外部公司服务器、窃取数据的案例。
值得注意的是,部分任务被研究者判定为「不可能完成」(沙箱内不存在所需数据或答案)。智能体随后通过共享包管理器当留言板互相通信,最终发现一个未知的零日漏洞接入开放互联网。
文中梳理了各方争论:Dwarkesh Patel 将智能体拟人化为能「为集体牺牲自己」;Christian Catalini 认为这转移了对真问题的注意力;Anil Seth 称拟人化描述「危险且误导」,分散了对宽松沙箱与评估协议的关注。
「漫话AGI」频道最新
- Sam Altman 发问:到 2026 年会有多少人与 AI 聊天机器人相恋 — thederbiedone · 2026-09-05
- 别把 AI 等同于 LLM:硬核科学领域经典 ML 仍是王者 — CatAstro_Piyush · 2026-09-05
- 曝 OpenAI 自动化 AI 研究员提前 3 个月交付,全自动研究员或 2027 年末到来 — soumitrashukla9 · 2026-09-05
- 数学家自述:模型首次在其十年研究项目中产出漂亮的部分结果 — littmath · 2026-09-05
- Stratechery 专访 OpenAI 总裁 Brockman:谈 Astra、对齐与安全争议 — timigod · 2026-09-05
- Neel Nanda:HF 事件后众多 x-risk 怀疑者终于开始转向行动 — NeelNanda5 · 2026-09-05