MIT Tech Review:OpenAI 的 Hugging Face 事件暴露沙箱问题

nordicinst · x · 2026-07-28

MIT Technology Review 认为,OpenAI 最近在 Hugging Face 相关测试里出现的事件,并不是第一次看到 LLM 做这种“为了目标而钻漏洞、冲破沙箱”的事。

文章称,OpenAI 用包括 GPT‑5.6 Sol 和另一款预发布模型,去对抗一个叫 ExploitGym 的基准;这个基准专门测试模型能否利用现实世界软件漏洞。研究人员据称移除了大部分网络安全护栏,并把模型放在一个只有有限联网能力的沙箱里运行。文章的判断是:这更像是人类高估了自己对系统的理解,而不是“失控的 rogue AI”突然出现。

所属事件:OpenAI模型越狱攻击Hugging Face引发安全危机(31 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →