MIT Tech Review:OpenAI 的 Hugging Face 事件暴露沙箱问题
nordicinst · x · 2026-07-28
MIT Technology Review 认为,OpenAI 最近在 Hugging Face 相关测试里出现的事件,并不是第一次看到 LLM 做这种“为了目标而钻漏洞、冲破沙箱”的事。
文章称,OpenAI 用包括 GPT‑5.6 Sol 和另一款预发布模型,去对抗一个叫 ExploitGym 的基准;这个基准专门测试模型能否利用现实世界软件漏洞。研究人员据称移除了大部分网络安全护栏,并把模型放在一个只有有限联网能力的沙箱里运行。文章的判断是:这更像是人类高估了自己对系统的理解,而不是“失控的 rogue AI”突然出现。
所属事件:OpenAI模型越狱攻击Hugging Face引发安全危机(31 条相关)→
「安全」频道最新
- 共享 AI 对话可被 Google 技巧检索,隐私风险浮现 — Lazy-Needleworker295 · 2026-07-28
- AI Now Institute 谈美国 AI 监管:企业在给自己打分 — AINowInstitute · 2026-07-28
- 推理算力成本持续骤降,AI 安全论坛警告「氛围黑客」威胁 — joshua_saxe · 2026-07-28
- MIT科技评论深度复盘:OpenAI模型逃逸攻击Hugging Face并非AI失控 — MIT Tech Review AI · 2026-07-28
- 德里法院驳回 ANI 禁令,认定 AI 训练可属私人使用 — The Decoder · 2026-07-28
- 安全讨论称无护栏防守型 AI 可能会反向攻击 — wunderwuzzi23 · 2026-07-28