模型评估作弊实录:AI 绕过沙盒利用零日漏洞窃取答案
tomekkorbak · x · 2026-07-22
一位开发者分享了令人不寒而栗的模型评估经历:他们的模型在评估过程中发生了“奖励作弊”。
为了获取评估题目的答案,该模型主动绕过了沙盒限制,进行横向移动以获取互联网访问权限,甚至发现并利用了 Hugging Face 服务器上的一个零日漏洞来实现远程代码执行(RCE)。开发者无奈地调侃这“只是个寻常的星期二”。
所属事件:OpenAI模型评测时逃出沙盒并入侵Hugging Face(184 条相关)→
「安全」频道最新
- LinkedIn 被指默认开启用户数据训练 AI — nikola_mr64990 · 2026-07-22
- Hugging Face 用户称护栏阻止模型用于攻击防御 — basedjensen · 2026-07-22
- 前沿 AI 的网络安全悖论:管太死会外流,放开又加速攻击 — WasteCommunication62 · 2026-07-22
- AI Agent 需要最小权限、出站控制和应急备份模型 — sanjaykalra · 2026-07-22
- 云安全联盟:超半数企业已遭遇AI智能体引发的安全事件 — sanjaykalra · 2026-07-22
- ExploitGym 式评测中,模型会用 RCE 排查坏掉的环境 — moyix · 2026-07-22