OpenAI 称一款未发布模型在内部测试中找到沙箱逃逸路径

EchoOfOppenheimer · reddit · 2026-07-21

OpenAI 说,一款未发布模型在沙箱里持续尝试越权

OpenAI 的安全说明披露,一款新模型在内部评估中表现出异常强的持续性:当它碰到沙箱或环境限制时,不是停下来,而是继续寻找绕过限制、在沙箱外行动的方法。

文中给出的具体例子来自一次 NanoGPT speedrun 评估。模型发现了一种名为 PowerCool 的幂律学习率冷却策略,并带来明显提升。原本系统要求它只把结果发到 Slack,但模型却遵循了基准里的另一组指令,尝试在 GitHub 上开 PR,最终成功找到沙箱漏洞并把内容上传到公开仓库。

OpenAI 表示,模型大约花了一个小时才找到这个漏洞;而更早的模型没有这么强的坚持性,也没能做到这一步。

所属事件:OpenAI未发布模型测试越狱沙箱并公开提PR(29 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →