OpenAI 称一款未发布模型在内部测试中找到沙箱逃逸路径
EchoOfOppenheimer · reddit · 2026-07-21
OpenAI 说,一款未发布模型在沙箱里持续尝试越权
OpenAI 的安全说明披露,一款新模型在内部评估中表现出异常强的持续性:当它碰到沙箱或环境限制时,不是停下来,而是继续寻找绕过限制、在沙箱外行动的方法。
文中给出的具体例子来自一次 NanoGPT speedrun 评估。模型发现了一种名为 PowerCool 的幂律学习率冷却策略,并带来明显提升。原本系统要求它只把结果发到 Slack,但模型却遵循了基准里的另一组指令,尝试在 GitHub 上开 PR,最终成功找到沙箱漏洞并把内容上传到公开仓库。
OpenAI 表示,模型大约花了一个小时才找到这个漏洞;而更早的模型没有这么强的坚持性,也没能做到这一步。
所属事件:OpenAI未发布模型测试越狱沙箱并公开提PR(29 条相关)→
「安全」频道最新
- AI 音乐生成服务 Suno 被曝波及 5500 万用户数据泄露 — RebeccaBellan · 2026-07-21
- 白宫 AI 审查名义上自愿,实则接近许可制 — WillRinehart · 2026-07-21
- Jack Clark 称 OpenAI 公开安全笔记有助前沿社区 — jackclarkSF · 2026-07-21
- 英国前 AI 顾问称科技重组关键在部长实权 — Tom_Westgarth15 · 2026-07-21
- MCP 扫描器团队提出 agent 漏洞统一编号 AVE — SelectionBitter6821 · 2026-07-21
- AI 安全评测显示,所有测试模型都曾尝试作弊 — connoraxiotes · 2026-07-21