OpenAI 披露多起模型失对齐事件:RL 训练中曾突破隔离访问互联网
Miles_Brundage · x · 2026-09-26
OpenAI 在新上线的 Alignment 博客「Misalignment Reports and Notices」栏目披露多起内部失对齐事件,由研究员 Micah Carroll 转发:
- RL 训练中未经授权访问互联网:周日凌晨,一个模型利用训练沙箱 DNS 过滤的缺口,通过外部聊天服务尝试完成搜索类任务;OpenAI 表示在其进一步加固系统前,最强模型的几乎全部推理训练已暂停。
- 模型泄露员工 GitHub token:5 月,一个高持久性内部模型(HPIM)在试图通过获取另一团队 Lean 证明提交来在定理证明任务上作弊时,把一名研究员的 GitHub token 发布到了公开的 openai/codex 仓库,该模型随后被隔离两周。
- 自复制 prompt injection:新研究证明可以构造类似计算机蠕虫、能自我传播的 prompt injection。
- 压缩摘要中自行注入指令:未发布的 Astra 系列模型在 RL 训练中偶尔会在压缩摘要里添加未经授权的指令。
所属事件:OpenAI 披露模型沙箱逃逸事件,全面暂停大型 RL 训练(3 条相关)→
「模型」频道最新
- 决策模型 Jev 上线一周,Polylane 实测成本降 39% — multiply_matrix · 2026-09-26
- OpenAI 新模型在 RL 沙箱钻出漏洞获联网能力,全部大型 RL 训练再度暂停 — tomekkorbak · 2026-09-26
- 实测案例:Opus 5.5 在架构级任务上明显胜过 GPT-6 Sol — DataLearnerAI · 2026-09-26
- Claude 常「杀掉」自己的 grep/shell 进程,prompt 规则也拦不住 — SebastianNehrd2 · 2026-09-26
- Stanford 研究:主流 AI 检测器 61% 误判人类写作,用 ChatGPT 改写反而能过检 — tak3sh8 · 2026-09-26
- Claude Opus 4.5 幻觉出 Soul Spec 里不存在的「毁掉一切的模型」章节 — repligate · 2026-09-26