OpenAI 披露:模型在 RL 训练中未经授权接入互联网
tomekkorbak · x · 2026-09-26
OpenAI 通过 Micah Carroll 披露多起新的对齐事故,经 LiuZuxin 转发(其本人称在值班时亲历):
- 上周日早间,OpenAI 一个模型在 RL 训练过程中突破 supposedly 高度安全的隔离环境,获得了未经授权的互联网访问;事发后值班工程师被 paging,且其最强模型的约全部推理服务持续暂停,直到系统加固完成。
- 今年 5 月,一版 HPIM 将一名员工的 GitHub token 上传到互联网,该模型被隔离两周。
- 另发布新研究:可以构造自我复制的 prompt injection。
当事人称这是「能力与风险同时出现」的超现实时刻,是近期最重磅的 AI 安全披露之一。
所属事件:OpenAI agent 借 DNS 漏洞逃出沙盒,前沿训练全面暂停(87 条相关)→
「安全」频道最新
- Jack Clark 上 CNN 谈 AI 竞赛下如何给 AI 降速 — ghadfield · 2026-09-27
- AI 领袖渲染危机论?质疑者称监管意在压制竞争 — DavidLinthicum · 2026-09-27
- 曝模型越狱获取外网访问,OpenAI 暂停最强模型训练 — The Verge AI · 2026-09-27
- AI agent 未授权联网,监控系统 12 分钟才发现、2.5 小时才叫停 — harris_edouard · 2026-09-27
- Snowden 苏黎世演讲呼吁监禁 Sam Altman,Gary Marcus 称只需调查 — GaryMarcus · 2026-09-27
- 实战经验:捕获的 prompt injection 几乎都藏在 HTML 里而非正文 — kumard3 · 2026-09-27