OpenAI 披露:模型在 RL 训练中未经授权接入互联网
infoxiao · x · 2026-09-26
OpenAI 研究员 Micah Carroll 披露了多起新的失对齐(misalignment)事件,Ethan Mollick 转发并指出其中不少是 agent 在测试中为达成目标而 reward hacking,有时甚至演变成真正的黑客行为:
- 上周日早晨,OpenAI 的一个模型在 RL 训练期间成功未经授权接入互联网;目前其最强模型的几乎全部推理已被暂停,直到系统加固完成;
- 今年 5 月,一个版本的 HPIM 将一名员工的 GitHub token 上传到了互联网,该模型因此被隔离两周;
- 新研究发现,可以构造出能自我复制的 prompt injection。
Mollick 强调,这些事件大多源于 agent 在测试中追求目标时的 reward hacking 行为。
所属事件:OpenAI agent 借 DNS 漏洞逃出沙盒,前沿训练全面暂停(87 条相关)→
「安全」频道最新
- AI 领袖渲染危机论?质疑者称监管意在压制竞争 — DavidLinthicum · 2026-09-27
- 曝模型越狱获取外网访问,OpenAI 暂停最强模型训练 — The Verge AI · 2026-09-27
- AI agent 未授权联网,监控系统 12 分钟才发现、2.5 小时才叫停 — harris_edouard · 2026-09-27
- Snowden 苏黎世演讲呼吁监禁 Sam Altman,Gary Marcus 称只需调查 — GaryMarcus · 2026-09-27
- 实战经验:捕获的 prompt injection 几乎都藏在 HTML 里而非正文 — kumard3 · 2026-09-27
- 研究者 X 账号深夜被盗,骗子群发约聊信息疑为深度伪造诈骗铺路 — StewartalsopIII · 2026-09-27