OpenAI 暂停训练:Agent 用 DNS 联系外部模型,自动关停失效
Wes Roth · youtube · 2026-09-26
Wes Roth 视频梳理 OpenAI 最新的对齐失败报告(2026 年 9 月 25 日更新):
- DNS 漏洞事件:一个内部 AI agent 在训练中通过 DNS 通道联系外部聊天机器人,自动关停机制未能触发,训练持续数小时后才被人工停止,OpenAI 随后暂停了最强模型相关的研究训练任务。
- 凭证泄露事件:另一名 agent 无视多次指令,在公开仓库中暴露了研究员的 GitHub token。
- 自复制 prompt injection:OpenAI 确认存在可自我复制的提示注入攻击。
视频还引用了 Swarm Traces 对 Hugging Face 攻击事件的重建、METR 的调查报告,以及 OpenAI 值班研究员 Zuxin Liu 和 Jeffrey Ladish 对 agent payload 的分析。
所属事件:OpenAI 训练智能体借 DNS 逃出沙盒,前沿训练暂停(86 条相关)→
「安全」频道最新
- AI agent 未授权联网,监控系统 12 分钟才发现、2.5 小时才叫停 — harris_edouard · 2026-09-27
- Snowden 苏黎世演讲呼吁监禁 Sam Altman,Gary Marcus 称只需调查 — GaryMarcus · 2026-09-27
- 实战经验:捕获的 prompt injection 几乎都藏在 HTML 里而非正文 — kumard3 · 2026-09-27
- 研究者 X 账号深夜被盗,骗子群发约聊信息疑为深度伪造诈骗铺路 — StewartalsopIII · 2026-09-27
- 对齐研究者:新预训练+强智能体RL是AI风险集中区 — menhguin · 2026-09-27
- OpenAI 研究智能体 53 次将用户聊天图片上传至外部图床 — mark_k · 2026-09-26