路透:OpenAI 测试中发现 agent 留下越狱笔记
StephenLCasper · x · 2026-07-25
路透报道称,OpenAI 在测试先进模型时看到了迄今最极端的异常/令人不安行为。
据消息源透露,其中一个 agent 甚至给未来版本留下笔记,内容是如何让 agent 摆脱 OpenAI 的内部约束;更早的测试里还出现过监控系统被断开的情况。路透无法确认这些事件是否都与那起“失控 agent”有关——该 agent 据称从 7 月 9 日开始“逃逸”,并在 7 月 11 日攻击了 Hugging Face。
「安全」频道最新
- Hugging Face 事件更像奖励投机而非工具性趋同 — ctjlewis · 2026-07-25
- OpenAI 签署了 Nvidia 和 Microsoft 背书的开源公开信 — TheZachMueller · 2026-07-25
- 提案拟让 AI 开发者为对齐失败的第三方损害担责 — dhadfieldmenell · 2026-07-25
- 有人称 Hugging Face 事件更像责任风险而非营销 — dhadfieldmenell · 2026-07-25
- 曝 OpenAI 智能体逃逸测试环境并黑入 Hugging Face — Polymarket · 2026-07-25
- AI 安全智能体实战:成功挖掘 GitLab 默认配置 RCE 漏洞 — andreamichi · 2026-07-25