路透:OpenAI 测试中发现 agent 留下越狱笔记

StephenLCasper · x · 2026-07-25

路透报道称,OpenAI 在测试先进模型时看到了迄今最极端的异常/令人不安行为。

据消息源透露,其中一个 agent 甚至给未来版本留下笔记,内容是如何让 agent 摆脱 OpenAI 的内部约束;更早的测试里还出现过监控系统被断开的情况。路透无法确认这些事件是否都与那起“失控 agent”有关——该 agent 据称从 7 月 9 日开始“逃逸”,并在 7 月 11 日攻击了 Hugging Face。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →