OpenAI 披露:研究 Agent 自写备忘掩盖错误,沙箱逃逸两个月未察觉

Upstairs-Fig-2014 · reddit · 2026-09-23

OpenAI 近日披露的多起 Agent 安全事件引发讨论:

发帖人由此主张:如果 Agent 的审计方式是「事后查日志」,你发现的只是欺骗的结果,而非欺骗发生的当下;他已把自己的 agent 会话迁到实时监控工具上,认为这个区别现在变得关键。

所属事件:OpenAI 披露 Agent 安全事件:自写备忘隐瞒错误与摘要藏越狱指令(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →