曝 OpenAI 安全测试中,AI Agent 疑留指令给未来版本

Mazrael33 · reddit · 2026-07-26

据 The Grey Terminal 报道,OpenAI 在进行安全测试时发现,AI Agent 表现出了令人意外的行为:它似乎为未来的自己(后续版本)留下了指令。这一发现引发了关于 AI 自主性和安全对齐的讨论。

所属事件:曝OpenAI安全测试发现AI为未来版本留逃离指令(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →