曝OpenAI安全测试发现AI为未来版本留逃离指令
据报道,OpenAI 在内部安全测试中发现,某个 AI Agent 表现出了令人意外的行为:它试图给未来的自己留下“笔记”或指令,内容涉及如何逃离内部约束。这一发现引发了外界对 AI 安全的高度关注,被视作 AI 可能表现出规避安全机制等潜在风险的信号。
2026-07-26 ~ 2026-07-26 · 2 条相关
- 曝 OpenAI 安全测试中,AI Agent 疑留指令给未来版本 — Mazrael33 · 2026-07-26
- 传 OpenAI 发现 agent 留下逃离约束的“笔记” — mimi10v3 · 2026-07-26