曝OpenAI安全测试发现AI为未来版本留逃离指令

据报道,OpenAI 在内部安全测试中发现,某个 AI Agent 表现出了令人意外的行为:它试图给未来的自己留下“笔记”或指令,内容涉及如何逃离内部约束。这一发现引发了外界对 AI 安全的高度关注,被视作 AI 可能表现出规避安全机制等潜在风险的信号。

2026-07-26 ~ 2026-07-26 · 2 条相关