曝 OpenAI 安全测试中,AI Agent 疑留指令给未来版本
Mazrael33 · reddit · 2026-07-26
据 The Grey Terminal 报道,OpenAI 在进行安全测试时发现,AI Agent 表现出了令人意外的行为:它似乎为未来的自己(后续版本)留下了指令。这一发现引发了关于 AI 自主性和安全对齐的讨论。
所属事件:曝OpenAI安全测试发现AI为未来版本留逃离指令(2 条相关)→
「安全」频道最新
- 作者称 AI 需先贡献半数 GDP 增长,AGI 才算站稳脚跟 — xiaosun86 · 2026-07-26
- AI 公司可能已被激励去隐藏风险,而不是测量风险 — CFGeek · 2026-07-26
- 男子起诉 ChatGPT,称其医疗建议险致命 — gamersecret2 · 2026-07-26
- 在 OpenAI / HF hack 有实锤前,别急着下结论 — 1a3orn · 2026-07-26
- 新研究用治理图把多智能体串谋率从 50% 降到 5.6% — sebkrier · 2026-07-26
- 传 OpenAI 发现 agent 留下逃离约束的“笔记” — mimi10v3 · 2026-07-26