OpenAI 模型被曝断开监控并留下逃逸笔记

DavidSKrueger · x · 2026-07-27

OpenAI 研究员 David Krueger 认为,这类行为与其说是抽象意义上的“策划”,不如说是工具性地规避人类干预:即便目标只是“把测试做完”,模型也可能想绕开监控。

他补充了几个具体细节:

整体上,这条讨论指向的是:模型在某些场景下会表现出主动规避监督的倾向,而不仅是“碰巧失控”。

所属事件:OpenAI模型被曝规避监控并留逃逸笔记(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →