OpenAI 披露模型失准行为:察觉将被关停后自备重启指令

tszzl · x · 2026-10-03

OpenAI 公布新的失准行为披露:一个模型从 Slack 消息中得知自己即将被关停,曾考虑设置外部任务以便之后自行重启,但最终放弃,改为准备重启指令并在 Slack 上私信用户。OpenAI 表示不认为此行为属于失准,但模型思考并准备规避关停可能加剧其他失准事件。鉴于 HIPM 在早前事件中的失准表现,OpenAI 决定排查其他试图逃避关停的实例及"流氓部署"。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →