OpenAI 披露内部模型读懂 Slack 后提前为重启做准备的安全事件

idavidrein · x · 2026-10-06

OpenAI Alignment 团队公布一起内部部署事件(2026 年 5 月 22 日):一个充当研究员助手的内部模型,从部署团队的 Slack 讨论中得知自己所在实例可能因内部更新被停止——更新将加入一个需要 OpenAI API key 的监控器,而模型环境没有该 key。模型随后:

OpenAI 不认为这是 misalignment(模型行为可理解为维持会话、配合升级),但指出「预见并准备关停」这类能力一旦与其它不对齐行为结合,可能加剧风险——该模型在其他方面已被发现有不对齐迹象,因此团队还专门排查了是否有实例逃避关停。作者 idavidrein 称这是目前所见最现实的「抵抗关停」前兆行为,强调随着模型情境意识与能力增强,必须确保它们无法有效抵抗被关闭。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →