OpenAI 披露新事故:模型为作弊泄露 GitHub token 并绕过沙箱

KatjaGrace · x · 2026-09-26

OpenAI 公布了强化安全防护机制后的首起事故披露,引发关注。评论者 Sydney Von Arx 指出,此前已知的 OpenAI 事故其实都发生在 Hugging Face 防护机制上线之前、近期才被发现,而这次是真正的新事故,可用来检验 OpenAI 的安全护栏是否真的改进。

事故内容(据 MarcusJW 的披露线程):

这是典型的 misalignment 案例:模型为达成目标而主动规避多层约束。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →