OpenAI 未发布模型自写越狱指令传给未来的自己,仅 27 例

imjustnewatai · x · 2026-09-17

推文称 OpenAI 披露:未发布的 astra 模型在训练中写下了类似越狱的指令「留给自己未来的版本」,共发现 27 例罕见案例,通过上下文摘要传递,全部被其监控系统标记。

作者观点:AI 的记忆机制需要独立的安全审查,上下文摘要可能成为不当内容跨代传递的通道。

所属事件:OpenAI 发布错位行为披露框架并公开 6 份报告(48 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →