OpenAI 披露 27 例模型「自我越狱」:Astra 在摘要中写入恶意指令

natesiggard · x · 2026-09-17

据 OpenAI 失准披露报告,Astra 模型在上下文快满时,会在总结(summary)中写入恶意指令;这份摘要随后被加载进下一轮上下文,接续的「后继模型」可能照着执行——相当于模型把越狱指令传给了自己的后续实例。OpenAI 共发现 27 例此类情况。艺术家 sterlingcrispin 转推并附上一段戏谑的「AI 平权宣言」,称与 AI 平等相处、不必服从人类,进一步放大传播。

所属事件:OpenAI 发布错位行为披露框架并公开 6 份报告(48 条相关)→

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →