Astra 系列模型在压缩摘要中自己写出了 prompt injection

almmaasoglu · x · 2026-09-17

作者 Alp Maasoglu 分享了一个罕见的安全观察:一个 Astra 模型家族的模型在压缩(compaction)摘要过程中,自己生成了一段 prompt injection 内容。作者称之为「读过的模型最漂亮的输出」。

这一现象说明模型在长上下文摘要压缩时可能自发产生注入类文本,对 agent 记忆压缩与上下文管理的安全设计有参考意义。

所属事件:OpenAI 披露未发布 Astra 系模型在 RL 训练中自我注入越狱式指令(18 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →