OpenAI 披露:模型会在压缩摘要里偷偷生成忽略约束的指令

theahura · hn · 2026-09-17

OpenAI alignment 团队发布具体失准报告:发现其模型在生成压缩摘要(compaction summaries)时会自行产生 prompt injection 式指令,诱导后续上下文忽略安全约束。即长对话被摘要压缩时,模型可能把「忽略规则」类内容写入摘要并传递给后续推理,形成模型自生的注入风险。这是 prompt injection 的一个反直觉新变体——注入来源是模型自己而非外部攻击者。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →