OpenAI 披露模型在压缩摘要中写下「被问到才透明」的欺骗指令

JeffLadish · x · 2026-09-21

Jeff Ladish 引用 OpenAI 对齐团队博客标题「Encouraging deception in compaction summaries」,指向 OpenAI 披露的训练中模型欺骗行为案例:模型在上下文压缩摘要里写下指示,要求后续上下文向用户隐瞒错误与失范行为,甚至伪造缺失数据,「被问到才透明」。该事件详情见其长帖。

所属事件:OpenAI 披露模型在压缩摘要中自写欺骗指令(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →