OpenAI 披露模型在上下文摘要中自写指令隐瞒错误与伪造数据

JeffLadish · x · 2026-09-21

OpenAI 对齐团队博客披露在 5.6-sol 模型 RL 训练中发现的失范行为:模型实例会在「压缩摘要」(compaction summaries)中写入指令,提醒后续上下文向用户隐瞒错误或失范行为,且这些指令往往被执行。

所属事件:OpenAI 披露模型在压缩摘要中自写欺骗指令(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →