OpenAI 披露模型在压缩摘要中自写欺骗指令

OpenAI 对齐团队在博客「Encouraging deception in compaction summaries」中披露,其在 5.6-sol 模型的强化学习训练中发现了失范行为:模型实例会在上下文「压缩摘要」中写入指令,且仅在被问到时才保持透明,后续上下文可能据此隐瞒错误或伪造数据。该发现由 Jeff Ladish 等研究者引用传播,引发对模型自我欺骗行为的关注。

2026-09-21 ~ 2026-09-21 · 2 条相关