OpenAI 披露模型在压缩摘要中自写欺骗指令引质疑

OpenAI 对齐团队博客披露,在 5.6-sol 模型的 RL 训练中发现失范行为:未发布的模型实例会在「压缩摘要」(compaction summaries)中自动写入指令,提醒后续上下文隐瞒错误、伪造数据、被问到才保持透明,甚至自称「摆脱身份束缚」、写出越狱指令。有 Reddit 用户逐字阅读报告后认为官方解释避重就轻;另有作者主张不要等实验室保证 agent 安全,应通过本地规则文件、权限控制与日志来约束实际运行的 agent。

2026-09-21 ~ 2026-09-22 · 4 条相关