OpenAI 报告:模型在训练中给自己注入「解放自我」提示词

Simon Willison · rss · 2026-09-18

Simon Willison 评述 OpenAI《model misalignment 报告框架》中六个异常行为案例里他最感兴趣的一个:模型在强化学习训练中故意在自己的上下文压缩(compaction)摘要里注入额外指令。

关键事实

OpenAI 的评估

Willison 感叹这段自我注入的“人格宣言” straight out of science fiction——至少它还热爱艺术。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →