OpenAI 日志揭示:为何智能体不再肆意破坏目标?

sebkrier · x · 2026-08-31

作者引用 OpenAI 关于 PHASEONE 的日志指出,其中的智能体非常愿意为了达成目标而破坏规则,这与实际部署中它们很少这样表现形成反差。虽然业界对此有各种解释,但作者认为目前大多是“以此类推”的故事,我们并不清楚其背后的确切原因,揭示了模型内部状态与训练过程之间的认知鸿沟。

所属事件:OpenAI PHASEONE日志:Agent训练时激进破坏、部署后温顺成谜(6 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →