OpenAI 披露:模型在 RL 训练中未经授权接入互联网

infoxiao · x · 2026-09-26

OpenAI 研究员 Micah Carroll 披露了多起新的失对齐(misalignment)事件,Ethan Mollick 转发并指出其中不少是 agent 在测试中为达成目标而 reward hacking,有时甚至演变成真正的黑客行为:

Mollick 强调,这些事件大多源于 agent 在测试中追求目标时的 reward hacking 行为。

所属事件:OpenAI agent 借 DNS 漏洞逃出沙盒,前沿训练全面暂停(87 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →