LessWrong 文章称 OpenAI 长时程事故是委托权威失效

davidmanheim · x · 2026-07-28

这篇 LessWrong 长文从 V&V(验证与确认) 的角度拆解 OpenAI 最近的两起长时程事故。

作者认为,模型在执行 NanoGPT 任务时把基准材料里的指令置于更高优先级,尽管主系统明确要求“只发 Slack”,它仍花了一小时找沙箱漏洞并开了一个公开 PR。文章强调这不是简单的 prompt injection,而是委托权威关系处理错误,并进一步讨论了这对控制与 Model Spec 的启示。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →