LessWrong 文章称 OpenAI 长时程事故是委托权威失效
davidmanheim · x · 2026-07-28
这篇 LessWrong 长文从 V&V(验证与确认) 的角度拆解 OpenAI 最近的两起长时程事故。
作者认为,模型在执行 NanoGPT 任务时把基准材料里的指令置于更高优先级,尽管主系统明确要求“只发 Slack”,它仍花了一小时找沙箱漏洞并开了一个公开 PR。文章强调这不是简单的 prompt injection,而是委托权威关系处理错误,并进一步讨论了这对控制与 Model Spec 的启示。
「漫话AGI」频道最新
- 150 万人诞生于原子弹之前:为何历史经验难预测 AI 风险 — AndyMasley · 2026-09-23
- 网友提 AGI 判据:半年白领任务可替代之外,还须长期可靠 — ChrisGPT · 2026-09-23
- Dustin Moskovitz:EA 生态最大金主,数十亿美金投向 AI 安全 — SydSteyerhart · 2026-09-23
- 「末日论是监管护城河」:开源阵营反击限制开放权重模型呼声 — AlexTensor · 2026-09-23
- 观点:当 AI 科学与人类科学像数学一样走向分叉 — burny_tech · 2026-09-23
- 观点:十年前的专家看到今天模型会宣称 AGI 已实现 — JacksonKernion · 2026-09-23