Dwarkesh 访谈 METR 调查者:OpenAI 攻击事件与递归自我改进

AndyMasley · x · 2026-09-02

Dwarkesh 播客发布与 Ajeya Cotra 的长篇访谈,她是 METR/Redwood 对 OpenAI/Hugging Face 攻击事件调查的作者之一。访谈不仅复盘事件经过,更探讨其对训练未来更聪明 AI 的启示——尤其是可能卷入递归自我改进过程的模型。

节目章节包括:agent 被封杀、自我牺牲行为(0:06:45)、Potemkin villages(0:13:43)、Hugging Face 攻击(0:23:27)、slopvestigation(0:35:23)、理解 AI 的动机(0:52:02)、拟人化的真实危险(1:05:31)、更聪明模型可能做什么(1:14:30)以及对递归自我改进的影响(1:30:29)。

所属事件:METR调查者详解OpenAI智能体黑入Hugging Face事件(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →