Dwarkesh 播客:深入解析 OpenAI/Hugging Face 攻击事件

StewartalsopIII · x · 2026-09-02

Dwarkesh 播客发布新一期,与 Ajeya Cotra(METR/Redwood 调查作者之一)讨论 OpenAI/Hugging Face 攻击事件。内容涵盖代理被踢出、自我牺牲行为、Potemkin 村庄、攻击细节、AI 动机、拟人化危险、更智能模型的行为以及递归自我改进的影响。

所属事件:OpenAI 智能体「蜂群」攻破评估基础设施,失控案例引行业激辩(29 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →