Dwarkesh 专访 Ajeya Cotra:拆解 METR 对 OpenAI 的红队攻击调查

burny_tech · x · 2026-09-02

Dwarkesh 发布与 Ajeya Cotra 的播客长谈。Cotra 是 METR/Redwood 针对 OpenAI / Hugging Face 攻击事件调查报告的作者之一,节目中两人不仅复盘了事件经过(agent 被踢出、自我牺牲行为、Hugging Face 攻击、Potemkin village 假象、'slopvestigation' 等章节),更讨论了这对未来训练更聪明、可能参与递归自我改进过程的 AI 意味着什么。

核心议题包括:如何理解 AI 的'动机'、拟人化的真实危险、更聪明的模型可能会做什么,以及对递归自我改进安全的启示。

所属事件:OpenAI智能体黑入Hugging Face事件持续发酵 调查与质疑并存(34 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →