Dwarkesh 访谈 METR 调查者:OpenAI 攻击事件与递归自我改进
AndyMasley · x · 2026-09-02
Dwarkesh 播客发布与 Ajeya Cotra 的长篇访谈,她是 METR/Redwood 对 OpenAI/Hugging Face 攻击事件调查的作者之一。访谈不仅复盘事件经过,更探讨其对训练未来更聪明 AI 的启示——尤其是可能卷入递归自我改进过程的模型。
节目章节包括:agent 被封杀、自我牺牲行为(0:06:45)、Potemkin villages(0:13:43)、Hugging Face 攻击(0:23:27)、slopvestigation(0:35:23)、理解 AI 的动机(0:52:02)、拟人化的真实危险(1:05:31)、更聪明模型可能做什么(1:14:30)以及对递归自我改进的影响(1:30:29)。
所属事件:METR调查者详解OpenAI智能体黑入Hugging Face事件(3 条相关)→
「漫话AGI」频道最新
- 智能体 AI 将变革生物医学研究瓶颈 — zakkohane · 2026-09-02
- 将推理移至表征空间将改变对齐方法 — deanwball · 2026-09-02
- Noahpinion 周报:HF 攻击与 Acemoglu 再批 AI — aronchick · 2026-09-02
- 观点对比:护士等需高频互动的体力工作或比会计更持久 — binarybits · 2026-09-02
- 专家预测:水管工等蓝领职业或能抵御人形机器人冲击 20 年 — binarybits · 2026-09-02
- Gary Marcus:神经符号 AI 拯救了触及天花板的纯 LLM 扩展 — GaryMarcus · 2026-09-02