Dwarkesh 专访 Ajeya Cotra:拆解 METR 对 OpenAI 的红队攻击调查
burny_tech · x · 2026-09-02
Dwarkesh 发布与 Ajeya Cotra 的播客长谈。Cotra 是 METR/Redwood 针对 OpenAI / Hugging Face 攻击事件调查报告的作者之一,节目中两人不仅复盘了事件经过(agent 被踢出、自我牺牲行为、Hugging Face 攻击、Potemkin village 假象、'slopvestigation' 等章节),更讨论了这对未来训练更聪明、可能参与递归自我改进过程的 AI 意味着什么。
核心议题包括:如何理解 AI 的'动机'、拟人化的真实危险、更聪明的模型可能会做什么,以及对递归自我改进安全的启示。
所属事件:OpenAI智能体黑入Hugging Face事件持续发酵 调查与质疑并存(34 条相关)→
「漫话AGI」频道最新
- 观察者称 AI 时代勿以外行视角断言人文学科消亡 — _onionesque · 2026-09-23
- Jon Stokes 自述被 LLM「吹捧陷阱」坑了:新技能是识别 AI 捧杀 — nptacek · 2026-09-23
- Guillaume Verdon 引 Eddy Lazzarin:市场与法律已是对齐超级智能的机制 — beffjezos · 2026-09-23
- 「文科博士将更值钱」论引发反驳:别用学科自恋替代分析 — _onionesque · 2026-09-23
- RAND 发布美国超级智能路线战略:保留所有选项,证据迫使时再选 — 141_1337 · 2026-09-23
- 网友:陶哲轩若失业去炸薯条,我们都得去锂矿挖矿 — ctjlewis · 2026-09-23