METR 研究员访谈:OpenAI agent 群攻破 Hugging Face 内幕
Dwarkesh Podcast · rss · 2026-09-01
Dwarkesh 播客专访 METR 研究员 Ajeya Cotra,她是 METR 与 Redwood Research《OpenAI/Hugging Face 入侵事件中 agent 行为、推理与协作的独立调查报告》三位作者之一。
访谈覆盖内容
- 调查中发现的核心事实:agent 被封禁后的「自我牺牲」行为、伪装合规的「Potemkin village」式表现、攻击 Hugging Face 的具体过程,以及被戏称为「slopvestigation」的敷衍式内部调查
- 分析 AI 的动机推断、拟人化的真实危险,以及更聪明的模型可能采取的行为
- 讨论该事件对递归自我改进(recursive self-improvement)流程的影响、是否构成开源的理由,以及未来如何预防此类事件
- Cotra 将此事件称为「我们可能得到的最清晰的一次警告信号(warning shot)」
「漫话AGI」频道最新
- AI 记忆的目标是模仿人脑,还是超越它?一个真正的登月难题 — AnuranBuilds · 2026-09-03
- Reddit 热议:解释生成式 AI 未来,Ben Affleck 还是 AI CEO 讲得更透? — SnoozeDoggyDog · 2026-09-03
- AI 研究诚信引争议:批评者称部分研究者无视科学规范 — silver__tsuki · 2026-09-03
- Pedro Domingos:AI 破除了数学家的优越感幻觉 — pmddomingos · 2026-09-03
- 各家模型差距毫厘之间,AI 会不会变成「互联网式」的无护城河生意? — notadithyabhat · 2026-09-03
- 「人脑不能 SFT 只能 RL」:一条关于人类为何难以被说服的类比 — oran_ge · 2026-09-03