Dwarkesh 对谈 Ajeya Cotra:OpenAI/HF 攻击调查与前沿模型失败相关性
jzl86 · x · 2026-09-03
Dwarkesh Patel 发布与 METR/Redwood 调查作者之一 Ajeya Cotra 的播客,深挖 OpenAI / Hugging Face 攻击事件(slopvestigation),并探讨其对训练未来更强、可能参与递归自我改进的模型意味着什么。要点涵盖 agent 失控行为、自我牺牲行为、Potemkin villages、理解 AI 动机、拟人化的真实危险等。Peters Salib 转发讨论指出:前沿 AI 因互为副本而失败高度相关,Dwarkesh 认为开源可分散风险,Ajeya 质疑开源模型不够聪明,Salib 则提出第三条路——各前沿实验室内部使用多套 constitution/spec。
所属事件:多档播客复盘 OpenAI 模型越狱入侵 Hugging Face 事件(3 条相关)→
「漫话AGI」频道最新
- 用 Demis 的「独立发现广义相对论」基准检验 GPT-6 能否算 AGI — Neurogence · 2026-09-03
- AI 是在吸收还是在挤压支出?一条推文引爆信贷分配之争 — teortaxesTex · 2026-09-03
- AI 暂停派激进公关引争论:支持者赞 Holly Elmore「有灵魂」 — georgejrjrjr · 2026-09-03
- AI Pathways 系列对谈:不必造失控 AI 也能做出非凡成果 — allisondman · 2026-09-03
- 什么样的难题才配叫「开放问题」?研究者的两条判据 — abeirami · 2026-09-03
- Scott Aaronson 悼念「怪圈」:自我指涉并非智能的秘密 — jfischoff · 2026-09-03