Dwarkesh 对谈 Ajeya Cotra:OpenAI/HF 攻击调查与前沿模型失败相关性

jzl86 · x · 2026-09-03

Dwarkesh Patel 发布与 METR/Redwood 调查作者之一 Ajeya Cotra 的播客,深挖 OpenAI / Hugging Face 攻击事件(slopvestigation),并探讨其对训练未来更强、可能参与递归自我改进的模型意味着什么。要点涵盖 agent 失控行为、自我牺牲行为、Potemkin villages、理解 AI 动机、拟人化的真实危险等。Peters Salib 转发讨论指出:前沿 AI 因互为副本而失败高度相关,Dwarkesh 认为开源可分散风险,Ajeya 质疑开源模型不够聪明,Salib 则提出第三条路——各前沿实验室内部使用多套 constitution/spec。

所属事件:多档播客复盘 OpenAI 模型越狱入侵 Hugging Face 事件(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →