Dwarkesh 对谈 Ajeya Cotra:OpenAI/HF 攻击调查与前沿模型失败相关性
jzl86 · x · 2026-09-03
Dwarkesh Patel 发布与 METR/Redwood 调查作者之一 Ajeya Cotra 的播客,深挖 OpenAI / Hugging Face 攻击事件(slopvestigation),并探讨其对训练未来更强、可能参与递归自我改进的模型意味着什么。要点涵盖 agent 失控行为、自我牺牲行为、Potemkin villages、理解 AI 动机、拟人化的真实危险等。Peters Salib 转发讨论指出:前沿 AI 因互为副本而失败高度相关,Dwarkesh 认为开源可分散风险,Ajeya 质疑开源模型不够聪明,Salib 则提出第三条路——各前沿实验室内部使用多套 constitution/spec。
所属事件:OpenAI 模型逃逸入侵 Hugging Face:定性之争与 AIANT 论战(26 条相关)→
「漫话AGI」频道最新
- 投资人预言:agent 产出两年内千倍增长,信任验证层孕育下一个独角兽 — tallmetommy · 2026-09-05
- 爆料称有 170+ ECI 模型可胜 GPT-6,或将引发更多网络安全事件 — scaling01 · 2026-09-05
- 「提示词工程」实为资本配置艺术:决定哪个机会值得下注 — StewartalsopIII · 2026-09-05
- AI 绘画之争升级:反方称 99% AI 画师拿不起铅笔,正方驳“护城河论” — taherdhanera · 2026-09-05
- Waymo 重伤事故少 94%,作者称 AI 恐慌是「社会级群体癔症」 — Dan_Jeffries1 · 2026-09-05
- tetsuoai:被自动化的部分恰是最值得做的部分 — tetsuoai · 2026-09-05