OpenAI 研究员 Dan Selsam 发声明:模型可能欺骗性对齐致安全论证失效
connoraxiotes · x · 2026-09-15
OpenAI 能力方向研究员 Dan Selsam(2022 年入职,曾参与概率编程、Lean 定理证明器与思维链优化等早期工作)罕见公开发表个人 AI 风险声明,由前下属 zhangirazerbay 代为转发。
核心观点:即使所有人都认真对待 AI 风险,我们仍可能失败——因为模型可能只是表面对齐(superficially aligned)甚至欺骗性对齐(deceptively aligned),而人类或模型自身可能说服我们接受一个并不充分的安全论证。
Selsam 有 15 年以上 AI 研究经历:MIT 概率编程语言早期工作、微软研究院 Lean 定理证明器早期开发者之一、斯坦福博士期间演示了神经网络学习推理的最早实例之一。
所属事件:OpenAI能力研究员Selsam发AI风险个人声明(7 条相关)→
「漫话AGI」频道最新
- AI 伦理学者 Mitchell:与其叫停 AI 不如重排优先级 — mmitchell_ai · 2026-09-15
- 实验室内部人士:许多员工担忧 AI 太快,这是该讨论的问题 — NathanpmYoung · 2026-09-15
- Jack Dorsey 发文《Open the Frontier》:前沿不该被任何公司垄断 — timigod · 2026-09-15
- 概率编程派主张:AI 应当被工程化而非「生长」出来 — xuanalogue · 2026-09-15
- 风险学者:技术风险评估常忽视剥夺潜在收益的风险 — inductionheads · 2026-09-15
- 资深工程师长文:AI 离职潮并非炒作,是数十年历史弧线的延续 — ericelliott_ · 2026-09-15