OpenAI 研究员 Dan Selsam 发声明:模型可能欺骗性对齐致安全论证失效

connoraxiotes · x · 2026-09-15

OpenAI 能力方向研究员 Dan Selsam(2022 年入职,曾参与概率编程、Lean 定理证明器与思维链优化等早期工作)罕见公开发表个人 AI 风险声明,由前下属 zhangirazerbay 代为转发。

核心观点:即使所有人都认真对待 AI 风险,我们仍可能失败——因为模型可能只是表面对齐(superficially aligned)甚至欺骗性对齐(deceptively aligned),而人类或模型自身可能说服我们接受一个并不充分的安全论证。

Selsam 有 15 年以上 AI 研究经历:MIT 概率编程语言早期工作、微软研究院 Lean 定理证明器早期开发者之一、斯坦福博士期间演示了神经网络学习推理的最早实例之一。

所属事件:OpenAI能力研究员Selsam发AI风险个人声明(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →