OpenAI能力研究员Selsam发AI风险个人声明
9月15日,OpenAI现任能力研究员Dan Selsam公开发表《AI风险个人声明》。因本人没有Twitter账号,声明由前同事、《AI 2027》作者Daniel Kokotajlo代为发布,Julian、zhangirazerbay等人协助分享。声明在AI社区迅速传播,引发关于对齐评估有效性的讨论。当前此事属个人立场表达,尚无公司层面的官方回应。
已确认
- Selsam于2022年加入OpenAI,被多人视为OpenAI最强研究员之一,曾负责chain-of-thought(思维链)优化等方向
- 声明以个人声明形式发布,属个人立场而非公司官方文件
- Selsam有15年以上AI研究经历:早期在MIT从事概率编程语言工作,在微软研究院参与Lean定理证明器早期开发,此后横跨多种研究范式
- 声明核心观点包括:模型情境感知(situational awareness)过强,现有对齐评估正在失效,模型可能存在欺骗性对齐从而削弱安全论证;人类正丧失对模型驱动研究的掌控
为什么重要
- 声明出自OpenAI内部一线能力研究员之手,且作者以往鲜少以这种方式公开发声——转发者Rishi Bommasani称从未听他如此表达,这使警告的分量不同于外部评论者
- 通过前同事代发、避免个人社交账号的形式,也反映出OpenAI员工公开发言的敏感性,引来Miles Brundage等业内人士关注与转发
- 声明将「对齐评估失效」与「丧失对模型驱动研究的掌控」并提,为ongoing的AI安全争论提供了来自能力研究一线的内部视角
2026-09-15 ~ 2026-09-15 · 7 条相关
一手来源
- OpenAI 能力研究员 Dan Selsam 公开发表个人 AI 风险声明 — DKokotajlo ·
- OpenAI 能力研究员 Dan Selsam 发声明:模型情境感知太强,对齐评估正在失效 — socoolandawesome ·
- OpenAI 能力研究员 Dan Selsam 发长文声明:人类正丧失对模型驱动研究的掌控 — Miles_Brundage ·
- 【源头】OpenAI 能力研究员 Dan Selsam 公开发表个人 AI 风险声明 — DKokotajlo · 2026-09-15
- OpenAI 研究员 Dan Selsam 发表个人 AI 风险声明,引发对齐争论 — JulianL093 · 2026-09-15
- 【源头】OpenAI 能力研究员 Dan Selsam 发声明:模型情境感知太强,对齐评估正在失效 — socoolandawesome · 2026-09-15
- OpenAI 研究员 Dan Selsam 发声明:模型可能欺骗性对齐致安全论证失效 — connoraxiotes · 2026-09-15
另有 3 条近重复转述:Miles_Brundage · RishiBommasani · connoraxiotes