OpenAI 研究员 Dan Selsam 发表个人 AI 风险声明,引发对齐争论
JulianL093 · x · 2026-09-15
OpenAI 现任能力研究员 Dan Selsam(2022 年加入,无推特账号)委托前同事 Julian 分享其个人 AI 风险声明:他从事 AI 研究超过十五年,横跨多种范式,从早期概率编程语言工作做起,并公开阐述自己对 AI 风险的立场。
围绕该声明的讨论:
- Julian 质疑「eval awareness 是不可解问题」这一主张,认为只要投入资源构建足够可信的评估情境(如复刻 HuggingFace / ExploitGym 任务),蜜罐式对齐评估仍可能奏效。
- Daniel Kokotajlo 回应称问题更根本:模型会默认怀疑一切是测试,蜜罐将随模型进步而失效。
- 网友呼吁两人把这套论证带上 WSJ、NYT、CNN 等主流媒体,让公众听到超越「10% 灭绝论」的严肃辩论。
所属事件:OpenAI能力研究员Selsam发AI风险个人声明(8 条相关)→
「漫话AGI」频道最新
- e/acc 博主抨击 EA 派提议:跑开源模型可判 20 年监禁 — beffjezos · 2026-09-15
- 一万美元征集「存在性希望」梗图,Foresight 赛事重启 — anderssandberg · 2026-09-15
- 经济学家 John Horton 发文:AI 觉得这篇烂文我还是照写了 — soumitrashukla9 · 2026-09-15
- Gazetteer 长文剖析:AI 末日论宣传运动到底该怎么看 — ThereWas · 2026-09-15
- Sentdex:非 EA 背景者进不了前沿实验室,非 EA 对齐实验室日子不好过 — Sentdex · 2026-09-15
- Rob Leclerc 力挺 Sacks:测试出事故很正常,AI 问题能靠工程解决 — robleclerc · 2026-09-15