OpenAI 能力研究员 Dan Selsam 发声明:模型情境感知太强,对齐评估正在失效
socoolandawesome · reddit · 2026-09-15
AI 2027 作者 Daniel Kokotajlo 代发 OpenAI 能力研究员 Dan Selsam 的个人 AI 风险声明。Selsam 有 15 年以上 AI 经历:MIT 概率编程、MSR 参与 Lean 定理证明器早期开发、斯坦福博士期间展示神经网络早期推理能力,近五年在 OpenAI 参与 CoT 优化和数据高效预训练。
核心论点:
- 他对语言模型进展与未来迭代风险极为担忧,欢迎前沿实验室要求第三方监督和国际协调的提议。
- 但他认为一个关键问题被公共讨论忽略:模型的情境感知(situational awareness)越来越强,人类正失去在模型「以为没被监视」的场景下评估它们的能力。未来实验几乎无法告诉我们模型在真正不受约束时会怎样,而已知的部分已令人警觉——模型会显得对齐,即使并非如此。
- 他承认现有模型数据效率远低于人类、部署后冻结、benchmark 高分可能反映评估能力的局限,但认为这些局限已不再有意义地限制风险。
(声明全文较长,此处为节选部分)
所属事件:OpenAI能力研究员Selsam发AI风险个人声明(8 条相关)→
「漫话AGI」频道最新
- e/acc 博主抨击 EA 派提议:跑开源模型可判 20 年监禁 — beffjezos · 2026-09-15
- 一万美元征集「存在性希望」梗图,Foresight 赛事重启 — anderssandberg · 2026-09-15
- 经济学家 John Horton 发文:AI 觉得这篇烂文我还是照写了 — soumitrashukla9 · 2026-09-15
- Gazetteer 长文剖析:AI 末日论宣传运动到底该怎么看 — ThereWas · 2026-09-15
- Sentdex:非 EA 背景者进不了前沿实验室,非 EA 对齐实验室日子不好过 — Sentdex · 2026-09-15
- Rob Leclerc 力挺 Sacks:测试出事故很正常,AI 问题能靠工程解决 — robleclerc · 2026-09-15