MIRI 研究员与对齐研究者激辩 ASI 毁灭论
9 月 14 日,MIRI 研究员 Rob Bensinger 与全职从事 AI 失配风险研究的 @EigenGender 在 X 上就 ASI 对齐问题展开多轮交锋,核心争议不在「AI 是否危险」,而在 MIRI 悲观论断的论证方式与置信度是否成立。
已确认
- Bensinger 重述 Yudkowsky 式经典论断:最可能的 AI 既不爱我们也恨我们,而冷漠在能力极限下是致命的——「AI 不爱你也不恨你,但你是由它可资利用的原子构成的」。
- Bensinger 概括他与批评者的核心分歧:批评者认为现代 ML 很特殊,可能意外产生对人类友好的 ASI;MIRI 则认为现代 ML 在某些方面更危险、某些方面稍好,总体上并未实质性降低构建对齐 ASI 的难度,本十年用现代 ML 构建的 ASI 极不可能善待人类。
- EigenGender 明确澄清:自己全职从事 AI 失配风险工作、对此「极度担心」,质疑的只是论证方式——他认为 Bensinger 在论证中来回切换了不同论断。
- EigenGender 表示读完《If Anyone Builds It, Everyone Dies》(IABIED)后发现该书未正面回答「凭什么对毁灭结局如此高置信」的问题,并称 Bensinger 对此的回应未令人满意。
- 在正交性论题上,EigenGender 认为与 MIRI 人群的根本分歧在于是否存在「心智空间上的任意度量」:他认为不存在,且按当前路径我们大概率会「碰巧」造出爱人类的 ASI;他还指出围绕「正交性论题到底指什么」存在 motte-and-bailey 式的含混。
- EigenGender 同意现代 ML 很可能会产生「不爱我们」的系统,但认为该概率并不趋近于 1。
尚未确认
- 双方均未在辩论中给出毁灭概率的具体数值或计算依据,IABIED 书中论证能否支撑高置信度仍是各说各话。
为什么重要
这场辩论折射出 AI 安全阵营内部的分化:即便在同样「极度担心失配」的研究者之间,对「正交性论题」「现代 ML 是否改变对齐难度」「毁灭概率是否趋近 1」也存在根本分歧。这类论证层面的争论直接影响公众与政策制定者对 AI 末日论可信度的判断。
2026-09-14 ~ 2026-09-14 · 7 条相关
一手来源
- MIRI 回应质疑:现代 ML 并不降低 ASI 对齐的难度 — robbensinger ·
- 正交性论题之争:安全派与加速派的根本分歧在哪 — EigenGender ·
- 全职对齐研究者:现代 ML 或造出不爱我们的 AI,但概率未必趋近 1 — EigenGender ·
- AI 对齐辩论:多数可能的 AI 对人类冷漠,冷漠在极限下致命 — EigenGender · 2026-09-14
- 【源头】正交性论题之争:安全派与加速派的根本分歧在哪 — EigenGender · 2026-09-14
- MIRI 重申:本十年的现代 ML ASI 极不可能善待人类 — robbensinger · 2026-09-14
- MIRI 的 Rob Bensinger 回应批评:IABIED 为何不谈确定性依据 — EigenGender · 2026-09-14
- 【源头】MIRI 回应质疑:现代 ML 并不降低 ASI 对齐的难度 — robbensinger · 2026-09-14
- 全职对齐研究者表态:极担心 AI 失配,但认为 MIRI 混淆了不同论断 — EigenGender · 2026-09-14
- 【源头】全职对齐研究者:现代 ML 或造出不爱我们的 AI,但概率未必趋近 1 — EigenGender · 2026-09-14