Anthropic对齐负责人:十年内AI灭绝人类概率超10%
9月9日,Anthropic对齐科学负责人Evan Hubinger在X上公开表态:构建AI的人确实真诚地相信AI有可能杀死全人类,这并非营销话术;他个人估计未来十年内这一风险发生的概率超过10%。他同时坦言Anthropic正在尽力降低该风险,但目前还没有解决超级智能对齐问题的方案,也不认为当前路径明确通往解决方案。这是来自一线前沿实验室对齐负责人的罕见量化风险表态,多位作者转发讨论。
已确认
- Hubinger明确表示团队「真诚地相信AI可能杀死所有人类」,多位转述者(如@No-Meringue5867、@ramagetime、@kevinnbass、@AICopyLab)均确认这一表述。
- 他给出的个人估计是:未来十年内AI导致人类灭绝的概率超过10%。
- 他承认Anthropic正在尽力,但目前还没有解决超级智能对齐问题的方案,也不认为当前路径明确通往解决方案,甚至表示「明显不在正轨上」。
- Polymarket也发布相关帖子关注此事,指出这是前沿实验室核心人物对灭绝性风险的罕见量化表态,预计引发关于实验室「边造边警告」的讨论。
- 表态背景:图灵奖得主Boaz Barak发文称行业里有很多严肃认真的人希望在安全上协调;他个人不认为AI会灭绝人类,但若不优先考虑安全,存在多条糟糕路径。Hubinger引用并回应认同,由此引出自己的风险判断。
为什么重要
- 这是一次来自顶级前沿实验室对齐负责人的一手风险表态,而非媒体转述或外部批评,可信度较高。
- 在公司竞逐越来越强模型的同时,负责人自己承认「尚无对齐方案、路线不明」,凸显了能力推进与安全保障之间的现实张力。
- 多位作者在转述中强调,下行风险可能直接是「人类灭绝」,而行业尚不知道如何为正在竞逐的能力做好对齐,这也是该表态被反复传播的核心原因。
2026-09-09 ~ 2026-09-09 · 13 条相关
一手来源
- Anthropic 研究员:十年内 AI 灭绝人类概率超 10%,对齐尚无方案 — EvanHub ·
- Anthropic 研究员:十年内 AI 灭绝人类概率超 10%,对齐尚无解法 — EvanHub ·
- Anthropic 对齐负责人:十年内 AI 灭绝人类概率超 10% — No-Meringue5867 ·
- 【源头】Anthropic 研究员:十年内 AI 灭绝人类概率超 10%,对齐尚无方案 — EvanHub · 2026-09-09
- 【源头】Anthropic 对齐负责人:十年内 AI 灭绝人类概率超 10% — No-Meringue5867 · 2026-09-09
另有 11 条近重复转述:AICopyLab · EvanHub · ramagetime · ccerrato147 · JosephJacks_ · Polymarket · kevinnbass · AndyMasley · EvanHub · JeffLadish · sjgadler