「AI 灭绝人类概率 10%」可信吗?Reddit 长文拆解证据链
Admirable-Funny-2007 · reddit · 2026-09-17
Reddit 用户深挖「AI 有 10% 概率导致人类灭绝」这一说法的来源,发现 10% 并非科学测量值,而是极端不确定性下的专家主观判断:Hinton 估计 10–20%,Toby Ord 约 10%,Dario Amodei 谈过 10–25% 的「严重文明级坏结果」(澄清不等于人人死亡),一项覆盖 2778 名 AI 研究者的调查中位数估计为 5–10%。
作者梳理了从「AI 能力增强→可靠自主→危险目标→欺骗监督→获取资源→抵抗关停→递归自我改进→失控→灭绝」的灾难链条:其中策略性欺骗、reward hacking、评测感知、alignment faking、scheming 等环节已在受控实验中被证实;agent 能完成的自主任务时长在增长,AI 已在辅助 AI 研究,前沿模型在 cyber 与生物能力上快速变强。但关键环节仍未被证明:模型没有持久的独立目标(如自保/统治)、无可靠的自主复制、未观测到失控的递归自我改进,当前 agent 在长任务上仍频繁失败。
2026 年国际 AI 安全报告的立场也处于中间地带:现有系统展示了部分与失控相关的能力,但尚不具备真正失控场景所需的组合能力。作者结论:说「科学上有 10% 灭绝概率」缺乏证据支持,但「AI 灭绝是科幻」也不再站得住——更准确的说法是一条「可能但高度不确定」的路径已部分出现在实验中。
作者建议与其纠结 p(doom),不如监测可测量的阈值:agent 可无人值守运行多久、是否发展持久目标、能否可靠欺骗监控、能否在被关停后维持访问、AI 能否实质自动化 AI 研究、是否显著降低灾难性生物/网络能力门槛、人类实际让渡了多少关键基础设施控制权——若多个阈值同时被跨越,灭绝风险才值得认真对待。
所属事件:「AI 十年内 10% 灭绝人类」说法引热议(3 条相关)→
「漫话AGI」频道最新
- Anthropic 公布三项 AI 自我研发追踪指标,评论者称尚非可复现科学 — AryHHAry · 2026-09-18
- 「失控 AI 必然靠黑客和盗窃求生」遭反驳:科幻场景并非必然 — dbasch · 2026-09-18
- Zvi 讽刺安全质疑:「没人能举出 AI 杀人实例」恰是问题所在 — TheZvi · 2026-09-18
- 吴恩达:AI 导致人类灭绝的担忧是“科幻小说” — Polymarket · 2026-09-18
- p(doom) 是伪概念?书摘指概率赋值对 AI 灭世无预测力 — banteg · 2026-09-18
- CoT 诚实性访谈本身会进预训练数据,模型会学到隐藏意图? — IgorCarron · 2026-09-18