专题 · FULL STORY

Anthropic研究员离职与AI灭绝风险警告

9月9日,Anthropic对齐团队负责人Evan Hubinger公开量化AI灭绝风险,同日一位预训练研究员因安全担忧离职并警告灭绝概率超10%,引发业内对模型加速冲向自我改进的集体恐慌与讨论。

2026-09-09 ~ 2026-09-10 · 2 集 · 90 条

第 1 集 · Anthropic 安全研究员离职,警告 AI 灭绝人类概率超 10%(2026-09-09,88 条)

9月9日,Anthropic内部围绕AI生存风险的两条消息同时引爆讨论:对齐科学团队负责人Evan Hubinger公开量化了自己对灭绝风险的估计,而一位预训练研究员宣布辞职并抨击前沿实验室的竞赛节奏。两者叠加,再次暴露出前沿AI实验室「边造边警告」的深层张力,Forbes、CNBC、WSJ等多家媒体当日跟进报道。

已确认

  • Evan Hubinger(Anthropic对齐科学负责人)公开表示,构建AI的人「真诚地相信」AI可能在本十年末之前杀死全人类,这不是营销话术;他个人估计未来十年内发生概率超过10%。
  • Hubinger承认Anthropic正在尽力降低风险,但坦承目前还没有解决超级智能对齐问题的方案,也没有明确的实现路径,并警告公司并未走上正轨。
  • 研究员Jacob Coxon(@hilbertspaess)当天宣布从Anthropic辞职。他过去三年先后在OpenAI和Anthropic从事预训练研究,声明中批评两家公司都没有负责任地行事,正「直冲自我改进的超级智能,拿我们的生命做赌注」;他在推文串中还提到风险关乎全人类,而员工与公司却以利润和「空洞的资本主义」之名忽视这些风险。转发讨论中Nathan Callmeier等人亦有回应。
  • Hubinger在后续转发中对Coxon的说法表示认同,称「我们真的真诚相信」,印证了内部风险信念的真实性;另有转发帖配图称展示了「AI试图杀死所有人类时如何阻止」的计划文件,其真实性存疑。
  • 该事件获Forbes、CNBC、WSJ等多家媒体报道;Reddit热帖围绕「造AI的人是否真相信末日论」引发大范围讨论,X上Taylor Lorenz等人对AI末日论的批评与Hubinger的量化表态形成交锋。

尚未确认

  • Polymarket账号称Coxon警告超级智能「可能在本十年末杀死我们所有人」,系快讯转述,暂无其本人长文直接佐证。
  • 转发帖中出现的「泄露机密计划」截图无法核实真伪。

为什么重要

这是前沿实验室核心人物对灭绝性风险的罕见量化表态,与同日安全派研究员的公开出走相互印证,显示Anthropic内部对AGI竞赛节奏与安全承诺存在真实分歧,也再次点燃了外界关于「实验室是否言行不一」的争论。

还有 68 条相关讨论 →

第 2 集 · 业内集体担忧 AI 失控,Anthropic 边冲 IPO 边加速(2026-09-09,2 条)

一篇五条长推的线程盘点 AI 圈对「模型加速冲向自我改进」的集体恐惧:一位 Anthropic 离职研究员公开称 Anthropic 和 OpenAI 都在不负责任地竞逐自我改进的超级智能,拿人命赌博。AI 评论者 eyishazyer 在结尾发出尖锐判断——当你在一个无法召回的系统上竞速,而终点线却是一场 IPO 路演时,这场竞赛本身就是错误。