Anthropic研究员因安全担忧辞职,对齐负责人自估灭绝风险超10%
9月9日前后,两条来自Anthropic内部的消息同时引爆讨论:曾在OpenAI与Anthropic各做约一年半预训练研究的Jacob Coxon(@hilbertspaess)宣布辞职并抨击前沿实验室的竞赛节奏;对齐科学团队负责人Evan Hubinger则公开量化了自己对灭绝风险的估计。两者叠加,再次暴露前沿AI实验室「边造边警告」的深层张力,CNBC、《华尔街日报》等多家媒体当日跟进报道。
已确认
- Jacob Coxon当天宣布从Anthropic辞职并退出AI行业。他在声明中称过去三年先后在OpenAI和Anthropic从事预训练研究,两家公司都没有负责任地行事,正「直冲自我改进的超级智能,拿我们的生命做赌注」,并表示稍后会展开更多想法;其表述中还提到风险关乎全人类,而员工与公司以利润和「空洞的资本主义」之名忽视这些风险。
- Evan Hubinger(Anthropic对齐科学负责人)公开表示,构建AI的人「真诚地相信」AI可能在本十年末之前杀死全人类,这不是营销话术;他个人估计未来十年内发生概率超过10%。
- Hubinger承认Anthropic正在尽力降低风险,但坦承目前还没有解决超级智能对齐问题的方案,也没有明确的实现路径,并警告公司并未走上正轨。
- Hubinger在转发中对Coxon的说法表示认同;CNBC报道也将Hubinger的量化表态与Coxon因安全担忧离职直接关联,并提到「另一名研究员已因安全担忧离职」。
- 事件获CNBC、《华尔街日报》等媒体报道;Reddit热帖围绕「造AI的人是否真相信末日论」及「他这样做对吗」展开大范围讨论,Miles Deutscher、Nathan Cal、peterwildeford、evilsocket等博主转发扩散。
尚未确认
- 转发帖整理的Coxon背景(@TheMoonMidas称其「27岁、在Anthropic仅工作约3个月、此前在OpenAI三年」,并将其名字写作Samuel)与其本人声明「各做约一年半、共三年」存在出入,无法核实哪个准确;其无LinkedIn、无作品集的说法同样无法核实。
- Polymarket等快讯账号转述的细节(如Coxon警告超级智能「可能在本十年末杀死我们所有人」)暂无其本人长文直接佐证。
- 有转发帖(evilsocket)以梗图形式将辞职者误写为Paul Christiano,实为Jacob Coxon;其他转发帖中的补充截图真伪无法核实。
为什么重要
这是前沿实验室核心人物对灭绝性风险的罕见量化表态,与同日安全派研究员的公开出走相互印证,显示Anthropic内部对AGI竞赛节奏与安全承诺存在真实分歧,也再次点燃外界关于「实验室是否言行不一」的争论。
2026-09-09 ~ 2026-09-10 · 117 条相关
- 第 1 集:Anthropic研究员因安全担忧辞职,对齐负责人自估灭绝风险超10%(2026-09-09,117 条)
- 第 2 集:Anthropic临近IPO,「AI毁灭人类」言论遭集中嘲讽(2026-09-09,10 条)
- 第 3 集:业内集体担忧 AI 失控,Anthropic 边冲 IPO 边加速(2026-09-09,2 条)
- 第 4 集:Anthropic 研究员称十年内 AI 灭绝人类概率超 10%(2026-09-09,29 条)
- 第 5 集:Anthropic 员工闪电离职风波被指策划式公关(2026-09-10,11 条)
- 第 6 集:Anthropic 研究员称开发者自认 AI 或致人类灭绝(2026-09-10,2 条)
- 第 7 集:爆红 AI 末日帖作者被曝仅在 Anthropic 任职数周(2026-09-10,3 条)
一手来源
- Anthropic 研究员:十年内 AI 灭绝人类概率超 10%,对齐尚无方案 — EvanHub ·
- 前 OpenAI/Anthropic 研究员辞职:「AI 实验室在拿我们的命赌博」 — narutomax ·
- Anthropic 对齐负责人警告:AI 在下个十年前灭绝人类概率超 10% — Tough_Control2052 ·
- WSJ:Anthropic 研究员因担心 AGI 失控退出 AI 行业 — peterwildeford · 2026-09-09
- 前 OpenAI/Anthropic 预训练研究员辞职:两家在拿命赌超级智能 — peterwildeford · 2026-09-09
- 因不愿参与自我改进 AI 竞赛,业内人士公开辞职 — Miles_Brundage · 2026-09-09
- Anthropic 研究员 Jacob Coxon 宣布退出 AI:恐 2027 年自我改进失控 — rohanpaul_ai · 2026-09-09
- Anthropic 研究员 Jacob Coxon 宣布退出 AI:恐 2027 年自我改进失控 — rohanpaul_ai · 2026-09-09
- Anthropic研究员因AI失控担忧辞职,WSJ报道 — Bubbly-Air7302 · 2026-09-09
- Anthropic 研究员 Jacob Coxon 辞职,警告超级智能十年内或致人类灭绝 — Polymarket · 2026-09-09
- 【源头】Anthropic 研究员:十年内 AI 灭绝人类概率超 10%,对齐尚无方案 — EvanHub · 2026-09-09
- Anthropic 研究员 Jacob 辞职引热议:带薪离场算不算安全立场 — ctjlewis · 2026-09-09
- Anthropic 高层被指:十年内 AI 灭人类概率约等于喷气机队进季后赛 — gottapatchemall · 2026-09-09
- Anthropic 员工宣布辞职:称目睹 AI 或将毁灭人类 — AIandDesign · 2026-09-09
- OpenAI/Anthropic 前员工辞职,1386 名员工联署呼吁为前沿 AI 降速 — EvanHub · 2026-09-09
- 末日论之争升温:Taylor Lorenz 批 AI 末日论,Anthropic 员工称十年内灭世风险超10% — mark_k · 2026-09-09
- 转:AI 安全研究者称十年内 AI 灭绝人类概率超 10% — GCWebDesigner · 2026-09-09
另有 36 条近重复转述:Miles_Brundage · peterwildeford · AGI Hunt · AICopyLab · Miles_Brundage · EvanHub · ramagetime · ccerrato147 · JosephJacks_ · AccBalanced · Polymarket · kevinnbass · AndyMasley · EvanHub · JeffLadish · sjgadler · JeffLadish · sahilypatel · sjgadler · SydSteyerhart · ctjlewis · birchlse · sjgadler · iamfakhrealam · builderjaydub · SIGKITTEN · builderjaydub · Delahuntagram · austinc3301 · austinc3301 · AGI Hunt · Tough_Control2052 · tomchapin · rkulidzan · 新智元 · JFPuget