专题 · FULL STORY
Anthropic 研究员辞职掀 AI 灭绝风险风波
9 月 9 日起,前研究员 Jacob Coxon 等人相继从 Anthropic 辞职并公开警告两大实验室正「拿命赌超智能」,引发议员与媒体跟进;Anthropic 发声明回应反被批公关话术,多位内部人士接连给出 10% 至 70% 的灭绝风险估计,争议持续发酵。
2026-09-09 ~ 2026-09-11 · 11 集 · 258 条
第 1 集 · Anthropic 研究员辞职警告两大实验室「拿命赌超智能」,引爆争议(2026-09-09,217 条)
前OpenAI研究员Jacob Coxon从Anthropic高调辞职,公开警告OpenAI与Anthropic都在冲向自我改进的超智能、「拿人命赌博」,并称各AI公司没有治理政策、正竞相造出自己无法控制的系统。其辞职帖24小时内收获约1.2亿浏览,登上TIME、Variety、WSJ,并先后出现在Fox News黄金时段与CNN Anderson Cooper 360节目中——他在CNN上称最可怕的场景是AI被用来让自身变得更聪明。事件随即分裂成两股讨论:一方质疑这是一场精心协调、资金充足的公关造势,连Elon Musk也下场推广「监管卧底」阴谋论;另一方则在安全圈探讨「离职发声」为何成为传导AI风险最有效的方式。
已确认
- 传播链路疑点由保守派评论者Parker Thayer等人及Reddit长帖列出:WSJ在Coxon发帖前18分钟刊出独家专访;其账号此前几乎无粉丝与活动记录,发帖后数小时内获数万转发、涨粉10万以上;Jordan Schachtel称其所有社交账号同一天出现。Coxon辞职后密集接受Fox News与CNN采访,有用户质疑其媒体曝光节奏像协调好的造势,并追问推动AI监管的声浪可能让Anthropic受益,应查证是否存在协调。
- 据Politico记者报道,Elon Musk在X上推广阴谋论称Coxon是亲AI监管运动的「卧底」,引发业内回击;MilesBrundage说明Coxon确实曾在OpenAI和Anthropic两家做预训练研究。Coxon自述三年间先后在两家公司做预训练,两家都没有负责任地行事。Reddit亦有讨论帖将其辞职概括为「因担心各实验室竞相造出无法控制的系统而退出AI行业」。
- Axios独家报道Coxon为离职放弃了手中股权;zerohedge转述时强调其「入职才六周」,Ethan Perez回应称其离职前对Anthropic的进展速度感到担忧。Gary Marcus指出风波中的抹黑操作「不干净」:唯一经核实的信源(Axios等直接采访)报道其任职约4个月,但多个高流量账号将其改写为更短的「六周」以强化「闪电离职」叙事;另有整理帖称其27岁、无LinkedIn无作品集、在Anthropic仅约3个月——各版本数字并不一致。
- 与辞职事件几乎同期,Anthropic对齐团队负责人Evan Hubinger(EvanHub)公开表态:构建AI的人「真诚地相信AI可能杀死全人类,这不是营销话术」,他个人估计未来十年内发生概率超过10%,并坦承目前还没有解决超级智能对齐问题的方案、公司未走上正轨。CNBC、BBC报道此言论,Axios报道称共有三名Anthropic研究员公开警告失控AI可能在本十年内毁灭人类,构成前沿实验室内部罕见的高调集体表态。反方叙事同步升级:Daniel Jeffries发长文称末日论反AI组织本质是「恐怖细胞」、层层转移资金并在AI公司安插「沉睡者」,还点名Coxon收取了2万美元;Wes Roth发布长视频梳理「AI恐慌」背后的暗钱网络。
- 多条转发帖给出更朴素解释:此人在OpenAI工作三年后幻灭,出于认同加入Anthropic,入职后发现两家同质化竞争而离职,阴谋论系过度渲染;Garry Tan亦回击了「有组织施压行动」的说法。安全圈一侧,Kelsey Tuoc认为离职发声的巨大反响应让心存忧虑的员工反思;birchlse指出辞职者的警报无法轻率归因于商业动机,是「AI圈外的人也能听懂的诚实信号」;jachiam0解释刷屏原因在于警告指向整个行业、时机与可信度俱佳;Danielle Fong玩梗「至少没人从Grok辞职」。同期Paul Christiano进入OpenAI董事会,被评论者与Daniel Kokotajlo辞职等并列列为AI风险「全民话题化」的标志性一天。
尚未确认
- 「资金充足的协调PR行动」指控目前只有时间线巧合与账号数据等间接证据,没有直接证据证明预谋或金主协调;Garry Tan已公开反驳,NathanpmYoung指出幕后小团体与发布前的正常「协调」是两回事。Musk的「卧底」说法、Jeffries关于「恐怖细胞」资金网络与Coxon收取2万美元的具体指控均属单方陈述,帖内未见信源佐证;Wes Roth的「暗钱」梳理同样属个人综述视角。
- Coxon确切任职时长存在约4个月、约六周、约3个月三种说法,Gary Marcus以Axios直接采访为准,但短时长版本已广为流传。
为什么重要
- 这场风波同时触及AI安全治理的两个核心问题:其一,内部吹哨与公开离职哪种方式更能有效传导风险信号——离职「不可归因于商业动机」的特质使其成为公众理解AI风险最直观的叙事;其二,当离职发声与媒体节奏高度耦合、其舆论效果又可能利于特定政策议程时,其可信度本身也会被政治化质疑。Hubinger作为在职对齐负责人亲自给出「超10%灭绝概率」的估计,且Axios显示共有三名Anthropic研究员同步发声,使风波从单一离职事件上升为实验室内部风险共识的公开化展示;而Musk推广阴谋论、Gary Marcus揭示的任职时长篡改与Jeffries等人的「暗钱」叙事,表明争议双方都可能在未经核实的情况下放大失实信息,忧心员工面临「是否用脚投票」与现实声誉风险的双重压力。
- WSJ:Anthropic 研究员因担心 AGI 失控退出 AI 行业 — peterwildeford · 2026-09-09
- WSJ:Anthropic 研究员因担心失控竞赛退出 AI 行业 — Miles_Brundage · 2026-09-09
- 前 OpenAI/Anthropic 预训练研究员辞职:两家在拿命赌超级智能 — peterwildeford · 2026-09-09
- 因不愿参与自我改进 AI 竞赛,业内人士公开辞职 — Miles_Brundage · 2026-09-09
- OpenAI/Anthropic 前预训练研究员辞职:两巨头在赌上人类性命冲超级智能 — peterwildeford · 2026-09-09
- Anthropic 研究员 Jacob Coxon 宣布退出 AI:恐 2027 年自我改进失控 — rohanpaul_ai · 2026-09-09
- Anthropic 研究员 Jacob Coxon 宣布退出 AI:恐 2027 年自我改进失控 — rohanpaul_ai · 2026-09-09
- Anthropic研究员因AI失控担忧辞职,WSJ报道 — Bubbly-Air7302 · 2026-09-09
- Anthropic 研究员 Jacob Coxon 辞职,警告超级智能十年内或致人类灭绝 — Polymarket · 2026-09-09
- Anthropic 研究员:十年内 AI 灭绝人类概率超 10%,对齐尚无方案 — EvanHub · 2026-09-09
- 前 OpenAI/Anthropic 预训练研究员 Jacob Coxon 辞职退出 AI 行业 — AGI Hunt · 2026-09-09
- Anthropic 研究员:十年内 AI 致人类灭绝概率超 10% — AICopyLab · 2026-09-09
- 在 OpenAI 和 Anthropic 做预训练三年后,这位研究员宣布辞职 — Miles_Brundage · 2026-09-09
- Anthropic 研究员:十年内 AI 灭绝人类概率超 10%,对齐尚无解法 — EvanHub · 2026-09-09
- Anthropic 研究员承认:十年内 AI 致人类灭绝概率超 10%,对齐尚无解法 — ramagetime · 2026-09-09
- 网友调侃 Anthropic 员工无法停止宣扬「AI 消灭所有工作」论调 — toptickcrypto · 2026-09-09
- Anthropic 研究员:十年内 AI 灭绝人类概率超 10%,对齐尚无方案 — ccerrato147 · 2026-09-09
- Anthropic 研究员:十年内 AI 灭人风险超 10%,尚无对齐方案 — JosephJacks_ · 2026-09-09
- Anthropic 研究员 Evan Hubinger:十年内 AI 灭绝人类概率超 10% — Bonecondor · 2026-09-09
- Anthropic 研究员 Jacob 辞职引热议:带薪离场算不算安全立场 — ctjlewis · 2026-09-09
第 2 集 · Anthropic临近IPO,「AI毁灭人类」言论遭集中嘲讽(2026-09-09,10 条)
随着 Anthropic 临近 IPO(预计市值高达 2.5 万亿美元),其高层「AI 可能毁灭人类」式的公开表态在 X 上引发一波密集嘲讽与质疑,争论核心是 AI 安全叙事与商业逐利之间的自相矛盾。
已确认
- scaling01 指出,Anthropic 的现任与离职员工公开发帖称「真诚地相信 AI 可能毁灭全人类」,而公司即将进行的 IPO 预计市值高达 2.5 万亿美元,并讽刺等到真正上市时估值恐怕还要更高。
- Marc Andreessen(beffjezos 转述)讽刺 Anthropic 员工一边宣称产品「可能杀死我们所有人」,投资人却只兴奋地想买它的股票;开发者 Chetan Puttagunta 吐槽其临近 IPO 的表态从「摧毁大多数工作」「摧毁大多数公司」升级到「可能杀死全人类」,调侃下一步是否要「吃掉宇宙」。
- a16z 合伙人 John Allard 讽刺「真诚的信念压倒财务回报」不可能,矛头指向上市前发存在性风险声明。
- 针对「实验室员工真心相信工作危险但认为该由负责任的人来做、卖企业合同与 IPO 只是筹资」的说法,intellectrona 提出:若真如此,为何还有员工股权激励。
- Azeem 提出检验标准:若 Anthropic 理智诚实,就应把灭绝风险写入 S-1 招股文件;也有网友(m1 转述)指出不写入可能构成信息披露不实,给投资者起诉留下依据。
- Taylor Lorenz 批评这类自我拔高式末日表态只会恐吓公众、催生糟糕的监管政策,建议高管措辞更精确并主动对冲监管后果;MoonL88537 强烈附和,认为若真觉得公司有哪怕 1% 概率毁灭人类,正确做法是带具体证据立即报警(如报 FBI),而非模糊放话。
- 投资人 firstadopter 引述 OpenAI 高管 Evan 的类似「毁灭人类」表态,称万亿级 IPO 前数周发这种言论「脑残」,若真相信就该立即辞职,且会给反对者与政客攻击 AI 基础设施建设留下口实。
为什么重要
- 这场争论把「AI 安全话语是否只是末日营销」推向台前:同一批言论在安全圈被视为负责任的警示,在投资人与部分记者眼中却成了上市前的自相矛盾甚至监管风险源。
- S-1 披露提议提供了一个可操作的检验:公司的风险表态是否与其对投资者的正式陈述一致,可能直接影响未来诉讼与监管环境。
- a16z 合伙人嘲讽 IPO 前夕发「产品将毁灭人类」声明 — john__allard · 2026-09-09
- Taylor Lorenz 批评 AI 高管惊悚言论:只会吓坏公众、催生糟糕监管 — sebkrier · 2026-09-09
- 网友调侃:Anthropic 若不在 IPO 招股书披露 AI 灭绝风险或涉违规 — examachine · 2026-09-09
- AI 圈争论:相信公司危及人类就该立刻报警拿证据,而非模糊指控 — MoonL88537 · 2026-09-09
- Anthropic 若真信灭绝风险就该报 FBI,而不是写进 S-1 — MoonL88537 · 2026-09-09
- OpenAI IPO 前高管末日言论引争议,投资人斥「脑残发言」 — GarrisonLovely · 2026-09-09
- Anthropic 员工称担心 AI 灭绝人类,公司 IPO 估值却达 2.5 万亿美元 — scaling01 · 2026-09-09
- 「末日论员工为何还持股」:AI 实验室安全叙事与逐利动机的矛盾 — intellectronica · 2026-09-09
- a16z 创始人嘲讽 Anthropic「末日营销」:投资人只关心能不能买股票 — beffjezos · 2026-09-10
- Anthropic 临近 IPO,"可能灭绝人类"言论被调侃越来越离谱 — chetanp · 2026-09-10
第 3 集 · 业内集体担忧 AI 失控,Anthropic 边冲 IPO 边加速(2026-09-09,2 条)
一篇五条长推的线程盘点 AI 圈对「模型加速冲向自我改进」的集体恐惧:一位 Anthropic 离职研究员公开称 Anthropic 和 OpenAI 都在不负责任地竞逐自我改进的超级智能,拿人命赌博。AI 评论者 eyishazyer 在结尾发出尖锐判断——当你在一个无法召回的系统上竞速,而终点线却是一场 IPO 路演时,这场竞赛本身就是错误。
- 长文盘点:业内大佬集体担忧 AI 失控,Anthropic 边冲 IPO 边加速 — eyishazyer · 2026-09-09
- 冲刺无法回头的系统,终点却是 IPO 路演:这场竞赛本身就是错误 — eyishazyer · 2026-09-09
第 4 集 · AI 灭绝风险警告震动英国议会(2026-09-09,2 条)
据《卫报》报道,Anthropic 一位安全专家在英国议会表示,AI 引发人类灭绝事件的可能性大于 10%,另有研究员警告 AI 或在 2030 年前导致人类灭绝。这些密集发出的超级智能风险警告引发议员对 AI 公司的猛烈抨击,极端 AI 风险话题再度成为监管讨论的焦点。
- Anthropic 安全专家称 AI 灭绝人类概率超 10%,英国议会激辩监管 — nordicinst · 2026-09-09
- 英国工党议员:AI 有 10% 灭绝人类风险,监管不作为不负责任 — connoraxiotes · 2026-09-10
第 5 集 · Anthropic 负责人称 AI 有 10% 灭绝风险,美议员提五项监管(2026-09-10,2 条)
美国众议员 Ro Khanna 转述 Anthropic 对齐负责人的判断:AI 导致人类灭绝的概率约为 10%,风险不止在于滥用,更在于缺乏控制,而美国政府「一直在沉睡」。他呼吁国会休会前必须通过 AI 监管立法,并提出五项具体措施,包括仿照核能与民航设立联邦 AI 监管机构、要求对模型「遏制」能力做预认证、设置灭停开关等。
- Anthropic 对齐负责人称 AI 有 10% 灭绝人类风险,议员提五项监管方案 — ShakeelHashim · 2026-09-10
- 美议员呼吁设联邦机构监管AI:建立核能级审批与灭停开关 — ShakeelHashim · 2026-09-10
第 6 集 · Anthropic 研究员称开发者自认 AI 或致人类灭绝(2026-09-10,2 条)
Anthropic 研究员 @saprmarks 以个人身份发长文梳理 AI 风险现状,获同行转发并引发可解释性路线之争。文中指出 AI 开发者普遍相信其技术可能导致人类灭绝,且这或在未来几年内发生;员工越资深越担忧。他同时认为行业需向政府说清具体诉求,推动更明确的监管回应。该文在 AI 圈引发激烈讨论,成为围绕 AI 存在性风险叙事的最新争论焦点。
- Anthropic 员工点评 AI 风险公开信:行业需向政府说清具体诉求 — clarejtbirch · 2026-09-10
- Anthropic 研究员:AI 开发者自己承认技术可能致人类灭绝 — xuanalogue · 2026-09-10
第 7 集 · 前研究员离职控诉两巨头赌命冲刺超智能,遭资历反噬(2026-09-10,9 条)
9 月 10 日,账号 @hilbertspaess 发文宣布当日从 Anthropic 离职,自称过去三年在 OpenAI 和 Anthropic 从事预训练研究,指责两家公司都在不负责任地冲向自我改进的超级智能,是「拿我们的生命赌博」。这条帖子迅速刷屏,据称获得超过 1 亿次浏览,成为当日 AI 舆论场的焦点,美国参议员 Heinrich 也转发了该辞职声明。
已确认
- @hilbertspaess(转发帖中提及真名 Hilbert Spaess,亦有转述称其为 Jacob Coxon)发布离职控诉帖,称在 OpenAI 与 Anthropic 共做过三年预训练研究,并宣称 Anthropic 内部「所有人都知道」其 AI 可能终结人类
- 该帖传播量极大,据多位网友转述浏览量超过 1 亿次
- 其辞职声明获得美国参议员 Heinrich 转发,影响力外溢至政策圈
- 据 @DavidLinthicum 转述 WIRED 采访要点,Coxon 称留给人类的安全窗口只剩一两年,并转述同事原话称 Anthropic 内部对风险有共识
- 该作者此前曾在 OpenAI 任职,转述中提到他抱怨 OpenAI 同事普遍不认同其末日观点
尚未确认
- 有网友指出其在 Anthropic 的任职时间仅约六周(另有说法为两个月),具体时长无法独立核实
- @DrSingularity、@TheMoonMidas 等多位发帖者质疑该账号是水军、整场风波更像精心策划的戏剧表演,认为背后「显然另有隐情」,但均属推测,无实锤证据
- 其「三年预训练研究」「Anthropic 内部共识」「安全窗口只剩一两年」等自述内容真伪不明
为什么重要
- 这一事件集中体现了 AI 末日论叙事的传播力与可信度问题:单条重磅控诉可在缺乏资历支撑的情况下获得上亿曝光,甚至引起参议员关注
- 社区的快速反噬——聚焦爆料者任职时长而非其论点本身——也反映出当前 AI 安全讨论中立场与信源可信度的激烈博弈,双方都更倾向于质疑动机而非正面回应论据
- 若账号确系炒作,将进一步削弱公众对「前员工爆料」类信息的信任
- 喊「AI 将毁灭人类」的安全派人物被曝只在 Anthropic 干过两个月 — TheMoonMidas · 2026-09-10
- 嘲讽「Anthropic 内部都知道 AI 或毁灭人类」爆料者:你才干了几个月 — TheMoonMidas · 2026-09-10
- 刷屏 1 亿次末日帖作者在 Anthropic 只干了六周 — Dr_Singularity · 2026-09-10
- 自称前 OpenAI/Anthropic 研究员发离职控诉,账号被质疑是水军 — TinfoilTricorn · 2026-09-10
- OpenAI/Anthropic 前预训练研究员辞职:两家在拿人命赌超级智能 — inductionheads · 2026-09-10
- OpenAI/Anthropic 前研究员离职怒斥:两巨头正赌命冲刺超级智能 — SatelliteNetSec · 2026-09-10
- Anthropic 研究员 Jacob Coxon 离职:留给人类的安全窗口只剩一两年 — DavidLinthicum · 2026-09-11
- 前 OpenAI/Anthropic 预训练研究员辞职:两大厂正鲁莽冲向超级智能 — ShakeelHashim · 2026-09-11
- 前 Anthropic 研究员离职怒斥失控竞赛,引发 AI 末日论激辩 — benfielding · 2026-09-11
第 8 集 · Anthropic 就风险争议发声明遭批公关话术(2026-09-10,5 条)
9月10日,Anthropic 针对过去24小时围绕 AI 风险的安全争议发布官方声明,称 AI 将同时带来巨大收益与前所未有的风险,公司一贯保持透明,模型配有业内最强安全护栏,并率先发布负责任扩展政策(RSP)、是机制可解释性研究的先驱,该领域正被用于分析和预防对齐事故。
已确认
- Anthropic 官方声明由记者 Hadas Gold 转发扩散,措辞强调「巨大收益与空前风险并存」,但对具体风险着墨含糊。
- 声明中 Anthropic 突出自身在机制可解释性和负责任扩展政策上的开创者地位。
尚未确认
- 声明所指的具体安全事件细节(Hubinger 与 Coxon 的相关说法内容)未在帖文中展开,外界对其风险表述是否自洽仍有分歧。
为什么重要
- Shakeel Hashim 撰文批评该声明「非常糟糕」:大量篇幅用于自我表扬,却未坦率讨论风险,也未重申研究者 Hubinger 和 Coxon 的明确说法,认为这家一向以坦诚著称的公司交出了怯懦的「企业话术」。
- 其他安全圈人士同样质疑 Anthropic 的安全先锋形象,认为声明避谈实质。
- 也有不同声音:网友 @menhguin 认为 Anthropic 在风险表态上一致,Dario 等联创多年公开言论与官方口径相近,看不出内部政策冲突;Hesamation 则就「谈风险」与「自身政策」是否自洽提出质疑,讨论仍在延续。
- Anthropic 危机声明被批自夸式公关,避谈风险实质 — ShakeelHashim · 2026-09-10
- Anthropic 安全声明被批「企业公关腔」,称其辜负一贯坦诚形象 — ShakeelHashim · 2026-09-10
- Anthropic 就风险争议发声明,业内人士吐槽「AI 可能毁灭人类」的公关话术 — Miles_Brundage · 2026-09-10
- Anthropic 风险声明被批企业话术,安全先锋形象遭质疑 — sjgadler · 2026-09-10
- Hesamation 质疑:Anthropic 谈风险与自身政策是否自洽 — Hesamation · 2026-09-10
第 9 集 · Wildeford 批 Anthropic 公关粉饰安全,呼吁研究员发声(2026-09-10,3 条)
有效利他主义者 Peter Wildeford 公开批评 Anthropic 的官方声明粉饰安全状况,称其强烈暗示公司对超智能扩展路径上的安全「已有把握」,但内部研究员并不这样认为。他建议撤换整个公关团队,让真心相信自己所言的研究员直接对外沟通,因为公关话术「听起来非常假」。他还用 Claude 评估 Anthropic 的争议回应,模型评语称其为「简历而非回应」,通篇罗列成绩而非正面答疑。
- Wilders 撑 Anthropic:让研究员直接发声,撤掉公关话术团队 — peterwildeford · 2026-09-10
- Peter Wildeford:Anthropic 应让研究员取代公关团队发声 — peterwildeford · 2026-09-10
- Wildeford 批 Anthropic 官方口径粉饰:研究员并不认为已安全 — peterwildeford · 2026-09-10
第 10 集 · 七位 AI 内部人士连发警示:灭绝风险从 10% 到 70% 不等(2026-09-10,4 条)
四天内至少七位 AI 行业内部人士接连发出高危警示:Anthropic 研究员 Evan Hubinger 称 AI 可能在十年内灭绝人类,个人估计概率超 10%,且 Anthropic 尚无解决方案;前 OpenAI 政策负责人引用员工 Marcus J. 的话称,若没有监管或各实验室协同放缓,三年内人类灭绝概率达 70%;Longview Philanthropy 研究员 Peter Wildeford 对此提出质疑,但认为即使如此灭绝概率仍超 10%。
- 七位 AI 内部人士四天内连发警示:AI 可能十年内毁灭人类 — sebpaquet · 2026-09-10
- Anthropic 研究员 Evan 称十年内 AI 灭绝人类风险超 10% — wfithian · 2026-09-10
- OpenAI 员工:若不监管或放缓前沿 AI,三年内人类灭绝概率 70% — peterwildeford · 2026-09-11
- OpenAI 员工称不控速则三年内人类灭绝概率达 70%,研究员质疑仍超 10% — peterwildeford · 2026-09-11
第 11 集 · 前 Anthropic 研究员上 CNN 警告 AI 生存风险遭质疑(2026-09-10,2 条)
前 OpenAI 与 Anthropic 研究员 Jacob Coxon 在公开辞职并发出严峻 AI 安全警告后,登上 CNN Anderson Cooper 节目,警告 AI 可能「杀死我们所有人」,讨论涉及 OpenAI 与 Gemini 等。有评论认为其言论有炒冷饭之嫌。
- 前 Anthropic 研究员上 CNN 警告:AI 可能「杀死我们所有人」 — Bubbly-Air7302 · 2026-09-10
- 前 OpenAI/Anthropic 研究员上电视谈 AI 安全,被评炒冷饭 — deliprao · 2026-09-10