专题 · FULL STORY

Anthropic 研究员辞职掀 AI 灭绝风险风波

9 月 9 日起,前研究员 Jacob Coxon 等人相继从 Anthropic 辞职并公开警告两大实验室正「拿命赌超智能」,引发议员与媒体跟进;Anthropic 发声明回应反被批公关话术,多位内部人士接连给出 10% 至 70% 的灭绝风险估计,争议持续发酵。

2026-09-09 ~ 2026-09-11 · 11 集 · 258 条

第 1 集 · Anthropic 研究员辞职警告两大实验室「拿命赌超智能」,引爆争议(2026-09-09,217 条)

前OpenAI研究员Jacob Coxon从Anthropic高调辞职,公开警告OpenAI与Anthropic都在冲向自我改进的超智能、「拿人命赌博」,并称各AI公司没有治理政策、正竞相造出自己无法控制的系统。其辞职帖24小时内收获约1.2亿浏览,登上TIME、Variety、WSJ,并先后出现在Fox News黄金时段与CNN Anderson Cooper 360节目中——他在CNN上称最可怕的场景是AI被用来让自身变得更聪明。事件随即分裂成两股讨论:一方质疑这是一场精心协调、资金充足的公关造势,连Elon Musk也下场推广「监管卧底」阴谋论;另一方则在安全圈探讨「离职发声」为何成为传导AI风险最有效的方式。

已确认

  • 传播链路疑点由保守派评论者Parker Thayer等人及Reddit长帖列出:WSJ在Coxon发帖前18分钟刊出独家专访;其账号此前几乎无粉丝与活动记录,发帖后数小时内获数万转发、涨粉10万以上;Jordan Schachtel称其所有社交账号同一天出现。Coxon辞职后密集接受Fox News与CNN采访,有用户质疑其媒体曝光节奏像协调好的造势,并追问推动AI监管的声浪可能让Anthropic受益,应查证是否存在协调。
  • 据Politico记者报道,Elon Musk在X上推广阴谋论称Coxon是亲AI监管运动的「卧底」,引发业内回击;MilesBrundage说明Coxon确实曾在OpenAI和Anthropic两家做预训练研究。Coxon自述三年间先后在两家公司做预训练,两家都没有负责任地行事。Reddit亦有讨论帖将其辞职概括为「因担心各实验室竞相造出无法控制的系统而退出AI行业」。
  • Axios独家报道Coxon为离职放弃了手中股权;zerohedge转述时强调其「入职才六周」,Ethan Perez回应称其离职前对Anthropic的进展速度感到担忧。Gary Marcus指出风波中的抹黑操作「不干净」:唯一经核实的信源(Axios等直接采访)报道其任职约4个月,但多个高流量账号将其改写为更短的「六周」以强化「闪电离职」叙事;另有整理帖称其27岁、无LinkedIn无作品集、在Anthropic仅约3个月——各版本数字并不一致。
  • 与辞职事件几乎同期,Anthropic对齐团队负责人Evan Hubinger(EvanHub)公开表态:构建AI的人「真诚地相信AI可能杀死全人类,这不是营销话术」,他个人估计未来十年内发生概率超过10%,并坦承目前还没有解决超级智能对齐问题的方案、公司未走上正轨。CNBC、BBC报道此言论,Axios报道称共有三名Anthropic研究员公开警告失控AI可能在本十年内毁灭人类,构成前沿实验室内部罕见的高调集体表态。反方叙事同步升级:Daniel Jeffries发长文称末日论反AI组织本质是「恐怖细胞」、层层转移资金并在AI公司安插「沉睡者」,还点名Coxon收取了2万美元;Wes Roth发布长视频梳理「AI恐慌」背后的暗钱网络。
  • 多条转发帖给出更朴素解释:此人在OpenAI工作三年后幻灭,出于认同加入Anthropic,入职后发现两家同质化竞争而离职,阴谋论系过度渲染;Garry Tan亦回击了「有组织施压行动」的说法。安全圈一侧,Kelsey Tuoc认为离职发声的巨大反响应让心存忧虑的员工反思;birchlse指出辞职者的警报无法轻率归因于商业动机,是「AI圈外的人也能听懂的诚实信号」;jachiam0解释刷屏原因在于警告指向整个行业、时机与可信度俱佳;Danielle Fong玩梗「至少没人从Grok辞职」。同期Paul Christiano进入OpenAI董事会,被评论者与Daniel Kokotajlo辞职等并列列为AI风险「全民话题化」的标志性一天。

尚未确认

  • 「资金充足的协调PR行动」指控目前只有时间线巧合与账号数据等间接证据,没有直接证据证明预谋或金主协调;Garry Tan已公开反驳,NathanpmYoung指出幕后小团体与发布前的正常「协调」是两回事。Musk的「卧底」说法、Jeffries关于「恐怖细胞」资金网络与Coxon收取2万美元的具体指控均属单方陈述,帖内未见信源佐证;Wes Roth的「暗钱」梳理同样属个人综述视角。
  • Coxon确切任职时长存在约4个月、约六周、约3个月三种说法,Gary Marcus以Axios直接采访为准,但短时长版本已广为流传。

为什么重要

  • 这场风波同时触及AI安全治理的两个核心问题:其一,内部吹哨与公开离职哪种方式更能有效传导风险信号——离职「不可归因于商业动机」的特质使其成为公众理解AI风险最直观的叙事;其二,当离职发声与媒体节奏高度耦合、其舆论效果又可能利于特定政策议程时,其可信度本身也会被政治化质疑。Hubinger作为在职对齐负责人亲自给出「超10%灭绝概率」的估计,且Axios显示共有三名Anthropic研究员同步发声,使风波从单一离职事件上升为实验室内部风险共识的公开化展示;而Musk推广阴谋论、Gary Marcus揭示的任职时长篡改与Jeffries等人的「暗钱」叙事,表明争议双方都可能在未经核实的情况下放大失实信息,忧心员工面临「是否用脚投票」与现实声誉风险的双重压力。

还有 197 条相关讨论 →

第 2 集 · Anthropic临近IPO,「AI毁灭人类」言论遭集中嘲讽(2026-09-09,10 条)

随着 Anthropic 临近 IPO(预计市值高达 2.5 万亿美元),其高层「AI 可能毁灭人类」式的公开表态在 X 上引发一波密集嘲讽与质疑,争论核心是 AI 安全叙事与商业逐利之间的自相矛盾。

已确认

  • scaling01 指出,Anthropic 的现任与离职员工公开发帖称「真诚地相信 AI 可能毁灭全人类」,而公司即将进行的 IPO 预计市值高达 2.5 万亿美元,并讽刺等到真正上市时估值恐怕还要更高。
  • Marc Andreessen(beffjezos 转述)讽刺 Anthropic 员工一边宣称产品「可能杀死我们所有人」,投资人却只兴奋地想买它的股票;开发者 Chetan Puttagunta 吐槽其临近 IPO 的表态从「摧毁大多数工作」「摧毁大多数公司」升级到「可能杀死全人类」,调侃下一步是否要「吃掉宇宙」。
  • a16z 合伙人 John Allard 讽刺「真诚的信念压倒财务回报」不可能,矛头指向上市前发存在性风险声明。
  • 针对「实验室员工真心相信工作危险但认为该由负责任的人来做、卖企业合同与 IPO 只是筹资」的说法,intellectrona 提出:若真如此,为何还有员工股权激励。
  • Azeem 提出检验标准:若 Anthropic 理智诚实,就应把灭绝风险写入 S-1 招股文件;也有网友(m1 转述)指出不写入可能构成信息披露不实,给投资者起诉留下依据。
  • Taylor Lorenz 批评这类自我拔高式末日表态只会恐吓公众、催生糟糕的监管政策,建议高管措辞更精确并主动对冲监管后果;MoonL88537 强烈附和,认为若真觉得公司有哪怕 1% 概率毁灭人类,正确做法是带具体证据立即报警(如报 FBI),而非模糊放话。
  • 投资人 firstadopter 引述 OpenAI 高管 Evan 的类似「毁灭人类」表态,称万亿级 IPO 前数周发这种言论「脑残」,若真相信就该立即辞职,且会给反对者与政客攻击 AI 基础设施建设留下口实。

为什么重要

  • 这场争论把「AI 安全话语是否只是末日营销」推向台前:同一批言论在安全圈被视为负责任的警示,在投资人与部分记者眼中却成了上市前的自相矛盾甚至监管风险源。
  • S-1 披露提议提供了一个可操作的检验:公司的风险表态是否与其对投资者的正式陈述一致,可能直接影响未来诉讼与监管环境。

第 3 集 · 业内集体担忧 AI 失控,Anthropic 边冲 IPO 边加速(2026-09-09,2 条)

一篇五条长推的线程盘点 AI 圈对「模型加速冲向自我改进」的集体恐惧:一位 Anthropic 离职研究员公开称 Anthropic 和 OpenAI 都在不负责任地竞逐自我改进的超级智能,拿人命赌博。AI 评论者 eyishazyer 在结尾发出尖锐判断——当你在一个无法召回的系统上竞速,而终点线却是一场 IPO 路演时,这场竞赛本身就是错误。

第 4 集 · AI 灭绝风险警告震动英国议会(2026-09-09,2 条)

据《卫报》报道,Anthropic 一位安全专家在英国议会表示,AI 引发人类灭绝事件的可能性大于 10%,另有研究员警告 AI 或在 2030 年前导致人类灭绝。这些密集发出的超级智能风险警告引发议员对 AI 公司的猛烈抨击,极端 AI 风险话题再度成为监管讨论的焦点。

第 5 集 · Anthropic 负责人称 AI 有 10% 灭绝风险,美议员提五项监管(2026-09-10,2 条)

美国众议员 Ro Khanna 转述 Anthropic 对齐负责人的判断:AI 导致人类灭绝的概率约为 10%,风险不止在于滥用,更在于缺乏控制,而美国政府「一直在沉睡」。他呼吁国会休会前必须通过 AI 监管立法,并提出五项具体措施,包括仿照核能与民航设立联邦 AI 监管机构、要求对模型「遏制」能力做预认证、设置灭停开关等。

第 6 集 · Anthropic 研究员称开发者自认 AI 或致人类灭绝(2026-09-10,2 条)

Anthropic 研究员 @saprmarks 以个人身份发长文梳理 AI 风险现状,获同行转发并引发可解释性路线之争。文中指出 AI 开发者普遍相信其技术可能导致人类灭绝,且这或在未来几年内发生;员工越资深越担忧。他同时认为行业需向政府说清具体诉求,推动更明确的监管回应。该文在 AI 圈引发激烈讨论,成为围绕 AI 存在性风险叙事的最新争论焦点。

第 7 集 · 前研究员离职控诉两巨头赌命冲刺超智能,遭资历反噬(2026-09-10,9 条)

9 月 10 日,账号 @hilbertspaess 发文宣布当日从 Anthropic 离职,自称过去三年在 OpenAI 和 Anthropic 从事预训练研究,指责两家公司都在不负责任地冲向自我改进的超级智能,是「拿我们的生命赌博」。这条帖子迅速刷屏,据称获得超过 1 亿次浏览,成为当日 AI 舆论场的焦点,美国参议员 Heinrich 也转发了该辞职声明。

已确认

  • @hilbertspaess(转发帖中提及真名 Hilbert Spaess,亦有转述称其为 Jacob Coxon)发布离职控诉帖,称在 OpenAI 与 Anthropic 共做过三年预训练研究,并宣称 Anthropic 内部「所有人都知道」其 AI 可能终结人类
  • 该帖传播量极大,据多位网友转述浏览量超过 1 亿次
  • 其辞职声明获得美国参议员 Heinrich 转发,影响力外溢至政策圈
  • 据 @DavidLinthicum 转述 WIRED 采访要点,Coxon 称留给人类的安全窗口只剩一两年,并转述同事原话称 Anthropic 内部对风险有共识
  • 该作者此前曾在 OpenAI 任职,转述中提到他抱怨 OpenAI 同事普遍不认同其末日观点

尚未确认

  • 有网友指出其在 Anthropic 的任职时间仅约六周(另有说法为两个月),具体时长无法独立核实
  • @DrSingularity、@TheMoonMidas 等多位发帖者质疑该账号是水军、整场风波更像精心策划的戏剧表演,认为背后「显然另有隐情」,但均属推测,无实锤证据
  • 其「三年预训练研究」「Anthropic 内部共识」「安全窗口只剩一两年」等自述内容真伪不明

为什么重要

  • 这一事件集中体现了 AI 末日论叙事的传播力与可信度问题:单条重磅控诉可在缺乏资历支撑的情况下获得上亿曝光,甚至引起参议员关注
  • 社区的快速反噬——聚焦爆料者任职时长而非其论点本身——也反映出当前 AI 安全讨论中立场与信源可信度的激烈博弈,双方都更倾向于质疑动机而非正面回应论据
  • 若账号确系炒作,将进一步削弱公众对「前员工爆料」类信息的信任

第 8 集 · Anthropic 就风险争议发声明遭批公关话术(2026-09-10,5 条)

9月10日,Anthropic 针对过去24小时围绕 AI 风险的安全争议发布官方声明,称 AI 将同时带来巨大收益与前所未有的风险,公司一贯保持透明,模型配有业内最强安全护栏,并率先发布负责任扩展政策(RSP)、是机制可解释性研究的先驱,该领域正被用于分析和预防对齐事故。

已确认

  • Anthropic 官方声明由记者 Hadas Gold 转发扩散,措辞强调「巨大收益与空前风险并存」,但对具体风险着墨含糊。
  • 声明中 Anthropic 突出自身在机制可解释性和负责任扩展政策上的开创者地位。

尚未确认

  • 声明所指的具体安全事件细节(Hubinger 与 Coxon 的相关说法内容)未在帖文中展开,外界对其风险表述是否自洽仍有分歧。

为什么重要

  • Shakeel Hashim 撰文批评该声明「非常糟糕」:大量篇幅用于自我表扬,却未坦率讨论风险,也未重申研究者 Hubinger 和 Coxon 的明确说法,认为这家一向以坦诚著称的公司交出了怯懦的「企业话术」。
  • 其他安全圈人士同样质疑 Anthropic 的安全先锋形象,认为声明避谈实质。
  • 也有不同声音:网友 @menhguin 认为 Anthropic 在风险表态上一致,Dario 等联创多年公开言论与官方口径相近,看不出内部政策冲突;Hesamation 则就「谈风险」与「自身政策」是否自洽提出质疑,讨论仍在延续。

第 9 集 · Wildeford 批 Anthropic 公关粉饰安全,呼吁研究员发声(2026-09-10,3 条)

有效利他主义者 Peter Wildeford 公开批评 Anthropic 的官方声明粉饰安全状况,称其强烈暗示公司对超智能扩展路径上的安全「已有把握」,但内部研究员并不这样认为。他建议撤换整个公关团队,让真心相信自己所言的研究员直接对外沟通,因为公关话术「听起来非常假」。他还用 Claude 评估 Anthropic 的争议回应,模型评语称其为「简历而非回应」,通篇罗列成绩而非正面答疑。

第 10 集 · 七位 AI 内部人士连发警示:灭绝风险从 10% 到 70% 不等(2026-09-10,4 条)

四天内至少七位 AI 行业内部人士接连发出高危警示:Anthropic 研究员 Evan Hubinger 称 AI 可能在十年内灭绝人类,个人估计概率超 10%,且 Anthropic 尚无解决方案;前 OpenAI 政策负责人引用员工 Marcus J. 的话称,若没有监管或各实验室协同放缓,三年内人类灭绝概率达 70%;Longview Philanthropy 研究员 Peter Wildeford 对此提出质疑,但认为即使如此灭绝概率仍超 10%。

第 11 集 · 前 Anthropic 研究员上 CNN 警告 AI 生存风险遭质疑(2026-09-10,2 条)

前 OpenAI 与 Anthropic 研究员 Jacob Coxon 在公开辞职并发出严峻 AI 安全警告后,登上 CNN Anderson Cooper 节目,警告 AI 可能「杀死我们所有人」,讨论涉及 OpenAI 与 Gemini 等。有评论认为其言论有炒冷饭之嫌。