专题 · FULL STORY

前OpenAI研究员疑虑引发AI安全圈激辩

9月9日,前OpenAI核心研究员Aidan Clark首次公开质疑AI是否发展过快,引发安全圈连锁讨论:从审视p(doom)灭绝概率的底层假设,到激辩是否应留在前沿实验室做安全工作,再到「模型本身成最大对手」的叙事转向,事件持续发酵。

2026-09-09 ~ 2026-09-10 · 4 集 · 22 条

第 1 集 · 前OpenAI核心研究员首度自问:AI是否发展太快(2026-09-09,12 条)

9月9日,前 OpenAI 核心研究员、现供职于 Anthropic 的 Aidan Clark(自称「Ants」之一)公开表示,自己第一次开始怀疑 AI 是否发展得太快,并坦言「说实话我也不确定」。他认为行业需要先回答一个更根本的问题:什么样的节奏才算成功的 pace——目前没有人给出清晰答案,他呼吁业界在未来数月内拿出明确提案,并以人类福祉为先。同一线程中,他对 Peter Wildeford 等人的 AI 发展节奏管控提案给出尖锐批评,引发安全治理圈与前沿实验室一线视角之间的持续讨论。

已确认

  • Clark 首次公开表达对 AI 发展速度的疑虑,呼吁正面定义「成功节奏」
  • 讨论中引用了 IFP(Institute for Progress)与 AI Futures Project 的两篇分析报告,其中一份题为《美国如何为自动化 AI 研发做准备》,包含 23 条低风险政策建议
  • sjgadler 认为 AI 发展的默认走向大致接近 Peter Wildeford 提出的「Scramble」情景
  • Clark 对外部治理提案给出具体批评:提案有想法,但作者显然远离前沿实验室一线细节,把关键困难过度抽象、过度聚焦递归自我改进(RSI),而忽视当下现实,这种疏离是有害的
  • 他提出判断标准:任何关于 AI 发展节奏治理的提案,如果不大量提及 Anthropic 和 OpenAI,很可能没有落在正确的细节层级上,因为前沿模型的实际开发进度由这两家决定;他同时表示愿意帮忙补充提案细节
  • 他指出外界对实验室的算力和项目运作普遍缺乏准确认知,「伸手进箱子」式的外部干预建议通常站不住脚
  • 面对「如果真信风险,为什么还在造 AI」的常见质疑,Clark 回应称:若认为 AI 有约 10% 的概率灭绝全人类,继续做 AI 的唯一辩护理由就是把实验室的人当成「坏人」。相关讨论中流传较广的一条推文(Peter Wildeford 转发)补充了内部视角:OpenAI 许多人并未真正内化「文明级风险」,而 Anthropic 充分理解风险,但被困在竞速中,认为没有其他实验室会负责任地行事
  • 围绕风险沟通方式,BronsonSchoen 批评「我们是负责任的一方所以必须继续」的表态同样有问题,认为末日式风险传播最终只会变成公司互相甩锅;ericlim 则认为圈子普遍低估 AI 技术的量级,缺少「这件事现在就能带来好处」的叙事,积极叙事比「会杀人」式的 doomerism 传播更有效

为什么重要

  • 这一表态来自曾身处 OpenAI 核心研究一线、现属 Anthropic 的人员,其首次出现「是否太快」的疑虑本身即是信号
  • 线程完整呈现了安全治理圈与前沿实验室一线视角之间的张力:治理提案被批脱离实际,「信风险为何还造」的质疑得到一线回应,而「什么节奏算合适」的正面定义仍付之阙如

第 2 集 · 研究者呼吁审视「10% 灭绝概率」背后的理论假设(2026-09-09,2 条)

安全研究者 sebkrier 提出观点:对于「AI 有 10% 概率导致人类全员死亡」这类 p(doom) 说法,人们应当更主动地质询其底层假设,包括对智能本质的理解、权力如何运作、工具性收敛以及 Omohundro 式的驱动等理论根基。他认为这些关于 AI 灭绝风险的论断并非生物性风险,其背后的理性、信念与核心假设亟待科学审视,而非不加检验地接受。

第 3 集 · AI 安全圈激辩:既信风险又留实验室是否自洽(2026-09-09,6 条)

9 月 9 日至 10 日,AI 安全圈围绕「是否应该加入或留在前沿实验室做安全工作」展开一场多轮讨论,由安全研究者 Jeff Ladish 的观点引发,多位从业者跟进表态。

已确认

  • Jeff Ladish 认为,从整体看人才过度集中在前沿实验室内部,希望更多人加入 CAISI、UK AISI、Redwood、Palisade 等外部安全机构。
  • 但他同时承认,有些非常重要的研究(如可解释性工作)只能在实验室内部进行。他进一步区分:如果认为灾难概率很高,预训练团队成员留在实验室的理由要弱得多;而研究 AI 失控失败案例的人全部离开实验室反而不明智,因为世界急需了解日益强大的智能体如何运作的信息。
  • 一位实验室在职员工(据 @hugobowne 转述的讨论)回应外界质疑时表示,留在实验室是因为认为从内部降低风险更有效,同时尊重并支持 Jacob、Joe 等人选择从外部推动安全。
  • Jasmine Sun 表示,她仍坚持「AI 无论如何都会被造出来,自己去做对齐与安全防护比让更糟糕的人来做要好」的立场,承认存在认知失调,但认为这比其他选项更好。
  • Jacques Thibodeau 针对公众「既然相信 AI 会毁灭人类,为什么还去那里工作」的典型质疑发声,认为持续跟进前沿 AI 发展本身就是一份全职工作,员工有充分理由留在一线边了解边行动,外界应给研究员多一点宽容。

为什么重要

这场争论折射出 AI 安全社区内部长期存在的张力:随着前沿能力加速,安全研究者面临「从内部减灾」与「外部监督」两条路线的选择。讨论中各方并非非此即彼——Ladish 本人既呼吁分流也认可内部研究的价值——共识倾向于按岗位性质(能力研发 vs. 失控研究)与个人判断区分对待,而非对留在实验室的研究者做道德指责。

第 4 集 · AI 安全叙事转向:模型本身成为最大对手(2026-09-10,2 条)

围绕实验室安全工作的讨论中,kipperrii 等人指出 AI 安全从业者的经典立场——「与其让更差的参与者做出来,不如由我来加速并做好对齐」——正面临动摇。随着竞争格局变化,「我比对手更安全」的传统叙事失效,威胁从模型的恶意使用转向模型本身,业内人士认为这一逻辑虽依然成立但相对安全感已消退。