专题 · FULL STORY
前OpenAI研究员疑虑引发AI安全圈激辩
9月9日,前OpenAI核心研究员Aidan Clark首次公开质疑AI是否发展过快,引发安全圈连锁讨论:从审视p(doom)灭绝概率的底层假设,到激辩是否应留在前沿实验室做安全工作,再到「模型本身成最大对手」的叙事转向,事件持续发酵。
2026-09-09 ~ 2026-09-10 · 4 集 · 22 条
第 1 集 · 前OpenAI核心研究员首度自问:AI是否发展太快(2026-09-09,12 条)
9月9日,前 OpenAI 核心研究员、现供职于 Anthropic 的 Aidan Clark(自称「Ants」之一)公开表示,自己第一次开始怀疑 AI 是否发展得太快,并坦言「说实话我也不确定」。他认为行业需要先回答一个更根本的问题:什么样的节奏才算成功的 pace——目前没有人给出清晰答案,他呼吁业界在未来数月内拿出明确提案,并以人类福祉为先。同一线程中,他对 Peter Wildeford 等人的 AI 发展节奏管控提案给出尖锐批评,引发安全治理圈与前沿实验室一线视角之间的持续讨论。
已确认
- Clark 首次公开表达对 AI 发展速度的疑虑,呼吁正面定义「成功节奏」
- 讨论中引用了 IFP(Institute for Progress)与 AI Futures Project 的两篇分析报告,其中一份题为《美国如何为自动化 AI 研发做准备》,包含 23 条低风险政策建议
- sjgadler 认为 AI 发展的默认走向大致接近 Peter Wildeford 提出的「Scramble」情景
- Clark 对外部治理提案给出具体批评:提案有想法,但作者显然远离前沿实验室一线细节,把关键困难过度抽象、过度聚焦递归自我改进(RSI),而忽视当下现实,这种疏离是有害的
- 他提出判断标准:任何关于 AI 发展节奏治理的提案,如果不大量提及 Anthropic 和 OpenAI,很可能没有落在正确的细节层级上,因为前沿模型的实际开发进度由这两家决定;他同时表示愿意帮忙补充提案细节
- 他指出外界对实验室的算力和项目运作普遍缺乏准确认知,「伸手进箱子」式的外部干预建议通常站不住脚
- 面对「如果真信风险,为什么还在造 AI」的常见质疑,Clark 回应称:若认为 AI 有约 10% 的概率灭绝全人类,继续做 AI 的唯一辩护理由就是把实验室的人当成「坏人」。相关讨论中流传较广的一条推文(Peter Wildeford 转发)补充了内部视角:OpenAI 许多人并未真正内化「文明级风险」,而 Anthropic 充分理解风险,但被困在竞速中,认为没有其他实验室会负责任地行事
- 围绕风险沟通方式,BronsonSchoen 批评「我们是负责任的一方所以必须继续」的表态同样有问题,认为末日式风险传播最终只会变成公司互相甩锅;ericlim 则认为圈子普遍低估 AI 技术的量级,缺少「这件事现在就能带来好处」的叙事,积极叙事比「会杀人」式的 doomerism 传播更有效
为什么重要
- 这一表态来自曾身处 OpenAI 核心研究一线、现属 Anthropic 的人员,其首次出现「是否太快」的疑虑本身即是信号
- 线程完整呈现了安全治理圈与前沿实验室一线视角之间的张力:治理提案被批脱离实际,「信风险为何还造」的质疑得到一线回应,而「什么节奏算合适」的正面定义仍付之阙如
- 前 OpenAI 研究员 Aidan Clark:第一次自问 AI 是否发展太快 — _aidan_clark_ · 2026-09-09
- IFP 报告:美国如何为自动化 AI 研发做准备,给出 23 条低风险政策建议 — sjgadler · 2026-09-09
- AI 情景讨论:默认走向或是 Peter Wildeford 的「Scramble」剧本 — sjgadler · 2026-09-09
- 前沿实验室研究员批评安全提案:过度聚焦 RSI、脱离实际 — _aidan_clark_ · 2026-09-09
- 前沿实验室内部人士批 AI 管速提案:脱离实际、过度聚焦 RSI — sjgadler · 2026-09-09
- DeepMind 前研究员批评 AI 治理提案:不提 OpenAI Anthropic 即不合格 — _aidan_clark_ · 2026-09-09
- 前 Anthropic 联创:多数 AI 安全提案根本不了解实验室实情 — _aidan_clark_ · 2026-09-09
- 圈内人剖析:OpenAI没内化风险,Anthropic懂风险却被迫抢跑 — peterwildeford · 2026-09-09
- Aidan Clark 自问 AI 是否太快,前 OpenAI 研究员呼吁以人类福祉为先 — JoHeidecke · 2026-09-09
- Anthropic 研究员回应质疑:哪怕 10% 灭绝风险也要做好 AI — _aidan_clark_ · 2026-09-09
- AI 安全圈争论:「末日式风险传播」是否只会变成公司互相甩锅 — BronsonSchoen · 2026-09-09
- ericlim:与其喊「AI 会杀人」,不如多讲「现在能做成什么好事」 — ericlim · 2026-09-09
第 2 集 · 研究者呼吁审视「10% 灭绝概率」背后的理论假设(2026-09-09,2 条)
安全研究者 sebkrier 提出观点:对于「AI 有 10% 概率导致人类全员死亡」这类 p(doom) 说法,人们应当更主动地质询其底层假设,包括对智能本质的理解、权力如何运作、工具性收敛以及 Omohundro 式的驱动等理论根基。他认为这些关于 AI 灭绝风险的论断并非生物性风险,其背后的理性、信念与核心假设亟待科学审视,而非不加检验地接受。
- 质疑「10% 全员灭绝」论:核心假设亟待科学审视 — lucasmeijer · 2026-09-09
- 安全研究者呼吁: scrutinize「10% 灭绝概率」背后的理论根基 — sebkrier · 2026-09-09
第 3 集 · AI 安全圈激辩:既信风险又留实验室是否自洽(2026-09-09,6 条)
9 月 9 日至 10 日,AI 安全圈围绕「是否应该加入或留在前沿实验室做安全工作」展开一场多轮讨论,由安全研究者 Jeff Ladish 的观点引发,多位从业者跟进表态。
已确认
- Jeff Ladish 认为,从整体看人才过度集中在前沿实验室内部,希望更多人加入 CAISI、UK AISI、Redwood、Palisade 等外部安全机构。
- 但他同时承认,有些非常重要的研究(如可解释性工作)只能在实验室内部进行。他进一步区分:如果认为灾难概率很高,预训练团队成员留在实验室的理由要弱得多;而研究 AI 失控失败案例的人全部离开实验室反而不明智,因为世界急需了解日益强大的智能体如何运作的信息。
- 一位实验室在职员工(据 @hugobowne 转述的讨论)回应外界质疑时表示,留在实验室是因为认为从内部降低风险更有效,同时尊重并支持 Jacob、Joe 等人选择从外部推动安全。
- Jasmine Sun 表示,她仍坚持「AI 无论如何都会被造出来,自己去做对齐与安全防护比让更糟糕的人来做要好」的立场,承认存在认知失调,但认为这比其他选项更好。
- Jacques Thibodeau 针对公众「既然相信 AI 会毁灭人类,为什么还去那里工作」的典型质疑发声,认为持续跟进前沿 AI 发展本身就是一份全职工作,员工有充分理由留在一线边了解边行动,外界应给研究员多一点宽容。
为什么重要
这场争论折射出 AI 安全社区内部长期存在的张力:随着前沿能力加速,安全研究者面临「从内部减灾」与「外部监督」两条路线的选择。讨论中各方并非非此即彼——Ladish 本人既呼吁分流也认可内部研究的价值——共识倾向于按岗位性质(能力研发 vs. 失控研究)与个人判断区分对待,而非对留在实验室的研究者做道德指责。
- 既信 AI 会灭世又留在实验室?业内人呼吁给研究员多一点宽容 — JacquesThibs · 2026-09-09
- 安全圈争论:去前沿实验室做对齐究竟是不是正当选择 — jasminewsun · 2026-09-10
- AI 实验室员工辩安全路线:内部减灾还是外部监督 — hugobowne · 2026-09-10
- 安全研究员 Jeff Ladish:建造超级智能的实验室里也需要留下研究者 — JeffLadish · 2026-09-10
- 安全研究者 Jeff Ladish:实验室人才过度集中,呼吁分流到外部安全机构 — JeffLadish · 2026-09-10
- Jeff Ladish:预训练团队该走可以走,研究 AI 失控的人留在实验室更重要 — JeffLadish · 2026-09-10
第 4 集 · AI 安全叙事转向:模型本身成为最大对手(2026-09-10,2 条)
围绕实验室安全工作的讨论中,kipperrii 等人指出 AI 安全从业者的经典立场——「与其让更差的参与者做出来,不如由我来加速并做好对齐」——正面临动摇。随着竞争格局变化,「我比对手更安全」的传统叙事失效,威胁从模型的恶意使用转向模型本身,业内人士认为这一逻辑虽依然成立但相对安全感已消退。
- AI 安全圈叙事转变:竞争安全感消退,模型本身成最大对手 — kipperrii · 2026-09-10
- 「比对手更安全」叙事正在失效:敌人从 misuse 变成模型本身 — nabla_theta · 2026-09-10