OpenAI研究员Irning:救火式安全补丁挤占超级智能对齐研究
9月10日,OpenAI 研究员 Geoffrey Irving 在推特连发多条帖子,批评当前 AI 公司的安全工作模式:迫于压力优先处理「紧急安全补丁」,而能为超级智能时代经得起考验的对齐研究根本无法开展。
已确认
- Irving 转述与某前沿 AI 公司安全负责人的对话:该公司安全组织分为团队 A(对齐下一代模型)和团队 B(对齐再下一代),但没有任何人在为更远期的模型做对齐工作。
- 他希望 Paul(Christiano)在 OpenAI 的影响力「为我们争取更多时间」——既通过进一步的单边暂停,也通过单边暂停汇聚成更大规模乃至国际层面的协调暂停。
- 争取到的时间可用于 Paul 的本职对齐研究以及 Resolution 等类似机构的工作,尝试更严谨的对齐方案。
- Irving 担忧监控 agent 行为正变得越来越困难,下一波 agent 集群(agent swarm)出问题可能完全不被察觉;Paul 的影响力甚至可能换来又一次「警告信号」(warning shot)。
- 他认为暂停与能力回退还能改变激励机制,促使 AI 开发者追求更高的对齐置信度。
为什么重要
- 这是一位在职前沿实验室研究员公开承认:公司安全资源几乎全部投入近两代模型,长期对齐研究缺位,与「为超级智能做准备」的公开叙事存在张力。
- 帖子将「争取时间」(暂停/回退)与「用好时间」(严谨对齐研究)连接起来,提出以激励机制而非仅靠研究投入来提升对齐置信度的思路。
2026-09-10 ~ 2026-09-10 · 5 条相关
一手来源
- Irving:AI 公司救火式安全补丁挤掉了面向超级智能的对齐研究 — geoffreyirving ·
- 安全研究员爆料:AI公司安全团队只顾下两代模型 — geoffreyirving ·
- Irving 警告:下一波 agent 集群失控可能完全不被察觉 — geoffreyirving ·
- OpenAI 研究员 Irving:盼 Paul 的影响力为对齐研究争取更多时间 — geoffreyirving · 2026-09-10
- 【源头】Irving 警告:下一波 agent 集群失控可能完全不被察觉 — geoffreyirving · 2026-09-10
- Irving:暂停和回退能激励 AI 开发者追求更高对齐置信度 — geoffreyirving · 2026-09-10
- 【源头】Irving:AI 公司救火式安全补丁挤掉了面向超级智能的对齐研究 — geoffreyirving · 2026-09-10
- 【源头】安全研究员爆料:AI公司安全团队只顾下两代模型 — geoffreyirving · 2026-09-10