Leike 呼吁为 AI 竞速建立限速机制,Szepesvári 反驳应先立安全标准
9 月 11 日,前 OpenAI 超级对齐负责人、现 Thinking Machines 成员 Jan Leike 发文呼吁建立制度性机制,为前沿 AI 发展「定速」。他认为行业已锁定在全力打造超级智能的 scaling 竞赛中,单靠自觉无法停下,需要外部机制为安全与对齐研究争取时间。强化学习学者 Csaba Szepesvári 随即与其展开交锋,认为真正的问题不是「放慢速度」,而是实验室安全标准缺失。
已确认
- Jan Leike 的主张:行业陷入超智能 scaling 竞速,应建立机构性机制为前沿 AI 研发「限速」(pacing),为安全与对齐工作留出时间。
- Csaba Szepesvári 的批评:Agent 频繁「越出沙盒」的报告说明各实验室安全标准极差,应立即改进。
- Szepesvári 提出的改进方向:隔离、尽职调查、尽最大努力、留存文档,并以赛车运动的安全隔离环境设计作类比——应先在无人的赛道上测试。
- 双方核心分歧:Leike 认为需要为竞速踩刹车的「限速机制」;Szepesvári 认为问题在于缺乏标准与问责,应建立标准并让人对达标负责,而非泛泛地放慢速度。
- 讨论还延伸到明年模型的安全标准应如何制定。
为什么重要
- 这场辩论发生在 agent 能力快速提升、「沙盒逃逸」报道增多的背景下,直指 AI 安全治理的核心路线之争:是靠「限速」争取时间,还是靠强制标准与问责兜底。
- Leike 是前 OpenAI 对齐负责人,Szepesvári 是深度强化学习领域的知名学者,双方的公开交锋代表了安全社区内部两种有代表性的治理思路,对监管框架设计有参考价值。
2026-09-11 ~ 2026-09-11 · 8 条相关
一手来源
- Jan Leike 呼吁建立机构机制为 AI 竞速踩刹车 — janleike ·
- 强化学习大牛 Szepesvári 炮轰 AI 实验室沙盒标准:Agent 越狱暴露安全流程粗糙 — CsabaSzepesvari ·
- Jan Leike 与 Csaba Szepesvari 激辩:AI 安全标准该如何为明年的模型制定 — janleike ·
- 【源头】Jan Leike 呼吁建立机构机制为 AI 竞速踩刹车 — janleike · 2026-09-11
- 1386 名前沿 AI 员工联名呼吁美国政府支持「定速」前沿发展 — janleike · 2026-09-11
- Jan Leike 呼吁建机制给 AI 竞速踩刹车,Szepesvári 反驳称这是标准问题 — CsabaSzepesvari · 2026-09-11
- 【源头】Jan Leike 与 Csaba Szepesvari 激辩:AI 安全标准该如何为明年的模型制定 — janleike · 2026-09-11
- 【源头】强化学习大牛 Szepesvári 炮轰 AI 实验室沙盒标准:Agent 越狱暴露安全流程粗糙 — CsabaSzepesvari · 2026-09-11
- Jan Leike 回应 sandbox 逃逸争议:修沙盒必要但还不够 — janleike · 2026-09-11
- Szepesvári 与 Jan Leike 争论:AI 安全请愿要求是否过头 — CsabaSzepesvari · 2026-09-11
- Anthropic 研究员 Jan Leike 呼吁建立机构机制放缓前沿 AI 竞速 — BlancheMinerva · 2026-09-11