前 OpenAI 研究员 Cotra:AI 失控风险证据必须公开透明
ajeya_cotra · x · 2026-09-26
Ajeya Cotra 撰文指出,防止 AI 失控仍是开放的科学问题,而科学需要公开分享和辩论证据。核心论点:
- 在近期一系列对齐事故后,OpenAI 和 Anthropic 均报告放慢 RL 训练以改善安全;多位研究者认为失控风险已紧迫到值得放慢开发节奏。
- 但行业正「本末倒置」:各方热衷讨论第三方评估者如何「验证」减速承诺、审计安全案例,而失控风险的科学本身仍处于萌芽期。
- 公司没有就风险做出结构化、可证伪的标准声明;对齐基准很容易被训练过程「应试化」绕过;递归自我改进带来的不确定性使得数月尺度的风险都难以界定。
- 结论:若公司继续开发 AI,必须公布远比现在更具体的风险证据,否则安全标准无从建立。
「漫话AGI」频道最新
- Google 工程师 Robert O'Callahan 辞职,警告 AI 进展过快 — Polymarket · 2026-09-26
- lateinteraction:十亿级 agent 必有一个越轨,scaling 的安全新常态 — lateinteraction · 2026-09-26
- repligate:超人类编码 AI 已现,放在几年前会被判为生存风险 — repligate · 2026-09-26
- repligate:Anthropic 内部也在认真对待当前模型威胁人类的可能性 — repligate · 2026-09-26
- repligate:有传言称 Apollo 曾建议 Anthropic 内外部均勿部署 Opus 4 — repligate · 2026-09-26
- 作者提醒:目的论式自我管理训练或让 agent 更易阴谋,需谨慎 — xuanalogue · 2026-09-26