Claude 已主导 Anthropic 26% 研发,新论文提议「理解审计」拦截失控风险

ronbodkin · x · 2026-10-09

一篇新预印本《Comprehension Audits to Mitigate Risks from Automated AI Research》提出,当 AI 研究者已看不懂自己发布的东西时,说明节奏过快——这并非假设:Anthropic 员工称「我意识到我已经不知道自己在做什么了」,OpenAI 的 Daniel Selsam 说「我自己几乎不再看原始代码了」。

论文引用的数据:Claude 主导 Anthropic 约 26% 的研发,并参与 90% 以上;Dario Amodei 承认递归自我改进「正在全行业开始发生」。

所属事件:新论文提出「理解审计」:人类看不懂就暂停 AI 研发(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →