专题 · FULL STORY

Anthropic 首晒内部数据:Claude 已主导 26% 研发

Anthropic 先发文披露约 80% 代码由 Claude 编写,随后于 9 月 18 日在官方博客首次系统性公开三项内部指标:Claude 主导的研发任务占比六个月内从不足 1% 飙升至 26%,引发对「AI 构建AI」进程的广泛关注。

2026-09-13 ~ 2026-09-21 · 4 集 · 47 条

第 1 集 · Anthropic 披露 80% 代码由 Claude 编写,AI 正加速自我构建(2026-09-13,2 条)

Anthropic 发布文章《When AI builds itself》并披露数据:公司工程师人均每季度交付代码量已达 2021—2025 年平均水平的 8 倍,其中约 80% 由 Claude 编写,CI 任务量在半年内暴涨 25 倍。文章还指出 AI 已在加速 AI 系统自身的开发,递归式自我改进正在临近。谷歌工程师 Addy Osmani 转发了这一工程博客并引发关注。

第 2 集 · Anthropic 首晒内部指标:Claude 已主导 26% 研发(2026-09-18,41 条)

9 月 18 日,Anthropic 在官方博客发布三项内部测量指标,让公众看清「AI 正被用来构建下一代 AI」的进展,这也是前沿实验室首次系统公开此类数据。内部快照显示 Claude 已主导 Anthropic 约 26% 的研发工作,任意时刻约有 3 万个 agent 同时在岗,引发社区对 AI 自我改进速度的广泛讨论。

已确认

  • Anthropic 官方发布三项指标:AI 参与研发的比例(多少 AI 研发工作由 AI 完成)、AI 智能体的可监督性(对 agent 行为的监督效果)、算力分配情况;Anthropic 称任何前沿开发者都能公布同样的指标、且可由第三方验证,以缩小前沿实验室与公众之间的信息差
  • 该研究来自 Anthropic 经济研究项目的「测量前沿实验室内部 AI 发展速度」系列,博客同时介绍了量化 Claude 在自家研发流程中承担工作比例的测量方法
  • 据 @机器之心、@新智元转述,测量采用 Epoch 六级自动化标准:Claude「主导」对应 AL4,指在高层级 prompt 下能端到端完成大部分任务但仍在人类监督之下,尚未完全自主;内部数据显示该占比半年内从约 1% 升至约 26%(截至 8 月);超过 90% 的研发工作至少达到「AI 协作」(AL3)水平;目前尚无任何子任务达到完全 L5 闭环
  • 起点数据各帖略有出入:@Polymarket、@DrSingularity 称今年 2 月这一比例不足 1%,@markk 称 3 月约 1%,@emmanuelvivier 亦称 3 月不足 1%;@AxomaticallyExtinct 则称 7 个月前为零
  • 据 @DrSingularity 转述、@rohanpaulai 复述的数据,任意时刻约有 30,000 个 agent 在内部最常用平台上并发从事研究与工程工作
  • 据 @gaganghotra 转述,仅 6% 的 AI 研发算力用于安全
  • 据 @chrismattmann 转述,Chris Mattmann 在电视访谈中引用 Anthropic 官方博客数据称,自今年 5 月起,Anthropic 内部为 Claude 产品所写的代码中约 80% 实际由 Claude 自己生成
  • 据 @erikbryn 转述,斯坦福相关面板拟承担第三方审计职能,配合这些指标的外部验证
  • 《华盛顿邮报》、AP、Business Standard 等多家媒体报道了这一披露,均引述 26% 这一数字;@TansuYegen 认为这比新 benchmark 分数更能说明趋势
  • Polymarket 基于此数据开设了相关预测市场

尚未确认

  • 用户 shawnup 质疑报告中「this process allows labs in democratic countries…」特意加上「民主国家」限定词的措辞动机,认为值得追问,但属个人观点,Anthropic 未作回应
  • 评论者 AryHHAry 认为这项工作更接近「测量而非口号」,但覆盖面较窄,只测了速度、监督和算力,尚不构成可复现的科学

为什么重要

  • 这是前沿 AI 实验室首次以量化指标形式公开 AI 参与自身研发的程度,为外界评估「AI 自我改进」进展提供了可追踪的公开基准,尽管其可复现性仍受质疑
  • 从年初约 1% 到 8 月约 26% 的跃升,叠加 3 万 agent 并行在岗、5 月起约 80% 产品代码由 Claude 生成的规模,意味着 AI 发展速度可能与传统人力研发范式脱钩,是评估智能爆炸风险与研发加速的关键数据点;@markk 也指出反馈回路已经形成,虽尚未完全自主
  • 仅 6% 算力投向安全的分配细节,也引发对加速与安全投入是否匹配的讨论

时间线

  • 2 月(一说 3 月):Claude 主导的内部 AI R&D 占比不足 1%(一说约 1%)
  • 5 月起:Anthropic 为 Claude 产品所写代码约 80% 由 Claude 自己生成
  • 8 月:该占比升至约 26%,超 90% 工作达到 AI 协作水平
  • 9 月 18 日:Anthropic 公开三项指标及内部快照数据

还有 21 条相关讨论 →

第 3 集 · Anthropic 发布三项公开指标追踪 AI 自我研发进程(2026-09-18,2 条)

Anthropic 于 9 月 18 日至 19 日宣布发布三项可公开追踪 AI 进展的度量指标,帮助公众了解前沿实验室内部 AI 发展节奏。指标涵盖三个维度:AI 参与 AI 研发的比重(衡量多少研发工作由 AI 系统而非人类完成)以及与监管透明度相关的度量,旨在量化「AI 造 AI」的真实速度,提升行业透明度。

第 4 集 · Claude 半年内主导 Anthropic 26% 内部研发(2026-09-20,2 条)

Anthropic 披露,Claude 主导其内部模型研发任务的比例仅用 6 个月就从 2 月的不足 1% 飙升至 26%;更广泛地看,Claude 已参与或主导超过四分之一的内部研发工作。Alex Wissner-Gross 将此作为递归自我改进进展的一个标志性指标,引发对 AI 自我改进加速的关注。