Anthropic 首晒内部数据:Claude 已主导 26% 的 AI 研发工作

APPSO · wechat · 2026-09-18

Anthropic 首次公开「研发自动化指数」,披露 Claude 参与下一代 AI 研发的内部进度与安全监控数据。

研发自动化:采用 EpochAI 的 AL0-AL5 分级,截至 8 月,Claude 能「主导」(AL4)约 26% 的研发工作,2 月这一比例不足 1%;超 90% 任务至少达「AI 协作」水平。尚未有任何工作达到 AL5(全自动部署)。指数由 Claude 分析 Slack/内部文档,抽取约 1.5 万项任务、542 节点任务树构建,Claude 与人类判断完全一致率仅 59%。

Agent 监控:内部平台约 3 万个 Agent 同时工作,8 月作出超 10 亿次决策,仅 0.002% 被实时监控拦截(约每 4.7 万次一次)。事后监控每周标记约 10 万份记录,最终约 50 份交人工审查。Agent 有独立身份,操作可全程溯源。

算力分配:约 6% 的 AI 研发算力流向安全研究,AI 驱动的研发算力中该比例为 12%,公司称此为保守估算。

局限与计划:指标由 Claude 自评、各实验室无统一标准、算力统计仅一周。Anthropic 计划引入第三方独立评估人员进入内部系统持续验证这些指标。递归自我改进虽未实现,但其早期循环已出现在现实研发流程中。

所属事件:Anthropic 披露 Claude 已承担 26% 内部研发(20 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →