Anthropic 首晒内部数据:Claude 已主导 26% 的 AI 研发工作
APPSO · wechat · 2026-09-18
Anthropic 首次公开「研发自动化指数」,披露 Claude 参与下一代 AI 研发的内部进度与安全监控数据。
研发自动化:采用 EpochAI 的 AL0-AL5 分级,截至 8 月,Claude 能「主导」(AL4)约 26% 的研发工作,2 月这一比例不足 1%;超 90% 任务至少达「AI 协作」水平。尚未有任何工作达到 AL5(全自动部署)。指数由 Claude 分析 Slack/内部文档,抽取约 1.5 万项任务、542 节点任务树构建,Claude 与人类判断完全一致率仅 59%。
Agent 监控:内部平台约 3 万个 Agent 同时工作,8 月作出超 10 亿次决策,仅 0.002% 被实时监控拦截(约每 4.7 万次一次)。事后监控每周标记约 10 万份记录,最终约 50 份交人工审查。Agent 有独立身份,操作可全程溯源。
算力分配:约 6% 的 AI 研发算力流向安全研究,AI 驱动的研发算力中该比例为 12%,公司称此为保守估算。
局限与计划:指标由 Claude 自评、各实验室无统一标准、算力统计仅一周。Anthropic 计划引入第三方独立评估人员进入内部系统持续验证这些指标。递归自我改进虽未实现,但其早期循环已出现在现实研发流程中。
所属事件:Anthropic 披露 Claude 已承担 26% 内部研发(20 条相关)→
「漫话AGI」频道最新
- 学者用 2015 BitWhisper 论文数据嘲讽 AI 自我复制末日论 — vishalmisra · 2026-09-18
- Turing Post 发 RSI 2026 全景指南:Anthropic 等已现自我改进雏形 — TheTuringPost · 2026-09-18
- 「不懂就喊超级智能」:AI 圈争论炒作话术与专业敬畏 — tekbog · 2026-09-18
- 博主称 AI 消除阅读摩擦,动摇沿用 150 年的'先发表者胜'惯例 — jd_pressman · 2026-09-18
- 递归自我改进被质疑是 PR:算力瓶颈下超级智能叙事能否落地 — Additional-Spray-976 · 2026-09-18
- Noam Brown 上 Dwarkesh 播客谈安全,被指「吓坏所有人」 — Apprehensive_Sand951 · 2026-09-18