Anthropic 公布三项 AI 自我研发追踪指标,评论者称尚非可复现科学
AryHHAry · x · 2026-09-18
Anthropic 发布三项衡量 AI 发展的指标:AI 参与自身研发的程度、AI agent 受监督的水平、算力分配情况,并提供内部快照数据。
评论者 AryHHAry 认为这更接近「测量而非口号」,但覆盖面较窄:只测了速度、监督和算力份额,未衡量公平性、决策可重建性、假设变化下的鲁棒性,以及系统失效时的问责。他也指出了方法论局限:评审可能带偏见、算力切片仅取一周、agent 遥测只来自一个平台。结论是:在第三方能用相同定义复跑评估之前,这只是「披露」,还不是「可复现的科学」。
所属事件:Anthropic 首次公开 AI 自研指标:Claude 主导 26% 研发(15 条相关)→
「漫话AGI」频道最新
- repligate 提出敌意认证概念:黑子反而是最好的信号源 — voooooogel · 2026-09-18
- 素人自述:用业余时间迭代七版,尝试从零构建数字意识 — Le_Golden_Pebbles · 2026-09-18
- AI 如何真正改变货运经纪:从一名经纪人的一天说起 — MatthewChang · 2026-09-18
- 菲尔兹奖得主自认一贯看错,称 AI 风险是应急而非炒作 — inductionheads · 2026-09-18
- 业内人士解析 AGI 实验室为何敢公开谈治理:Coxon 放开了内部言论闸门 — danfaggella · 2026-09-18
- Bloomberg 深度报道 AI 末日论走向主流,专家担忧其挤占更紧迫议题 — rao2z · 2026-09-18