Anthropic 公布三项 AI 自我研发追踪指标,评论者称尚非可复现科学

AryHHAry · x · 2026-09-18

Anthropic 发布三项衡量 AI 发展的指标:AI 参与自身研发的程度、AI agent 受监督的水平、算力分配情况,并提供内部快照数据。

评论者 AryHHAry 认为这更接近「测量而非口号」,但覆盖面较窄:只测了速度、监督和算力份额,未衡量公平性、决策可重建性、假设变化下的鲁棒性,以及系统失效时的问责。他也指出了方法论局限:评审可能带偏见、算力切片仅取一周、agent 遥测只来自一个平台。结论是:在第三方能用相同定义复跑评估之前,这只是「披露」,还不是「可复现的科学」。

所属事件:Anthropic 首次公开 AI 自研指标:Claude 主导 26% 研发(15 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →