Artificial Analysis 发布 v1.1 职业能力指数,Claude 全六域领跑
ArtificialAnlys · x · 2026-09-15
Artificial Analysis 更新其 Capability Indices 至 v1.1,将 ONET 职业任务映射到对应基准并按能力在职业中出现的频率加权,覆盖六个领域:金融会计、战略运营、法律、医疗、工程、经济。
主要变化:
- 多个领域新增「Agentic Tool Use」能力(来自 AutomationBench-AA)
- 移除「Agentic Customer Interaction」
- 长上下文推理加入 GDP.pdf,知识型 agent 工作加入 AA-Briefcase
- 医疗新增 Long-Context Reasoning(MLCR-AA);工程端 Terminal-Bench 升级到 v4.0,移除 GPQA Diamond
关键结果:
- Claude Fable 5.1 (max) 在全部六个指数中排名第一
- GPT-6 Astra (max) 在金融、战略、法律、工程四个领域居第二
- 开源权重模型表现有竞争力:Kimi K3 (max) 在金融(#8)、法律(#9)、经济(#7)领先开源,GDP 方面 DeepSeek V4.1 Flash (max) 战略运营 #7,GLM-5.3 (max) 医疗 #6、工程 #7
所属事件:Artificial Analysis 职业能力指数 v1.1 发布,Claude 六域全领跑(3 条相关)→
「模型」频道最新
- xAI 被指默认用用户数据训练,企业版可关闭 — carlosdponx · 2026-09-15
- Bolt Forge 上线:免费开放 GLM、DeepSeek、Kimi,用量提升最高 50 倍 — HeyAmit_ · 2026-09-15
- GPT-6 Astra 机器人控制实测:简单任务惊艳,精细操作仍受限 — DJiafei · 2026-09-15
- SOTA 推理近乎免费,消费端本地模型趋势或逆转 — mobileraj · 2026-09-15
- 从 Cursor 转投 Claude Code:第 3 天就用光了额度 — jdluk87 · 2026-09-15
- Claude Max 等订阅拉开算力鸿沟:AI 民主化承诺正被高价瓦解 — IndraVahan · 2026-09-15