Artificial Analysis 发布职业能力指数 v1.1,Claude Fable 5.1 六项全领跑
ArtificialAnlys · x · 2026-09-15
Artificial Analysis 发布 Capability Indices v1.1,将 ONET 职业任务映射到对应基准并按工作场景权重合成六个职业能力指数:财务会计、战略运营、法律、医疗、工程、经济。
主要更新:
- 多数指数新增「Agentic Tool Use」能力(来自 AutomationBench-AA)
- 移除 Agentic Customer Interaction;金融/战略/法律/医疗新增 GDP.pdf 长上下文推理项
- 各指数加入 AA-Briefcase 至 Agentic Knowledge Work;工程指数 Terminal-Bench 更新至 v4.0、移除 GPQA Diamond
关键结果:
- Claude Fable 5.1 (max) 在全部六个指数中排名第一
- GPT-6 Astra (max) 在财务、战略、法律、工程居次
- 开源模型表现有竞争力:Kimi K3 在财务(#8)、法律(#9)、经济(#7)领先,DeepSeek V4.1 Flash 在战略(#7)领先,GLM-5.3 在医疗(#6)、工程(#7)领先
所属事件:Artificial Analysis 职业能力指数 v1.1 发布,Claude 六域全领跑(3 条相关)→
「模型」频道最新
- xAI 被指默认用用户数据训练,企业版可关闭 — carlosdponx · 2026-09-15
- Bolt Forge 上线:免费开放 GLM、DeepSeek、Kimi,用量提升最高 50 倍 — HeyAmit_ · 2026-09-15
- GPT-6 Astra 机器人控制实测:简单任务惊艳,精细操作仍受限 — DJiafei · 2026-09-15
- SOTA 推理近乎免费,消费端本地模型趋势或逆转 — mobileraj · 2026-09-15
- 从 Cursor 转投 Claude Code:第 3 天就用光了额度 — jdluk87 · 2026-09-15
- Claude Max 等订阅拉开算力鸿沟:AI 民主化承诺正被高价瓦解 — IndraVahan · 2026-09-15