Artificial Analysis 发布 v1.1 能力指数:六大职业域模型排行上线
ArtificialAnlys · x · 2026-09-15
Artificial Analysis 宣布 Capability Indices v1.1,将 Intelligence Index v4.3 的评测切片与专项评测组合,并更新权重。该指数把 ONET 职业任务映射到对应 benchmark,按能力在各职业中的出现频率加权,覆盖六大领域:
- 金融与会计:商业知识、智能体知识工作、推理、工具调用、长文本分析、抗幻觉
- 战略与运营:商业知识、跨业务应用的智能体工具调用、长文本分析
- 法律:法律知识、智能体知识工作、长文档分析、抗幻觉
- 医疗健康:临床知识、病历长文本推理、临床推理、抗幻觉
- 工程:工程知识、量化推理、智能体执行、终端使用(含 Terminal-Bench v4.0、CritPt)
- 经济:经济知识、量化推理、智能体执行、长文本分析
涉及的基准包括 AA-Omniscience、GDPval-AA v2、AA-Briefcase、Humanity's Last Exam、AutomationBench-AA、AA-LCR v1.1 等。已发布分数均已按新权重更新。
所属事件:Artificial Analysis 职业能力指数 v1.1 发布,Claude 六域全领跑(3 条相关)→
「模型」频道最新
- xAI 被指默认用用户数据训练,企业版可关闭 — carlosdponx · 2026-09-15
- Bolt Forge 上线:免费开放 GLM、DeepSeek、Kimi,用量提升最高 50 倍 — HeyAmit_ · 2026-09-15
- GPT-6 Astra 机器人控制实测:简单任务惊艳,精细操作仍受限 — DJiafei · 2026-09-15
- SOTA 推理近乎免费,消费端本地模型趋势或逆转 — mobileraj · 2026-09-15
- 从 Cursor 转投 Claude Code:第 3 天就用光了额度 — jdluk87 · 2026-09-15
- Claude Max 等订阅拉开算力鸿沟:AI 民主化承诺正被高价瓦解 — IndraVahan · 2026-09-15