Artificial Analysis 发布智能指数 v4.3:引入 Terminal-Bench 4.0 与 Zapier 工作流基准
SteppenAxolotl · reddit · 2026-09-08
Artificial Analysis 发布 Intelligence Index v4.3,是向 v5 过渡的又一轮升级:
- Terminal-Bench 2.1→4.0:66 个多步终端任务,评测框架从 Terminus 2 换为 mini-SWE-agent
- 用 AutomationBench-AA 替换 τ³-Banking:基于 Zapier 的私有测试集,657 个跨 Gmail/Slack/Salesforce/Jira 的业务工作流,私有测试集权重从 40% 升至 45%
关键结果:Claude Fable 5.1 与 GPT-6 Astra 并列榜首(53 分),Claude Opus 5(51)、Claude Fable 5(50)紧随;开源模型中 GLM-5.3 与 Kimi K3 以 44 分领先,DeepSeek V4 Pro 为 36。成本效率前沿由 OpenAI 主导,GPT-6 Astra 五档推理强度均以最低单任务成本占位。
所属事件:Artificial Analysis 发布智能指数 v4.3,引入私有测试集(3 条相关)→
「模型」频道最新
- 实测称 Astra 浏览器操作能力不错,速度仍偏慢 — jobergum · 2026-09-08
- Codex 实用技巧:让 Astra 读取剩余额度百分比,用英语设预算跑长任务 — Dimillian · 2026-09-08
- Matt Shumer 盛赞 GPT-6 Pro「是个怪物」,细节未明 — msg · 2026-09-08
- 「不是我不够聪明,是旧模型太烂」:强模型改变使用强度 — teortaxesTex · 2026-09-08
- Astra 宣布全球重置付费订阅用量,今天 6pm PST 生效 — infoxiao · 2026-09-08
- Codex 7 天限额可视化上线:红色表示跑在限额「前面」,绿色为「后面」 — lucasmeijer · 2026-09-08