Artificial Analysis 发布智能指数 v4.2:GPT-6 Astra token 效率领先
ArtificialAnlys · x · 2026-09-05
Artificial Analysis 宣布发布 Intelligence Index v4.2,将原定 v5 的部分更新提前放出以跟上前沿节奏。新版任务更复杂、更真实,并加入更多私有测试集以防刷榜。本次更新包括:自研的 agentic 知识工作评测 AA-Briefcase(私有测试集)以及接入 @HelloSurgeAI 的 GDP.pdf 等基准。
在 token 效率方面,GPT-6 Astra 在接近智能前沿的模型中几乎是最省 token 的;而在指数得分至少 25 分的模型中,Claude Fable 5.1 和 Gemini 3.8 Flash 用的 token 最多。
所属事件:Artificial Analysis 发布智能指数 v4.2 并公开完整方法论(3 条相关)→
「模型」频道最新
- 博主称 GPT 6 早期测试表现平平,与 GPT 5.6 Sol 犯相同错误 — RylanSchaeffer · 2026-09-05
- Nous Portal 上架 GPT-6 Astra,优惠 20% — NousResearch · 2026-09-05
- ChatGPT 5.6 十小时证明渗流猜想,Lean 形式化达 10 万行 — burny_tech · 2026-09-05
- LLM 跑 Fiverr 任务基准全员不到 1%,如今已被弃用引质疑 — BLUECOW009 · 2026-09-05
- astra 在 mcbench-v2 上大幅提速,fable 跑数小时后再被刷新 — adonis_singh · 2026-09-05
- Grok 额度耗尽被迫迁移,开发者用 Hermes 重跑流程效果意外满意 — mazzaTalk · 2026-09-05