AA 发布智能指数 v4.2:私有测试集防刷榜,两大新榜分化
Artificial Analysis 于 9 月 5 日发布 Intelligence Index v4.2 中期更新,将原定 v5 的部分内容提前放出,以跟上前沿模型迭代节奏,距 v4 发布已过去 8 个月。新版任务更复杂、更贴近真实场景,40% 权重改用私有测试集以防刷榜,并新增自研智能体知识工作评测 AA-Briefcase 与 GDP.pdf 长文档推理榜,同时公开完整评测方法论。
已确认
- 指数更新:v4.2 任务更复杂、更真实,40% 权重使用私有测试集,降低公开基准被针对性优化的风险。alexandrwang 转发评论称 Muse spark 1.3 max 表现依旧强劲,效率前沿基本延续。
- AA-Briefcase:自研智能体知识工作评测首次随 v4.2 一并发布分模型成绩。Anthropic 的 Claude Fable 5.1 与 Opus 5 领跑,OpenAI 的 GPT-6 Astra 落后约 85 Elo,处于猛追态势。
- GDP.pdf 长文档推理榜:GPT-6 Astra 以 33.2% 排名第一,GPT-5.6 Sol 以 28.2% 次之,Claude Fable 5.1 以 26.2% 位列第三。
- token 效率:GPT-6 Astra 在 v4.2 的 token 效率维度领先。
- 方法论公开:Artificial Analysis 公开 v4.2 完整评测方法论页面,说明指数如何综合推理、知识、数学与编程等十余项基准刻画模型整体智能,并坦承任何评测指标都有局限。
为什么重要
- 40% 权重转向私有测试集,是对公开基准数据污染与刷榜问题的直接回应,可能影响各家实验室的优化策略。
- GDP.pdf 与 AA-Briefcase 两大新榜呈现分化格局:OpenAI 占优长文档推理,Anthropic 占优智能体知识工作,为模型选型提供了更细粒度的参考。
2026-09-05 ~ 2026-09-05 · 7 条相关
一手来源
- Artificial Analysis 发布智能指数 v4.2:40% 权重改用私有测试集防刷榜 — ArtificialAnlys ·
- Artificial Analysis 发布智能指数 v4.2:GPT-6 Astra token 效率领先 — ArtificialAnlys ·
- Artificial Analysis 公开智能评测完整方法论,覆盖十余项基准 — ArtificialAnlys ·
- 【源头】Artificial Analysis 发布智能指数 v4.2:40% 权重改用私有测试集防刷榜 — ArtificialAnlys · 2026-09-05
- 【源头】Artificial Analysis 发布智能指数 v4.2:GPT-6 Astra token 效率领先 — ArtificialAnlys · 2026-09-05
- AA-Briefcase 榜单:Claude Fable 5.1 与 Opus 5 领先,GPT-6 Astra 猛追 85 Elo — ArtificialAnlys · 2026-09-05
- GDP.pdf 长文档推理榜:GPT-6 Astra 以 33.2% 居首 — ArtificialAnlys · 2026-09-05
- 【源头】Artificial Analysis 公开智能评测完整方法论,覆盖十余项基准 — ArtificialAnlys · 2026-09-05
- AA 智能指数 v4.2 发布:Muse spark 1.3 max 表现依旧强势 — gaotianyu1350 · 2026-09-05
另有 1 条近重复转述:ArtificialAnlys