AA 情报指数 v4.2 上线:更复杂任务加私有测试集,防模型刷榜
shuchaobi · x · 2026-09-05
Artificial Analysis 发布 Intelligence Index v4.2 中期更新,为即将到来的 v5 提前提速:
- 新增 AA-Briefcase:带私有测试集的 agentic 知识工作评测;
- 新增 Surge AI 的 GDP.pdf:跨 4,592 页 PDF 的长文档推理评测;
- 移除已饱和的 GPQA Diamond;
- 加大 held-out 私有测试集权重,升级判分基础设施,明确目标是防止模型针对性刷分。
转发者 EdwardSun0909 借此阴阳 muse spark 1.3 是「可用性拉满、恰好跑分也好看」的模型,暗示其高分与基准设计有关。
所属事件:Artificial Analysis 发布智能指数 v4.2,新增两大评测榜(9 条相关)→
「模型」频道最新
- GPT-6 Astra 全球推送数小时,早期用户称其为最真实模型 — imadade · 2026-09-05
- 用户实测 GPT-6 Astra 电脑操作:能同时点多个微按钮 — JasonBotterill · 2026-09-05
- OpenAI Astra 被曝提前上线:被指在「swarm 事件」曝光后急于全量推送 — repligate · 2026-09-05
- 新 Artificial Analysis 榜单出炉,Qwen 3.8 27B 仍站得住脚 — RedditUsr2 · 2026-09-05
- 「AGI 了?」用户实测 Astra 写作称仅达 GPT-4 水平,大失所望 — jtteop · 2026-09-05
- Simonw 实测 GPT-6 Astra 与 5.6 全系 SVG 对比:单次最贵 63 美分 — gaganghotra_ · 2026-09-05