Artificial Analysis 发布智能指数 v4.2:40% 权重改用私有测试集防刷榜
ArtificialAnlys · x · 2026-09-05
Artificial Analysis 提前释放部分 v5 内容,发布 Intelligence Index v4.2 中期更新,距 v4 发布已 8 个月。要点:
- 新增 AA-Briefcase:自研的智能体知识工作评测,采用私有 held-out 测试集,模型需完成数周长、含数千输入文件的多任务项目,结合 rubric 与 pairwise 评分考察任务成功率、分析质量与呈现质量。
- 新增 GDP.pdf(@HelloSurgeAI 出品):跨 100 份 PDF、10 个领域的单轮专业文档推理,需综合 4,592 页文本/表格/图表证据,按 1,275 条专家标准打分,全部通过才计入 All-pass Rate。
- 防刷榜:私有 held-out 测试集权重升至 40%(v4.1 的两倍),含 AA-Briefcase、AA-Omniscience 及 CritPt 解答,v5 还将继续提高。
- 移除已饱和的 GPQA Diamond;升级 AA-LCR v1.1 评分体系与采样/Elo 校准。
官方称因近期前沿模型发布过快,才打破惯例推出中期更新,v5 及更多增量版本将陆续推出。
所属事件:Artificial Analysis 发布智能指数 v4.2 并公开完整方法论(3 条相关)→
「模型」频道最新
- 博主晒「Astra」生成细节:连背面板都有,直呼离谱 — adonis_singh · 2026-09-05
- 博主实测「Astra」模型:称首次被模型表现震撼到失语 — adonis_singh · 2026-09-05
- 博主称 GPT 6 早期测试表现平平,与 GPT 5.6 Sol 犯相同错误 — RylanSchaeffer · 2026-09-05
- Nous Portal 上架 GPT-6 Astra,优惠 20% — NousResearch · 2026-09-05
- ChatGPT 5.6 十小时证明渗流猜想,Lean 形式化达 10 万行 — burny_tech · 2026-09-05
- LLM 跑 Fiverr 任务基准全员不到 1%,如今已被弃用引质疑 — BLUECOW009 · 2026-09-05