AA-Briefcase 榜单:Claude Fable 5.1 与 Opus 5 领先,GPT-6 Astra 猛追 85 Elo
ArtificialAnlys · x · 2026-09-05
Artificial Analysis 公布 v4.2 中自研智能体知识工作评测 AA-Briefcase 的分模型成绩:
- Anthropic 的 Claude Fable 5.1 与 Opus 5 领跑,GPT-6 Astra 与 Muse Spark 1.3 紧随其后。
- GPT-6 Astra 较 GPT-5.6 Sol 有约 85 Elo 的大幅提升。
该评测用私有 held-out 测试集,让模型完成数周长、含数千输入文件的真实知识工作项目,结合 rubric 与 pairwise 评分综合考察任务成功、分析质量与呈现质量。
「模型」频道最新
- 博主称 GPT 6 早期测试表现平平,与 GPT 5.6 Sol 犯相同错误 — RylanSchaeffer · 2026-09-05
- Nous Portal 上架 GPT-6 Astra,优惠 20% — NousResearch · 2026-09-05
- ChatGPT 5.6 十小时证明渗流猜想,Lean 形式化达 10 万行 — burny_tech · 2026-09-05
- LLM 跑 Fiverr 任务基准全员不到 1%,如今已被弃用引质疑 — BLUECOW009 · 2026-09-05
- astra 在 mcbench-v2 上大幅提速,fable 跑数小时后再被刷新 — adonis_singh · 2026-09-05
- Grok 额度耗尽被迫迁移,开发者用 Hermes 重跑流程效果意外满意 — mazzaTalk · 2026-09-05