GDP.pdf 长文档推理榜:GPT-6 Astra 以 33.2% 居首
ArtificialAnlys · x · 2026-09-05
Artificial Analysis 公布 GDP.pdf 评测的分模型成绩:OpenAI GPT-6 Astra 以 33.2% 领先,GPT-5.6 Sol 达 28.2%,Claude Fable 5.1 以 26.2% 位列第三。
GDP.pdf 由 @HelloSurgeAI 打造,考察跨 100 份 PDF、10 个领域的单轮专业文档推理:模型需综合分布在 4,592 页中的文本、表格、图表、脚注与排除性信息作答,按 1,275 条专家撰写的原子标准评分,全部达标才计入 All-pass Rate 总分。
「模型」频道最新
- 博主称 GPT 6 早期测试表现平平,与 GPT 5.6 Sol 犯相同错误 — RylanSchaeffer · 2026-09-05
- Nous Portal 上架 GPT-6 Astra,优惠 20% — NousResearch · 2026-09-05
- ChatGPT 5.6 十小时证明渗流猜想,Lean 形式化达 10 万行 — burny_tech · 2026-09-05
- LLM 跑 Fiverr 任务基准全员不到 1%,如今已被弃用引质疑 — BLUECOW009 · 2026-09-05
- astra 在 mcbench-v2 上大幅提速,fable 跑数小时后再被刷新 — adonis_singh · 2026-09-05
- Grok 额度耗尽被迫迁移,开发者用 Hermes 重跑流程效果意外满意 — mazzaTalk · 2026-09-05