四大模型横评:GPT-6 Astra 与 Claude Fable 5.1 领跑 40 余项基准

HealthySkeptic2000 · reddit · 2026-09-22

一份截至 2026 年 9 月 21 日的大型横评,汇集 Artificial Analysis 与 Vals AI 的公开成绩,对比 Grok 4.7、Claude Fable 5.1、GPT-6 Astra 与 DeepSeek V4.1 Flash 四个前沿模型。要点:- 综合指数:AA Intelligence Index 上 GPT-6 Astra 与 Fable 5.1 并列最高(53),Grok 4.7 为 46,DeepSeek V4.1 Flash 为 39;Vals Index Fable 5.1 领先(68.83%)。- 编程:GPT-6 Astra 在 Terminal-Bench 4.0(AA 口径 59%)、IOI(满分)、代码迁移等项领先;Fable 5.1 在 Vibe Code Bench(90.26%)最强。- 知识推理:Fable 5.1 的 HLE 成绩最高(59%,带工具 65%),但幻觉率高达 73%;DeepSeek 幻觉率 96% 最差。- 专业工作:Fable 5.1 在法律、金融、Excel 建模多项第一,Grok 4.7 仅在 Harvey Legal Agent(19.58%)领先。整体上 Fable 5.1 与 GPT-6 Astra 各占大量星标,Grok 4.7 与 DeepSeek V4.1 Flash 明显掉队。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →