四大模型横评:GPT-6 Astra 与 Claude Fable 5.1 领跑 40 余项基准
HealthySkeptic2000 · reddit · 2026-09-22
一份截至 2026 年 9 月 21 日的大型横评,汇集 Artificial Analysis 与 Vals AI 的公开成绩,对比 Grok 4.7、Claude Fable 5.1、GPT-6 Astra 与 DeepSeek V4.1 Flash 四个前沿模型。要点:- 综合指数:AA Intelligence Index 上 GPT-6 Astra 与 Fable 5.1 并列最高(53),Grok 4.7 为 46,DeepSeek V4.1 Flash 为 39;Vals Index Fable 5.1 领先(68.83%)。- 编程:GPT-6 Astra 在 Terminal-Bench 4.0(AA 口径 59%)、IOI(满分)、代码迁移等项领先;Fable 5.1 在 Vibe Code Bench(90.26%)最强。- 知识推理:Fable 5.1 的 HLE 成绩最高(59%,带工具 65%),但幻觉率高达 73%;DeepSeek 幻觉率 96% 最差。- 专业工作:Fable 5.1 在法律、金融、Excel 建模多项第一,Grok 4.7 仅在 Harvey Legal Agent(19.58%)领先。整体上 Fable 5.1 与 GPT-6 Astra 各占大量星标,Grok 4.7 与 DeepSeek V4.1 Flash 明显掉队。
「模型」频道最新
- Jev 并非传统 LLM,作者撰文向普通人解释其设计原理 — multiply_matrix · 2026-09-22
- 单 token 就够用?开发者呼吁用具体 token 数取代高中低推理档位 — arkuto · 2026-09-22
- 小米 MiMo-V2.6-Pro 开源权重登顶 AA 智能指数,1T 参数 MoE — ArtificialAnlys · 2026-09-22
- Grok 4.7 多次评测仅胜 4.6 0.1 分,作者判定属随机噪声 — PawelHuryn · 2026-09-22
- 小米 MiMo-V2.6-Flash-RL 上架 Hugging Face — Bestlife73 · 2026-09-22
- 小米 MiMo-V2.6-Pro-RL 上架 Hugging Face — Bestlife73 · 2026-09-22