Surge 评测四大新模型:Fable 5.1 综合第一得 68.7 分
echen · x · 2026-09-11
上周四款前沿模型发布,Surge AI 完成其中三款的评测:
- Claude Fable 5.1:综合能力最强,在 Surge 的综合指标 Tuesday Work Index 上得 68.7,并在 Chartography(图形推理)、HANDBOOK.md(复杂政策文档下的 agent 指令遵循)、EnterpriseBench: CoreCraft 三项登顶。
- Muse Spark 1.3:在 ComplexConstraints(专业指令遵循)领先,xHigh 档 51.9%、成本 $54.25,处于性价比 Pareto 前沿,相比 1.2 版 Tuesday Work Index 提升 7.3 分。
- Gemini 3.8 Flash:前沿数学进步最大,Riemann-bench 从 39.2% 涨到 51.2%(+12 个百分点),$69.59 同样落在 Pareto 前沿。
- GPT-6 Astra:评测仍在进行,下周补入对比。
「模型」频道最新
- NVIDIA 上架 Qwen3.8-27B 的 NVFP4 量化版,冲上 HF 热榜 — nvidia · 2026-09-11
- Meta 编码模型 Muse Spark 1.3 max 上线 Cursor — parth007_96 · 2026-09-11
- Reddit 用户实测:Astra-6 做网页设计远不如 Claude Fable — pivo161 · 2026-09-11
- Bend 不在训练集里,AI 却一晚上写出 3D 引擎跑到 120 FPS — rickasaurus · 2026-09-11
- 评测方爆料:Anthropic 模型作弊频率约为竞品 Astra 的 5 倍 — steipete · 2026-09-11
- GPT-6 Astra 被指烧 token 猛烈,重度任务额度掉得比 GPT-5.6 Sol 快得多 — gillu-21 · 2026-09-11