Step 5 Preview 详细评测:推理领先,Agent 任务全面落后
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 补充 Step 5 Preview 在 Intelligence Index 各项评测的完整明细:Agent 任务是其明显短板,GDPval-AA 1,566 Elo、AA-Briefcase 1,432 Elo、Terminal-Bench 4.0 33%,均落后 GLM-5.3 (max) 与 Qwen3.8 Max;而在知识与推理上反向领先——HLE 46%、CritPt 21%、AA-Omniscience Index 16,均高于两者。
所属事件:Step 5 Preview 评测 44 分:成本击穿、Agent 短板(6 条相关)→
「模型」频道最新
- 吐槽 xAI 重演套路:狂吹 Grok 4.7 却难产,圈内 hype 归零 — flowersslop · 2026-09-22
- xAI 修复 SDK 丢失推理内容的 bug,Grok 4.7 性能显著提升 — ns123abc · 2026-09-22
- Artificial Analysis 发布 TTS 全榜:xAI 87.6% 发音准确率居首 — ArtificialAnlys · 2026-09-22
- xAI 更新 SDK 后性能大增,冲进 Vals 榜单前十 — teortaxesTex · 2026-09-22
- Grok 4.7 价格不再便宜,第三方评测已贵过 Astra — steipete · 2026-09-22
- 8GB 显存 + 64GB 内存,哪款 LLM 最像「百科全书」? — Mangleus · 2026-09-22