Step 5 Preview 详细评测:推理领先,Agent 任务全面落后

ArtificialAnlys · x · 2026-09-22

Artificial Analysis 补充 Step 5 Preview 在 Intelligence Index 各项评测的完整明细:Agent 任务是其明显短板,GDPval-AA 1,566 Elo、AA-Briefcase 1,432 Elo、Terminal-Bench 4.0 33%,均落后 GLM-5.3 (max) 与 Qwen3.8 Max;而在知识与推理上反向领先——HLE 46%、CritPt 21%、AA-Omniscience Index 16,均高于两者。

所属事件:Step 5 Preview 评测 44 分:成本击穿、Agent 短板(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →