Step 5 Preview 评测 44 分:成本击穿、Agent 短板
Artificial Analysis 于 09-22 发布对阶跃星辰新旗舰 Step 5 Preview 的完整评测:模型总分 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max, 45 分) 与 Qwen3.8 Max,在榜单 202 个模型中排第 26。综合看,这是一款以极低价格为最大卖点、推理能力领先但 Agent 能力偏弱的旗舰模型。
已确认
- 模型规格与总分:600B 总参数/27B 激活,Intelligence Index 44 分,列第 26;输出速度 92.8 token/秒,快于均值 71;定价 $1/$2.70 每百万 token,均低于中位数。
- 推理与 Agent 表现:推理能力领先,但 Agent 任务全面落后是明显短板,GDPval-AA 1,566 Elo、AA-Briefcase 1,4xx(帖子未给出完整数值)。
- 知识与幻觉:AA-Omniscience 准确率 42%,超过 GLM-5.3 (max, 753B, 34%),略高于参数量对应的事实召回趋势线;但 43% 的作答存在幻觉。
- 成本优势:跑完 Intelligence Index 每任务约 $0.72,同分的 Kimi K3 (max) 约 $2.00,多 1 分的 GLM-5.3 (max) 更贵;Artificial Analysis 评价其是靠定价而非省 token 击穿成本线,成本约为同级模型的 1/2.8。
为什么重要
Step 5 Preview 展示了一条差异化路线:不以绝对分数取胜,而以 44 分智能水平配合约 1/2.8 的任务成本抢占性价比段位。但其 43% 的幻觉率与 Agent 短板提示,在高可靠性要求的自动化场景中仍需谨慎评估。
2026-09-22 ~ 2026-09-22 · 6 条相关
- 第 1 集:阶跃星辰发布 Step 5 Preview 主打性价比前沿(2026-09-21,3 条)
- 第 2 集:Step 5 Preview 评测 44 分:成本击穿、Agent 短板(2026-09-22,6 条)
一手来源
- 阶跃 Step 5 Preview 评测 44 分,成本仅同级模型 1/2.8 — ArtificialAnlys ·
- Step 5 Preview 上榜 Artificial Analysis:智力第 26,速度与价格中上 — ArtificialAnlys ·
- 每任务 $0.72:Step 5 Preview 用定价而非省 token 击穿成本线 — ArtificialAnlys ·
- 【源头】阶跃 Step 5 Preview 评测 44 分,成本仅同级模型 1/2.8 — ArtificialAnlys · 2026-09-22
- StepFun Step 5 Preview 每 task 成本仅 $0.72,追平 Kimi K3 省 2.8 倍 — ArtificialAnlys · 2026-09-22
- 【源头】每任务 $0.72:Step 5 Preview 用定价而非省 token 击穿成本线 — ArtificialAnlys · 2026-09-22
- Step 5 Preview 知识超 GLM-5.3,但 43% 作答会幻觉 — ArtificialAnlys · 2026-09-22
- Step 5 Preview 详细评测:推理领先,Agent 任务全面落后 — ArtificialAnlys · 2026-09-22
- 【源头】Step 5 Preview 上榜 Artificial Analysis:智力第 26,速度与价格中上 — ArtificialAnlys · 2026-09-22