专题 · FULL STORY
阶跃星辰Step 5 Preview:发布与首测
阶跃星辰于9月21日发布新一代旗舰模型 Step 5 Preview,主打成本与能力帕累托前沿的性价比定位。次日 Artificial Analysis 发布完整评测,给出44分并与 Kimi K3 对比,指出其成本击穿但 Agent 能力存在短板。
2026-09-21 ~ 2026-09-22 · 2 集 · 9 条
第 1 集 · 阶跃星辰发布 Step 5 Preview 主打性价比前沿(2026-09-21,3 条)
阶跃星辰发布新一代旗舰模型 Step 5 Preview,官方定位为「推进帕累托前沿」,即成本与能力的最优平衡,定价具有竞争力,并同步推出 Step Pla 平台。早期测试者 omarsar0 以编程 agent 场景为主实测,结论是该模型处于成本-能力帕累托前沿,长任务表现优于 GLM 5.3,且知道何时停下,性价比可对标 GLM、Kimi 等旗舰模型。
- StepFun Step 5 Preview 实测:知道何时停下,长任务胜 GLM 5.3 — omarsar0 · 2026-09-21
- 阶跃星辰发布 Step 5 Preview,主打性价比前沿 — omarsar0 · 2026-09-21
- 阶跃星辰 Step 5 Preview 早期实测:性价比对标 GLM、Kimi 旗舰 — StepFun_ai · 2026-09-21
第 2 集 · Step 5 Preview 评测 44 分:成本击穿、Agent 短板(2026-09-22,6 条)
Artificial Analysis 于 09-22 发布对阶跃星辰新旗舰 Step 5 Preview 的完整评测:模型总分 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max, 45 分) 与 Qwen3.8 Max,在榜单 202 个模型中排第 26。综合看,这是一款以极低价格为最大卖点、推理能力领先但 Agent 能力偏弱的旗舰模型。
已确认
- 模型规格与总分:600B 总参数/27B 激活,Intelligence Index 44 分,列第 26;输出速度 92.8 token/秒,快于均值 71;定价 $1/$2.70 每百万 token,均低于中位数。
- 推理与 Agent 表现:推理能力领先,但 Agent 任务全面落后是明显短板,GDPval-AA 1,566 Elo、AA-Briefcase 1,4xx(帖子未给出完整数值)。
- 知识与幻觉:AA-Omniscience 准确率 42%,超过 GLM-5.3 (max, 753B, 34%),略高于参数量对应的事实召回趋势线;但 43% 的作答存在幻觉。
- 成本优势:跑完 Intelligence Index 每任务约 $0.72,同分的 Kimi K3 (max) 约 $2.00,多 1 分的 GLM-5.3 (max) 更贵;Artificial Analysis 评价其是靠定价而非省 token 击穿成本线,成本约为同级模型的 1/2.8。
为什么重要
Step 5 Preview 展示了一条差异化路线:不以绝对分数取胜,而以 44 分智能水平配合约 1/2.8 的任务成本抢占性价比段位。但其 43% 的幻觉率与 Agent 短板提示,在高可靠性要求的自动化场景中仍需谨慎评估。
- 阶跃 Step 5 Preview 评测 44 分,成本仅同级模型 1/2.8 — ArtificialAnlys · 2026-09-22
- StepFun Step 5 Preview 每 task 成本仅 $0.72,追平 Kimi K3 省 2.8 倍 — ArtificialAnlys · 2026-09-22
- 每任务 $0.72:Step 5 Preview 用定价而非省 token 击穿成本线 — ArtificialAnlys · 2026-09-22
- Step 5 Preview 知识超 GLM-5.3,但 43% 作答会幻觉 — ArtificialAnlys · 2026-09-22
- Step 5 Preview 详细评测:推理领先,Agent 任务全面落后 — ArtificialAnlys · 2026-09-22
- Step 5 Preview 上榜 Artificial Analysis:智力第 26,速度与价格中上 — ArtificialAnlys · 2026-09-22