专题 · FULL STORY

阶跃星辰Step 5 Preview:发布与首测

阶跃星辰于9月21日发布新一代旗舰模型 Step 5 Preview,主打成本与能力帕累托前沿的性价比定位。次日 Artificial Analysis 发布完整评测,给出44分并与 Kimi K3 对比,指出其成本击穿但 Agent 能力存在短板。

2026-09-21 ~ 2026-09-22 · 2 集 · 9 条

第 1 集 · 阶跃星辰发布 Step 5 Preview 主打性价比前沿(2026-09-21,3 条)

阶跃星辰发布新一代旗舰模型 Step 5 Preview,官方定位为「推进帕累托前沿」,即成本与能力的最优平衡,定价具有竞争力,并同步推出 Step Pla 平台。早期测试者 omarsar0 以编程 agent 场景为主实测,结论是该模型处于成本-能力帕累托前沿,长任务表现优于 GLM 5.3,且知道何时停下,性价比可对标 GLM、Kimi 等旗舰模型。

第 2 集 · Step 5 Preview 评测 44 分:成本击穿、Agent 短板(2026-09-22,6 条)

Artificial Analysis 于 09-22 发布对阶跃星辰新旗舰 Step 5 Preview 的完整评测:模型总分 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max, 45 分) 与 Qwen3.8 Max,在榜单 202 个模型中排第 26。综合看,这是一款以极低价格为最大卖点、推理能力领先但 Agent 能力偏弱的旗舰模型。

已确认

  • 模型规格与总分:600B 总参数/27B 激活,Intelligence Index 44 分,列第 26;输出速度 92.8 token/秒,快于均值 71;定价 $1/$2.70 每百万 token,均低于中位数。
  • 推理与 Agent 表现:推理能力领先,但 Agent 任务全面落后是明显短板,GDPval-AA 1,566 Elo、AA-Briefcase 1,4xx(帖子未给出完整数值)。
  • 知识与幻觉:AA-Omniscience 准确率 42%,超过 GLM-5.3 (max, 753B, 34%),略高于参数量对应的事实召回趋势线;但 43% 的作答存在幻觉。
  • 成本优势:跑完 Intelligence Index 每任务约 $0.72,同分的 Kimi K3 (max) 约 $2.00,多 1 分的 GLM-5.3 (max) 更贵;Artificial Analysis 评价其是靠定价而非省 token 击穿成本线,成本约为同级模型的 1/2.8。

为什么重要

Step 5 Preview 展示了一条差异化路线:不以绝对分数取胜,而以 44 分智能水平配合约 1/2.8 的任务成本抢占性价比段位。但其 43% 的幻觉率与 Agent 短板提示,在高可靠性要求的自动化场景中仍需谨慎评估。