阶跃 Step 5 Preview 评测 44 分,成本仅同级模型 1/2.8
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 发布对阶跃星辰新旗舰 Step 5 Preview 的完整评测,总分 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max, 45) 与 Qwen3.8 Max (45)。
核心亮点
- 成本优势显著:每任务成本约 $0.72,仅为同分的 Kimi K3 (max, $2.00) 的约 1/2.8,主要来自定价($1/$2.70 每百万输入/输出 token)。仅 MiMo-V2.6-Pro(46 分,$0.13)以更低成本拿到更高分。
- 推理能力大幅跃升:HLE 46%(较上代 +25 分)、CritPt 21%(+19 分),与 Kimi K3 接近。
- 知识强但幻觉多:600B 总参即达 AA-Omniscience 42% 准确率,超过 GLM-5.3 (753B),但尝试作答时 43% 会幻觉,不知拒绝作答。
- 短板在 Agent 任务:GDPval-AA 1,566 Elo、Terminal-Bench 4.0 33%、AA-Briefcase 1,432 Elo,均落后同分的 GLM-5.3 与 Qwen3.8 Max。
规格:600B 总参/27B 激活的 MoE,1M 上下文,支持文本/图像/视频输入;当前闭源 API,10 月 15 日计划开放权重。
所属事件:Step 5 Preview 评测 44 分:成本击穿、Agent 短板(6 条相关)→
「Infra」频道最新
- Cerebras CEO:做到 500 亿营收才懂黄仁勋五万亿有多难 — rohanpaul_ai · 2026-09-22
- 腾讯混元把 770B 模型压进 214 GiB:四权重五比特 — TencentHunyuan · 2026-09-22
- 语义缓存加共形风险控制,实测保证在线上失效 — Reasonable_Royal_621 · 2026-09-22
- 456GB 的 DeepSeek v4.1 本地跑出 40 tok/s,混合推理方案公开 — HankYeomans · 2026-09-22
- 开源项目 Agent Substrate:子秒级挂起恢复,大规模智能体运行时 — rakyll · 2026-09-22
- SemiAnalysis 抢先拆解 A20:A20 基于 TSMC N2,封装内藏 DRAM — dylan522p · 2026-09-22