StepFun Step 5 Preview 实测:知道何时停下,长任务胜 GLM 5.3
omarsar0 · x · 2026-09-21
StepFun 旗舰新模型 Step 5 Preview 开放试用,定价有竞争力,官方称处于成本-能力帕累托前沿。Elvis(omarsar0)早期实测结论:
- 编码能力:与 GLM 5.3、Kimi K3 等同梯队。在最小化 harness 中对同一 repo 同一 commit 给两个真实任务(数字过滤器静默返回空行的 bug;需新路由+权限门控+重构后台任务的功能),两个模型都一次通过、held-out 测试全绿、无回归。
- 关键差异在「知止」:Step 5 Preview 完成后会检查并主动宣告结束,两次都是;GLM 5.3 代码同样正确但持续跑到步数上限。这使其更适合无人值守的 agent 运行、陌生代码库修 bug 和长程任务。
- 补丁质量:修 bug 时写出了更短的补丁,与 Datasette 维护者真实提交的方案一致,还主动加了测试。
- 长上下文:在约 368K token 的伪造事故工单中藏 5 条线索,约 90 秒内全部找出并正确串联出根因。
注意:本文为与 StepFun 团队合作发布。
所属事件:阶跃星辰发布 Step 5 Preview 主打性价比前沿(3 条相关)→
「编程与Agent」频道最新
- GitHub Actions MCP 服务器:让 AI 直接查日志、重跑失败任务 — modelcontextprotocol · 2026-09-21
- Block 开源 Buzz:33.8k star 的人机共享协作平台 — abhishek__AI · 2026-09-21
- 被 AI 颠覆恐惧蔓延,独立开发者建「无聊应用」对冲风险 — alexmacgregor__ · 2026-09-21
- 开源协作平台 Buzz 让 AI Agent 与人类同频道共建工作区 — abhishek__AI · 2026-09-21
- OpenClaw 过 Trail of Bits 审计:23 个确认漏洞,零 Critical — steipete · 2026-09-21
- 开发者实测 KLPO 训练后端:默认梯度等价 REINFORCE,异步训练被拒 — burny_tech · 2026-09-21