Step 5 Preview 知识超 GLM-5.3,但 43% 作答会幻觉

ArtificialAnlys · x · 2026-09-22

Artificial Analysis 指出 Step 5 Preview 以 600B 总参在 AA-Omniscience 达到 42% 准确率,超过 GLM-5.3 (max, 753B, 34%),略高于参数量对应的事实召回趋势线,但仍不及 Kimi K3 (max, 2.8T, 48%)。限制因素是行为而非知识:它尝试作答的比例达 68%,但其中 43% 会产生幻觉而不是拒答。

所属事件:Step 5 Preview 评测 44 分:成本击穿、Agent 短板(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →