Step 5 Preview 知识超 GLM-5.3,但 43% 作答会幻觉
ArtificialAnlys · x · 2026-09-22
Artificial Analysis 指出 Step 5 Preview 以 600B 总参在 AA-Omniscience 达到 42% 准确率,超过 GLM-5.3 (max, 753B, 34%),略高于参数量对应的事实召回趋势线,但仍不及 Kimi K3 (max, 2.8T, 48%)。限制因素是行为而非知识:它尝试作答的比例达 68%,但其中 43% 会产生幻觉而不是拒答。
所属事件:Step 5 Preview 评测 44 分:成本击穿、Agent 短板(6 条相关)→
「模型」频道最新
- xAI 修复 SDK 丢失推理内容的 bug,Grok 4.7 性能显著提升 — ns123abc · 2026-09-22
- Artificial Analysis 发布 TTS 全榜:xAI 87.6% 发音准确率居首 — ArtificialAnlys · 2026-09-22
- xAI 更新 SDK 后性能大增,冲进 Vals 榜单前十 — teortaxesTex · 2026-09-22
- Grok 4.7 价格不再便宜,第三方评测已贵过 Astra — steipete · 2026-09-22
- 8GB 显存 + 64GB 内存,哪款 LLM 最像「百科全书」? — Mangleus · 2026-09-22
- 私有基准实测:Xiaomi v2.6 Pro 被评两年最差,Grok 仅 Luna 水平 — Afinetheorem · 2026-09-22