Grok 4.5 在 LaurenBench 以 56.9% 登顶,领先 Claude Sonnet 5 和 GLM 5.2

elonmusk · x · 2026-07-29

配图展示了 LaurenBench 的最新排名:Grok 4.5 Medium 以 56.9% 排在第 1,领先 Claude Sonnet 5 Medium 的 55.6%、GLM 5.2 Medium 的 55.2%、Claude Opus 5 Medium 的 51.7% 和 Kimi K3 Medium 的 49.7%。

图中说明这个 benchmark 测的是现实世界 agent 能力,覆盖:

榜单下半部分还能看到 GPT-5.6 Luna Medium(43.7%)、Gemini 3.5 Flash Lite Medium(42.4%)、Gemini 3.6 Flash Medium(41.7%)以及 DeepSeek V4 Pro Medium(41.3%)。这条信息本质上是在传递一次模型排名变化。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →