Grok 4.5 在 LaurenBench 以 56.9% 登顶,领先 Claude Sonnet 5 和 GLM 5.2
elonmusk · x · 2026-07-29
配图展示了 LaurenBench 的最新排名:Grok 4.5 Medium 以 56.9% 排在第 1,领先 Claude Sonnet 5 Medium 的 55.6%、GLM 5.2 Medium 的 55.2%、Claude Opus 5 Medium 的 51.7% 和 Kimi K3 Medium 的 49.7%。
图中说明这个 benchmark 测的是现实世界 agent 能力,覆盖:
- 对话
- 工具使用
- 记忆
- 安全性
榜单下半部分还能看到 GPT-5.6 Luna Medium(43.7%)、Gemini 3.5 Flash Lite Medium(42.4%)、Gemini 3.6 Flash Medium(41.7%)以及 DeepSeek V4 Pro Medium(41.3%)。这条信息本质上是在传递一次模型排名变化。
「模型」频道最新
- Kimi开源模型定价引争议:月烧2000万美元的变现现实 — BenBajarin · 2026-07-29
- 用户反馈 Claude Opus 输出冗长,切换至 Sonnet 体验更佳 — brandon_galang · 2026-07-29
- Meta 论文让 RL 学会优化代码速度,Qwen 2.5 7B 也涨了 — burny_tech · 2026-07-29
- 用户改口称 GPT 5.6 Sol 其实是个很强的模型 — TheZachMueller · 2026-07-29
- Sam Altman 预告 GPT-5.6 Sol 7 月上 Cerebras,750 token/s — daniel_mac8 · 2026-07-29
- 一张爆图对比 12 类付费 AI 工具与免费替代品 — nikola_mr64990 · 2026-07-29