GLM 5.3 跑分 75.4%,仍落后于 Kimi-K3
teortaxesTex · x · 2026-09-01
在 WeirdML 基准测试中,智谱 GLM 5.3 (max) 得分 75.4%,较 GLM 5.2 的 70.1% 有所提升。
横向对比:
- Kimi-K3:82.6%
- Claude Opus/Fable:约 92%
分析:GLM 虽有进步,但相对排名可能被高估。该测试存在 explore-vs-score 的轻微偏差,但对最终得分影响小于 1%。
「模型」频道最新
- Arena 排行榜现神秘 Gemma 模型,或为 Gemma 5 — Hot_Example_4456 · 2026-09-01
- antirez 演示 DeepSeek v4 Flash 视觉版在 M5 Max 上本地快速运行 — antirez · 2026-09-01
- 自监督新法 OPSA 无需蒸馏,AIME24 提升 35 分 — heghbalz · 2026-09-01
- Vibe Code 集成智谱 GLM 5.2,Pro 订阅可用 — iamaliveix · 2026-09-01
- OpenRouter 上线 262K 上下文金融模型 LING 3.0 — Daikon-Legend · 2026-09-01
- 3200 亿参数模型仅用 1% 激活,MoE 稀疏性揭秘 — Two Minute Papers · 2026-09-01