GLM 5.2 在长链路浏览基准上接近翻倍 Kimi K3
zainhas · x · 2026-07-24
一张新的复合基准图显示,GLM 5.2 在长链路浏览任务上的表现明显高于 Kimi K3。
- 这项 Composite-Bench 测试面向 long-horizon browser work,采用 exact match 评测,并固定推理预算。
- 图中给出的结果里,GLM-5.2 为 63%,而 Kimi-K3 为 31%,相当于接近翻倍。
- 同图还列出了其他模型:Claude Fable 5(74%)、Claude Opus 4.8(73%)、Gemini 3.5 Flash(27%)、MiniMax-M3(26%)、GPT-5.6 Sol(18%)、Grok-4.5(9%)。
「模型」频道最新
- NVIDIA 把 LLM agent 直接做成 Python 对象 — nvidia · 2026-07-24
- 让模型画鹈鹕骑车,结果成了一场开源比拼 — Atretador · 2026-07-24
- Codex 上线使用额度重置日历,覆盖 2026 年 6—7 月 — haider1 · 2026-07-24
- KAT-Coder-V2.5-Dev 开放权重,35B 总参 3B 激活 — AdinaYakup · 2026-07-24
- 一道基础生物题,Opus 4.8 过了而 5.6 Sol xhigh 没过 — Sauers_ · 2026-07-24
- 同样的权重,在不同输入下效用可能天差地别 — TheGradient · 2026-07-24