GLM-5.2 在 ProgramBench 以 8.5% 排到第三
parth007_96 · x · 2026-07-23
ProgramBench 更新了排行榜,GLM-5.2 成为首个被评测的开权重模型,拿到 8.5% almost resolved,总排名升至 第 3。
配图显示,这个基准包含 200 个任务、248,000+ 项测试;目前领先的是 GPT-5.5(xhigh),达到 13.5% almost resolved,其中 0.5% 已完全解出。
「模型」频道最新
- 写作指纹分析称 Kimi K3 与 Fable 5 过于相似 — alex_verem · 2026-07-23
- Cisco 称两款开源安全小模型在漏洞检测上更省钱 — The Decoder · 2026-07-23
- Laguna-S-2.1 败在 100 米步行决策测试 — logic_prevails · 2026-07-23
- BTL-3 以 8.39GB 文件发布 27B 开源 agent 模型 — QuixiAI · 2026-07-23
- Claude Opus 4.8 占 OpenRouter 上 Anthropic 用量 40% — maferase · 2026-07-23
- GLM 复现 cmatrix 几乎满分,只差“Computer locked.” — jyangballin · 2026-07-23