GLM 5.2 登上 ProgramBench 第三,但平均分可能误导
jyangballin · x · 2026-07-23
在最新的 ProgramBench 榜单更新里,GLM 5.2 作为首个被评估的开源权重模型,拿到了 3rd place。围绕这个结果,讨论重点其实是“怎么评测更靠谱”。
帖子强调:只看平均通过率会掩盖问题,尤其是一些样本虽然“差不多解出来了”,但实际上还没真正解决。与其盯着一个总分,不如同时看 almost resolved 和 fully resolved 的数量,因为少数顽固失败往往能暴露模型的真实短板。
所属事件:GLM-5.2 登上 ProgramBench 榜单第三名(3 条相关)→
「模型」频道最新
- Sentdex 质疑 Kimi K3 对比 Nemotron 3 Ultra 的图表 — Daniel_Farinax · 2026-07-23
- 按显存档位整理的模型榜单:从 4GB 到 384GB — victormustar · 2026-07-23
- 测试丘吉尔风格骂人提示词,Claude 与 GPT 展现文风差异 — emollick · 2026-07-23
- NVIDIA 总结 Kaggle 挑战赛:开源模型推理优化实践 — NVIDIAAI · 2026-07-23
- Kimi K3 创开源模型 ECI 指数新高,性能逼近 GPT-5 — rohanpaul_ai · 2026-07-23
- GLM 5.2 被曝能驾驭多节点 H100 集群,成最强开源自动科研模型 — _ScottCondron · 2026-07-23