GLM 5.2 登上 ProgramBench 第三,但平均分可能误导

jyangballin · x · 2026-07-23

在最新的 ProgramBench 榜单更新里,GLM 5.2 作为首个被评估的开源权重模型,拿到了 3rd place。围绕这个结果,讨论重点其实是“怎么评测更靠谱”。

帖子强调:只看平均通过率会掩盖问题,尤其是一些样本虽然“差不多解出来了”,但实际上还没真正解决。与其盯着一个总分,不如同时看 almost resolved 和 fully resolved 的数量,因为少数顽固失败往往能暴露模型的真实短板。

所属事件:GLM-5.2 登上 ProgramBench 榜单第三名(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →