105个真实bug实测:GLM-5.3修19个,逊于Grok 4.7

PawelHuryn · x · 2026-08-26

作者在自建 bug hunt 基准上测试 GLM-5.3:2 个仓库、105 个真实 bug,GLM-5.3 修掉 19 个,而 Grok 4.7 修了 27 个,且速度慢一倍。另一发现是:16 个前沿模型中有 49/105 的 bug 从未被任何模型修复——一旦出现这种情况,这些 bug 就被默认「已解决」。作者还指出若只看成本,Grok 4.6 并不在 Pareto 前沿上,Luna (max) 以其价格来说是极强的 bug 猎手。实时基准与证据在 bughunt.productcompass.pm 公开。

所属事件:105 个真实 Bug 实测:GLM-5.3 落后 Grok 4.7(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →