105个真实bug实测:GLM-5.3修19个,逊于Grok 4.7
PawelHuryn · x · 2026-08-26
作者在自建 bug hunt 基准上测试 GLM-5.3:2 个仓库、105 个真实 bug,GLM-5.3 修掉 19 个,而 Grok 4.7 修了 27 个,且速度慢一倍。另一发现是:16 个前沿模型中有 49/105 的 bug 从未被任何模型修复——一旦出现这种情况,这些 bug 就被默认「已解决」。作者还指出若只看成本,Grok 4.6 并不在 Pareto 前沿上,Luna (max) 以其价格来说是极强的 bug 猎手。实时基准与证据在 bughunt.productcompass.pm 公开。
所属事件:105 个真实 Bug 实测:GLM-5.3 落后 Grok 4.7(2 条相关)→
「模型」频道最新
- IBM 发布 Granite 4.2 模型,专注企业 Agent 工作流 — realmrfakename · 2026-08-26
- 曝 OpenAI 完成超 10T 参数预训练 Bel,Anthropic 因算力短板恐全年被动 — rohanpaul_ai · 2026-08-26
- Together 推荐榜单:Kimi K3、DeepSeek V4 分场景夺冠 — togethercompute · 2026-08-26
- Astra 两月未支持多模型?网友质疑宣传 — teortaxesTex · 2026-08-26
- 观点:模型发展至今,推理速度比模型大小更重要 — natesiggard · 2026-08-26
- Tiel-Coder-35B 模型:本地推理速度达 121.4 tok/s — DerTomsn · 2026-08-26