实测评测:105 个植入 bug 下 Grok 4.7 仅 28.7 分,不敌 GPT-6

PawelHuryn · x · 2026-09-22

Pawel Huryn 用两个真实仓库、植入 105 个 bug 的实测基准,跑了 3 轮对比各模型「找 bug 并修复」能力,结果:

作者直言「这不是我们等待的那个模型」:Grok 4.7 相比 4.6 毫无提升。他表示后续每隔 30-70 分钟会在推文串中补充更高 effort 档位及 n=5 的成绩,以判定两代 Grok 谁更优。

所属事件:105 个植入 bug 实测:Grok 4.7 仅 28.7 分不敌 GPT-6(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →