实测评测:105 个植入 bug 下 Grok 4.7 仅 28.7 分,不敌 GPT-6
PawelHuryn · x · 2026-09-22
Pawel Huryn 用两个真实仓库、植入 105 个 bug 的实测基准,跑了 3 轮对比各模型「找 bug 并修复」能力,结果:
- GPT-6 Astra (max): 45
- Muse Spark 1.3 (max): 32.2
- Grok 4.7 (xhigh): 28.7
- Grok 4.6 (xhigh): 28.7(并非笔误,与 4.7 持平)
- Opus 5 (max): 27
- Qwen3.8-Max (max): 25.7
作者直言「这不是我们等待的那个模型」:Grok 4.7 相比 4.6 毫无提升。他表示后续每隔 30-70 分钟会在推文串中补充更高 effort 档位及 n=5 的成绩,以判定两代 Grok 谁更优。
所属事件:105 个植入 bug 实测:Grok 4.7 仅 28.7 分不敌 GPT-6(2 条相关)→
「模型」频道最新
- Karpathy 评 Jev:单 token 低延迟智能是 LLM Pareto 曲线上被忽视的一点 — karpathy · 2026-09-22
- chrisalbon:AI 长文写作就是不行,研究和校对可以,写作要自己来 — chrisalbon · 2026-09-22
- 曝 OpenAI 内部模型已解决超百个数学长期开放难题 — inductionheads · 2026-09-22
- 实测发现 Jev 同样会幻觉,数 strawberry 的 r 也会答错 — JeremyNguyenPhD · 2026-09-22
- 用户实测:Grok 4.7 3D 生成不如 4.6,还疯狂吃 token — teortaxesTex · 2026-09-22
- 网友让 Claude 画百合漫画,模型反问「要多少福利内容」 — repligate · 2026-09-22