实测 105 个真实 bug:Grok 4.7 得 28.7 分,未胜 Grok 4.6
PawelHuryn · x · 2026-09-22
PawelHuryn 在两个真实仓库里埋入 105 个 bug 测试各前沿模型的查错修复能力(每模型跑 3 次取均值):GPT-6 Astra(max)45 分领先,Muse Spark 1.3 得 32.2,Grok 4.7 与 4.6(xhigh)均为 28.7,Opus 5 得 27,Qwen3.8-Max 得 25.7。Grok 4.7 相比 4.6 方差不大(25/30/31 vs 27/30/29),且无一超过 Muse Spark 1.3 的中位数——「这不是我们等的那款模型」。方法论要点:bug 为 2026 年初前沿模型曾漏掉的高难题而非随机 bug;模型主动多报的「未埋 bug」不计分(作者认为这是负分行为);跨模型家族的裁判按密钥答案评分,未修完或漏报计 0 分。更多数据见其 benchmark 网站。
所属事件:105 个植入 bug 实测:Grok 4.7 仅 28.7 分不敌 GPT-6(2 条相关)→
「模型」频道最新
- SemiAnalysis 称开源将死,但两个月内仍有 20+ 开源模型发布 — _lewtun · 2026-09-22
- Grok 4.7 网络安全实测:59% 召回,成本仅 GPT 竞品一半 — andreamichi · 2026-09-22
- Grok 4.7 在 BuildingBench 3D 建模榜从第 9 跳到第 3,得分 0.783 — ZhitingHu · 2026-09-22
- Jev 并非传统 LLM,作者撰文向普通人解释其设计原理 — multiply_matrix · 2026-09-22
- 单 token 就够用?开发者呼吁用具体 token 数取代高中低推理档位 — arkuto · 2026-09-22
- Grok 4.7 多次评测仅胜 4.6 0.1 分,作者判定属随机噪声 — PawelHuryn · 2026-09-22