105 个植入 bug 实测:Grok 4.7 仅 28.7 分不敌 GPT-6
Pawel Huryn 在两个真实仓库中植入 105 个 bug,每模型运行 3 轮测试前沿模型的查错修复能力。结果显示 GPT-6 Astra(max)以 45 分领先,而 Grok 4.7 仅得 28.7 分,甚至未超过前代 Grok 4.6,Muse 系列也有上榜。该实测为评估各模型实际工程调试能力提供了参考,显示不同模型间差距明显。
2026-09-22 ~ 2026-09-22 · 2 条相关
- 实测评测:105 个植入 bug 下 Grok 4.7 仅 28.7 分,不敌 GPT-6 — PawelHuryn · 2026-09-22
另有 1 条近重复转述:PawelHuryn