Bug Hunt Bench 实测:GPT-5.6 Sol 修复 22 个 bug,Opus 5 修复 12 个
PawelHuryn · x · 2026-07-25
作者在一个 VS Code 扩展仓库上跑了 Bug Hunt Bench:同一提示词、同一环境,6 个模型面对 45 个隐藏 bug 做找错修复测试。
- GPT-5.6 Sol 排名第一,修复 13+9 个,耗时 21 分 57 秒,成本 $10.76。
- Opus 5 修复 11+1 个,耗时 17 分 22 秒,成本 $15.89。
- Fable 5 修复 9+2 个,但成本最高,达到 $36.42。
- Grok 4.5 修复 5+2 个,成本 $5.82。
- Kimi K3 只修复 4+0 个,耗时 62 分 19 秒。
- Opus 4.8 最弱,只修复 2+0 个。
测试过程中 922 条测试始终保持绿色,说明这类任务不会被表面测试轻易暴露;最后仍有 27/45 个 bug 在六个模型轮番尝试后幸存,显示真实代码修复依然很难。
「模型」频道最新
- Anthropic 这次“chart crime”更像过度信任 Claude — herbiebradley · 2026-07-25
- Claude Opus 5 在同仓库修出 11 个 bug,Opus 4.8 只修 2 个 — PawelHuryn · 2026-07-25
- Miles Brundage:Anthropic 图表争议本质是过度信任 Claude — Miles_Brundage · 2026-07-25
- 一张评测图表因数字混乱变成 AI 圈梗图 — Miles_Brundage · 2026-07-25
- FrontierCode 1.1 显示 Opus 5 在更强推理下反而降分 — andrew_n_carr · 2026-07-25
- Claude Opus 5 用 27% 订阅额度做出赛车克隆 — soumitrashukla9 · 2026-07-25