Bug Hunt Bench 实测:GPT-5.6 Sol 修复 22 个 bug,Opus 5 修复 12 个
PawelHuryn · x · 2026-07-25
作者在一个 VS Code 扩展仓库上跑了 Bug Hunt Bench:同一提示词、同一环境,6 个模型面对 45 个隐藏 bug 做找错修复测试。
- GPT-5.6 Sol 排名第一,修复 13+9 个,耗时 21 分 57 秒,成本 $10.76。
- Opus 5 修复 11+1 个,耗时 17 分 22 秒,成本 $15.89。
- Fable 5 修复 9+2 个,但成本最高,达到 $36.42。
- Grok 4.5 修复 5+2 个,成本 $5.82。
- Kimi K3 只修复 4+0 个,耗时 62 分 19 秒。
- Opus 4.8 最弱,只修复 2+0 个。
测试过程中 922 条测试始终保持绿色,说明这类任务不会被表面测试轻易暴露;最后仍有 27/45 个 bug 在六个模型轮番尝试后幸存,显示真实代码修复依然很难。
所属事件:Bug实测:GPT-5.6修复22个bug领先Claude Opus 5(3 条相关)→
「模型」频道最新
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11
- antirez 谈 Anthropic 禁止未成年人使用 Claude — antirez · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- RTX 3060 全本地语音助手复刻 GPT Live 官方演示,6 分钟跑完全程 — liampetti · 2026-09-11
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11