Bug实测:GPT-5.6修复22个bug领先Claude Opus 5
在针对代码修复能力的Bug Hunt Bench实测中,测试者在约2.8万行的VS Code扩展仓库中隐藏了45个可通过测试的bug。结果显示,GPT-5.6 Sol成功修复22个bug表现最佳,而Claude Opus 5修复了约11至12个,且识别出了旧版本漏掉的问题,Opus 4.8仅修复2个。
2026-07-25 ~ 2026-07-25 · 3 条相关
- 第 1 集:Opus 5 编码测试反转:推理越强分数反而下滑(2026-07-24,13 条)
- 第 2 集:Claude Opus 5被曝概率推理过程反复摇摆(2026-07-25,3 条)
- 第 3 集:Bug实测:GPT-5.6修复22个bug领先Claude Opus 5(2026-07-25,3 条)
- Bug Hunt Bench 实测:GPT-5.6 Sol 修复 22 个 bug,Opus 5 修复 12 个 — PawelHuryn · 2026-07-25
- Claude Opus 5 在同仓库修出 11 个 bug,Opus 4.8 只修 2 个 — PawelHuryn · 2026-07-25
- Claude Opus 5 在代码任务中识别出旧版漏掉的问题 — PawelHuryn · 2026-07-25