Bug实测:GPT-5.6修复22个bug领先Claude Opus 5

在针对代码修复能力的Bug Hunt Bench实测中,测试者在约2.8万行的VS Code扩展仓库中隐藏了45个可通过测试的bug。结果显示,GPT-5.6 Sol成功修复22个bug表现最佳,而Claude Opus 5修复了约11至12个,且识别出了旧版本漏掉的问题,Opus 4.8仅修复2个。

2026-07-25 ~ 2026-07-25 · 3 条相关

事件全程(共 3 集)→