Bug Hunt Bench 实测:GPT-5.6 Sol 修复 22 个 bug,Opus 5 修复 12 个

PawelHuryn · x · 2026-07-25

作者在一个 VS Code 扩展仓库上跑了 Bug Hunt Bench:同一提示词、同一环境,6 个模型面对 45 个隐藏 bug 做找错修复测试。

测试过程中 922 条测试始终保持绿色,说明这类任务不会被表面测试轻易暴露;最后仍有 27/45 个 bug 在六个模型轮番尝试后幸存,显示真实代码修复依然很难。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →