105个真实Bug实测主流模型修bug能力
Pawel Huryn(The Product Compass作者)发布了名为 Bug Hunt Bench 的基准测试,在 2 个真实代码仓库中重植共 105 个真实 bug,让各家前沿编码模型进行查找与修复,并以修复数量计分。实测结果显示,Sonnet 5.5 以 55.5 分大幅领先一众旗舰模型,展现出最强的真实场景 bug 修复能力,该榜单为评估编码模型实战表现提供了新参考。
2026-09-29 ~ 2026-09-29 · 2 条相关
- 105 个真实 Bug 实测:Sonnet 5.5 以 55.5 分大幅领先一众旗舰 — PawelHuryn · 2026-09-29
- Bug Hunt Bench:105 个真实代码 Bug 横评前沿模型 — PawelHuryn · 2026-09-29