自建 Bug Hunt 基准测试出不同结论

PawelHuryn · x · 2026-10-07

Paweł Huryn 的 Bug Hunt Benchmark 测量模型在真实代码仓库中发现并修复疑难 bug 的能力,结果与其他榜单不同:GPT-6.1 Sol 表现回升,而 Muse + Contributor 仍是对多数任务足够强且最便宜的选择。

所属事件:自建Bug Hunt基准得出不同结论:GPT-6.1 Sol可修复疑难Bug(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →