自建Bug Hunt基准得出不同结论:GPT-6.1 Sol可修复疑难Bug
Paweł Huryn 用自建的 Bug Hunt Benchmark(考察模型在真实代码仓库中发现并修复困难 bug 的能力)进行测试,得出与其他榜单不同的结论:此前表现受质疑的 GPT-6.1 Sol 在任务中能够实现翻盘修复,而 Muse 系模型仍是最便宜的主力选择。该结果引发了社区对现有基准测试能否真实反映模型代码调试能力的讨论。
2026-10-07 ~ 2026-10-07 · 2 条相关
- 第 1 集:自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(2026-10-07,3 条)
- 第 2 集:自建Bug Hunt基准得出不同结论:GPT-6.1 Sol可修复疑难Bug(2026-10-07,2 条)
- 自建 Bug Hunt 基准测试出不同结论 — PawelHuryn · 2026-10-07
- Bug Hunt 实测:GPT-6.1 Sol 能翻盘修复, Muse 系仍是最便宜主力 — PawelHuryn · 2026-10-07