专题 · FULL STORY
自建Bug Hunt基准:谁是最强修Bug模型
开发者 Paweł Huryn 出于对公开基准的不信任,基于真实仓库自建 Bug Hunt Benchmark 实测前沿模型,先得出 Sonnet 5.5 夺魁,随后测试又显示 GPT-6.1 Sol 能修复疑难 bug,不同批次结论引发对评测方法的讨论。
2026-10-07 ~ 2026-10-07 · 2 集 · 5 条
第 1 集 · 自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(2026-10-07,3 条)
开发者 Paweł Huryn 不信任公开基准,自建 Bug Hunt Benchmark,基于 2 个真实仓库、105 个 2026 年初前沿模型都漏掉的 bug,实测 Opus 5.5、Sonnet 5.5、GPT-6.1 Sol 等新模型并核算各家订阅的真实 API 成本。结果显示 Sonnet 5.5 位列满分档夺魁;Opus 5.5 性能追平 Fable 5.1 而成本仅其三分之二;GPT-6.1 Sol 表现更强且比上一代 GPT-5.6 便宜约 10 倍。
- Bug Hunt 实测:Sonnet 5.5 满分档夺魁,GPT-6.1 Sol 比 GPT-5.6 便宜 10 倍 — PawelHuryn · 2026-10-07
- 实测新模型:Opus 5.5 性能追平 Fable 5.1 而成本仅三分之二 — PawelHuryn · 2026-10-07
- 自建 Bug Hunt 基准实测:GPT-6.1 Sol 更强且比上代便宜 10 倍 — PawelHuryn · 2026-10-07
第 2 集 · 自建Bug Hunt基准得出不同结论:GPT-6.1 Sol可修复疑难Bug(2026-10-07,2 条)
Paweł Huryn 用自建的 Bug Hunt Benchmark(考察模型在真实代码仓库中发现并修复困难 bug 的能力)进行测试,得出与其他榜单不同的结论:此前表现受质疑的 GPT-6.1 Sol 在任务中能够实现翻盘修复,而 Muse 系模型仍是最便宜的主力选择。该结果引发了社区对现有基准测试能否真实反映模型代码调试能力的讨论。
- 自建 Bug Hunt 基准测试出不同结论 — PawelHuryn · 2026-10-07
- Bug Hunt 实测:GPT-6.1 Sol 能翻盘修复, Muse 系仍是最便宜主力 — PawelHuryn · 2026-10-07