自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁
开发者 Paweł Huryn 不信任公开基准,自建 Bug Hunt Benchmark,基于 2 个真实仓库、105 个 2026 年初前沿模型都漏掉的 bug,实测 Opus 5.5、Sonnet 5.5、GPT-6.1 Sol 等新模型并核算各家订阅的真实 API 成本。结果显示 Sonnet 5.5 位列满分档夺魁;Opus 5.5 性能追平 Fable 5.1 而成本仅其三分之二;GPT-6.1 Sol 表现更强且比上一代 GPT-5.6 便宜约 10 倍。
2026-10-07 ~ 2026-10-07 · 3 条相关
- 第 1 集:自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(2026-10-07,3 条)
- 第 2 集:自建Bug Hunt基准得出不同结论:GPT-6.1 Sol可修复疑难Bug(2026-10-07,2 条)
- Bug Hunt 实测:Sonnet 5.5 满分档夺魁,GPT-6.1 Sol 比 GPT-5.6 便宜 10 倍 — PawelHuryn · 2026-10-07
- 实测新模型:Opus 5.5 性能追平 Fable 5.1 而成本仅三分之二 — PawelHuryn · 2026-10-07
另有 1 条近重复转述:PawelHuryn