自建 Bug Hunt 基准实测:GPT-6.1 Sol 更强且比上代便宜 10 倍
PawelHuryn · x · 2026-10-07
作者 Paweł Huryn 用自建的 Bug Hunt Benchmark(2 个真实仓库、105 个 2026 年初前沿模型都漏掉的 bug)实测 Opus 5.5、Sonnet 5.5、GPT-6.1 Sol 等新模型,关键发现:
- Opus 5.5 明显强于 Opus 5,接近 Fable 5.1(41.7 vs 43),但成本只有约 2/3($58.53 vs $87.18);作者建议除非预算无限,否则停用 Fable 5.1。
- Sonnet 5.5 输入/输出 token 比 Opus 5.5 便宜一半($2/$10 vs $4/$20 每 MTok),但长 agent 会话里大头是 cache read,两者同为 $0.20/MTok。Sonnet 5.5 (max) 以 51.3/105 拿下第一(跑了 1497 次迭代)。
- GPT-6.1 Sol 略强于 GPT-5.6 Sol 但复杂任务成本低 10 倍以上:输入输出减半,cache read 便宜 4 倍(OpenAI 称 95% 折扣,可能是暂时的)。差距主要来自轮数:同一任务 GPT-5.6 xhigh 跑了 485 轮,GPT-6.1 只需 200 轮。
- 发布当天 GPT-6.1 Sol 比 Opus 5.5 慢近 2 倍,据 OpenAI 的 Tibo 称几小时内会提速近 2 倍。
全套数据与基准测量免费公开。
所属事件:自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(3 条相关)→
「编程与Agent」频道最新
- Epic 开源原生多进程图形调试器 raddebugger,星数破 7700 — EpicGames · 2026-10-07
- 开源终端 cmux 专为 AI 编程 Agent 设计,星数近 2.8 万 — manaflow-ai · 2026-10-07
- AI 编码该复用开源还是从零写?Weaviate 播客激辩系统设计 — CShorten30 · 2026-10-07
- 44 次注入测试全拦截:CLIM Agent Guard 用确定性边界挡住危险删除 — Slight_Analysis_5414 · 2026-10-07
- 并行 AI 会话别开太多:实测 2-3 个是效率最优区间 — IgorCarron · 2026-10-07
- 苹果论文:单 Agent 加 Shell 胜过多 Agent 编排,Kaggle 奖牌率 62.5% 对 47.1% — rohanpaul_ai · 2026-10-07