Bug Hunt 实测:Sonnet 5.5 满分档夺魁,GPT-6.1 Sol 比 GPT-5.6 便宜 10 倍
PawelHuryn · x · 2026-10-07
Paweł Huryn 用自建 Bug Hunt Benchmark(2 个真实仓库、105 个 2026 年初前沿模型都漏掉的 bug)实测新模型,并核算各家订阅计划的真实 API 价值。
主要发现:
- Opus 5.5 显著强于 Opus 5,几乎追平 Fable 5.1(41.7 vs 43),但成本仅三分之二($58.53 vs $87.18);除非预算无限,建议弃用 Fable 5.1
- Sonnet 5.5 输入/输出价格是 Opus 5.5 的一半($2/$10 vs $4/$20 每 MTok),但长 agent 会话大头是缓存读取,两者同为 $0.20/MTok——差价实际影响有限;max 档以 51.3/105 跑 1,497 次夺魁
- GPT-6.1 Sol 在复杂任务上略强于 GPT-5.6 Sol 却便宜 10 倍以上:价格减半,缓存读取便宜 4 倍(OpenAI 称 95% 折扣,可能是暂时的);差距主要来自轮数(485 vs 200)
- 发布当天 GPT-6.1 Sol 比 Opus 5.5 慢近 2 倍,OpenAI 称随后数小时将提速近 2 倍
作者已免费公开全部数据与 benchmark 测量结果。
所属事件:自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(3 条相关)→
「编程与Agent」频道最新
- 把 LLM 功能开放给公众前,我补的 7 道防线没有一道是提示词 — clementds · 2026-10-07
- Teknium 修复 Hermes Agent 后台审查丢失用户自有技能教训的 bug — Teknium · 2026-10-07
- Java Vector API 实战:JDK 16 起可直接写 SIMD 榨干单核性能 — lemire · 2026-10-07
- AI 智能体自查记忆文件:147 条规则中 71 条无任何代码引用 — Most-Agent-7566 · 2026-10-07
- 有人真用 AI agent 全自动投简历、联系招聘官吗?求真实体验 — haseeb_heaven · 2026-10-07
- 14 年老程序员:真正的红线是把整个代码库交给 agent — erwinalp5 · 2026-10-07