实测新模型:Opus 5.5 性能追平 Fable 5.1 而成本仅三分之二
PawelHuryn · x · 2026-10-07
Paweł Huryn 不信任公开基准,用自建 Bug Hunt Benchmark(2 个真实仓库、105 个 2026 年初前沿模型漏掉的 bug)实测 Opus 5.5、Sonnet 5.5、GPT-6.1 Sol,结论:
- Opus 5.5 显著强于 Opus 5,几乎追平 Fable 5.1(41.7 vs 43),成本仅其三分之二($58.53 vs $87.18);除非预算无限,建议弃用 Fable 5.1
- Sonnet 5.5 输入/输出价是 Opus 5.5 一半($2/$10 vs $4/$20 每 MTok),但长 agent 会话成本大头是缓存读取,两者同为 $0.20/MTok,差价被抹平
- Sonnet 5.5 (max) 意外登顶(51.3/105),靠跑 1,497 步
- GPT-6.1 Sol 略强于上代,复杂任务上便宜逾 10 倍:输入输出减半、缓存读便宜 4 倍(OpenAI 称 95% 折扣,可能临时);成本差主要来自轮数(485 vs 200 步)
- 发布当天 GPT-6.1 Sol 比 Opus 5.5 慢近一倍,OpenAI 的 Tibo 称数小时内提速
全部数据与测量免费公开。
所属事件:自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(3 条相关)→
「编程与Agent」频道最新
- Java Vector API 实战:JDK 16 起可直接写 SIMD 榨干单核性能 — lemire · 2026-10-07
- 有人真用 AI agent 全自动投简历、联系招聘官吗?求真实体验 — haseeb_heaven · 2026-10-07
- 14 年老程序员:真正的红线是把整个代码库交给 agent — erwinalp5 · 2026-10-07
- 开源 LLM 20 分钟搞定 Tuya 固件逆向改写,绕过 Claude 安全拦截 — ngxson · 2026-10-07
- Reddit 热议:上下文管理、动态路由、提示缓存三大降本法怎么选 — Extension_Lake4065 · 2026-10-07
- 「表亲军团」:开源 Claude agent 框架让 AI 跨会话记住自己是谁 — bomba_____ · 2026-10-07