Sonnet 5.5 不同 effort 档实测:max 分 55.5 但单次最高花 134.79 美元
PawelHuryn · x · 2026-09-29
Pawel Huryn 在自建的真实仓库 bug 修复基准上测试了 Sonnet 5.5 的各 effort 档位(平均 n=2):
- max:55.5 分,1330 轮,234.7 分钟,$134.79
- xhigh:39 分,588 轮,122.4 分钟,$60.30
- high:32 分,294 轮,24.5 分钟,$16.73
- medium:18 分,112 轮,11.9 分钟,$8.39
- low:20 分,119 轮,7.4 分钟,$5.75
对比 Sonnet 5(max):9 分、411 轮、61.3 分钟、$17.96。
结论:5.5 是个「极其有干劲」的模型,单轮快且便宜,但需要时会跑远多于前代的轮次——分数随 effort 档大幅波动,max 档成本可达 low 档的 25 倍以上。评测方法:真实仓库重植入前沿模型曾漏掉的真实 bug,由异家族盲校准裁判打分,只计真正修复,答案密钥保密以保证基准有效。
所属事件:Bug Hunt Bench 基准发布:Sonnet 5.5 实测大幅领先(4 条相关)→
「编程与Agent」频道最新
- Sonnet 5.5 一条 prompt 一键复刻月入 10 万美元的应用 — PrajwalTomar_ · 2026-09-29
- 开源项目手写 PyTorch 复现 Transformer,免费从零训出 13M 参数模型 — thisguyknowsai · 2026-09-29
- 调三小时 2021 年就废弃的 API:当 Cursor 幻觉把你拉进考古现场 — Full_Collar9026 · 2026-09-29
- 用 Claude 写视频提示词仍难保一致性,ComfyUI 短片工作流求助 — Laxus534 · 2026-09-29
- 别让 LLM 算合规账:确定性核心+情景记忆的混合 agent 架构 — Brilliant_Tension_53 · 2026-09-29
- 给代码审查 agent 加记忆:记住它看过的每一次提交 — manivarsha · 2026-09-29