Sonnet 5.5 不同 effort 档实测:max 分 55.5 但单次最高花 134.79 美元

PawelHuryn · x · 2026-09-29

Pawel Huryn 在自建的真实仓库 bug 修复基准上测试了 Sonnet 5.5 的各 effort 档位(平均 n=2):

对比 Sonnet 5(max):9 分、411 轮、61.3 分钟、$17.96。

结论:5.5 是个「极其有干劲」的模型,单轮快且便宜,但需要时会跑远多于前代的轮次——分数随 effort 档大幅波动,max 档成本可达 low 档的 25 倍以上。评测方法:真实仓库重植入前沿模型曾漏掉的真实 bug,由异家族盲校准裁判打分,只计真正修复,答案密钥保密以保证基准有效。

所属事件:Bug Hunt Bench 基准发布:Sonnet 5.5 实测大幅领先(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →