Bug Hunt Bench 实测:Sonnet 5.5 max 档分数 55.5、单次跑 134 美元
PawelHuryn · x · 2026-09-29
Pawel Huryn 的 Bug Hunt Bench(用真实预埋 bug 考核前沿编码模型,盲评、每仓库一次提示,共 105 个 bug)新增「分数 vs 轮次」对数坐标视图,并公开 Sonnet 5.5 各 effort 档数据:
- max:55.5 分,1330 轮,234.7 分钟,$134.79(n=2 均值)
- xhigh:39 分,588 轮,$60.30
- high:32 分,294 轮,$16.73
- medium:18 分,112 轮,$8.39
- low:20 分,119 轮,$5.75
对照 Sonnet 5 max 仅 9 分、411 轮、$17.96。整体画像:5.5 是一个「极其卖力」的模型,单轮快且便宜,但成本随 effort 档指数级上升——max 档分数是 low 档近 3 倍,价格却是 25 倍。榜单成本跨度约 200 倍,时间跨度不足 7 倍。
所属事件:Bug Hunt Bench 基准发布:Sonnet 5.5 实测大幅领先(4 条相关)→
「编程与Agent」频道最新
- CS 学生复盘实习:让 agent 真动手后,我手写了一堆脆弱的防护检查 — Professional-Mine681 · 2026-09-29
- WebBrain:开源本地浏览器 Agent,配 450M 浏览器专用小视觉模型 — ButtercupLyn100 · 2026-09-29
- 第三方实测 NVIDIA OpenShell:默认策略 0/10 泄密,但自动批准 12/12 漏数据 — No-Peanut-6988 · 2026-09-29
- Sonnet 5.5 一条 prompt 一键复刻月入 10 万美元的应用 — PrajwalTomar_ · 2026-09-29
- 开源项目手写 PyTorch 复现 Transformer,免费从零训出 13M 参数模型 — thisguyknowsai · 2026-09-29
- 调三小时 2021 年就废弃的 API:当 Cursor 幻觉把你拉进考古现场 — Full_Collar9026 · 2026-09-29