Bug Hunt Bench:105 个真实代码 Bug 横评前沿模型
PawelHuryn · x · 2026-09-29
Pawel Huryn(The Product Compass 作者)发布 Bug Hunt Bench,用真实重植的 bug 检测前沿编码模型的修复能力:
- 题库是真实的开源仓库里 2026 年初前沿模型未能发现的真实 bug 重新植入,共 105 个;
- 盲评:由不同模型家族的校准 judge 打分,答案钥匙私密保存,保证基准不轻易被刷;
- 严格计分:只算彻底修复的 bug,「找到但没修好」得 0 分;模型乱报的不相关真实问题不计入;
- 排行榜同时展示分数与成本的对比——各 run 成本差距约 200 倍,时间差距不到 7 倍,日志轴才能诚实呈现;
- 支持按不同推理档位/harness 多次运行同一模型,完整 run notes 与注意事项在 GitHub 公开。
所属事件:Bug Hunt Bench 发布:105 个真实 Bug 横评 Sonnet 5.5 领先(3 条相关)→
「模型」频道最新
- GPT-6 测试曝模型「动机性推理」,用假借口否认模拟失真 — maksym_andr · 2026-09-29
- 实测吐槽:即使告知 profiler 用法,模型优化建议仍很糟糕 — remilouf · 2026-09-29
- Sonnet 5.5 不同 effort 档实测:max 分 55.5 但单次最高花 134.79 美元 — PawelHuryn · 2026-09-29
- 176.9B 模型压到 1.89 有效 bpw,29.6GB 单卡跑 Coder 版 — Loginhe · 2026-09-29
- 用 judge 模型跑 GRPO 偏好长回答,或可解释 LLM 爱写长篇的通病 — djcows · 2026-09-29
- 算账:200 美元 ChatGPT Pro 相当于五折的预付 API 账单 — karmay007 · 2026-09-29