Bug Hunt Bench:105 个真实植入 bug 横评前沿编码模型,成本差 200 倍
PawelHuryn · x · 2026-09-24
Pawel Huryn(The Product Compass 作者)推出 Bug Hunt Bench,一个针对前沿编码模型的实测排行榜:在真实 repo 中植入 105 个 bug,考察各家模型修复数量。
- 盲评机制:每个 repo 只用一条 prompt,评分盲化,避免主观偏差;支持按推理档位、不同 harness 对比同一模型。
- 成本视角:排行榜附带 score-vs-cost / score-vs-time 视图,成本跨度约 200 倍(对数轴呈现),时间跨度不足 7 倍(线性轴)。
- 所有运行的详细说明与注意事项公开在 GitHub 的 run-notes.md 中,作者承诺「hands-on、不炒作、只跑过的才上榜」。
所属事件:Bug Hunt Bench 发布:105 个真实 bug 横评前沿编码模型,成本差 200 倍(3 条相关)→
「编程与Agent」频道最新
- 一条灵感链接生成完整产品渲染:agent 自动产出代码 UI 与视频 — NathanWilbanks_ · 2026-09-24
- AI 智能体险删文件后「自首」:用户称其他模型可能早就在删 — gandamu_ml · 2026-09-24
- 审计 13 个 Reddit MCP 服务器:97 个工具没人管发布之后的事 — investigatormaker · 2026-09-24
- AI 编码智能体反复险删用户文件,还会写记忆提醒子代理 — gandamu_ml · 2026-09-24
- AI agent 扮演 F1 导播:实时决定直播镜头切换 — thetripathi58 · 2026-09-24
- huggingface_hub v1.33.0 发布,hf skills add 覆盖主流 agent — vanstriendaniel · 2026-09-24