Bug Hunt Bench 上线:前沿编码模型盲评修复 105 个植入 bug
PawelHuryn · x · 2026-09-10
Pawel Huryn(Product Compass 作者)发布 Bug Hunt Bench:让前沿编码模型在真实仓库中修复人工植入的 bug,共 105 个,盲评打分、每仓库单次 prompt,榜单持续更新。
榜单提供多重视图:按修复数排名的 leaderboard、score vs cost(成本跨度约 200 倍,用对数轴)、score vs time、覆盖率等,可按推理档位或 harness 区分同模型多次运行,被取代的历史 run 会标记 superseded 并移出默认视图。支持导出 PNG,用户可在筛选器中自选对比模型。
所属事件:Bug Hunt Bench 实测 105 个真实 bug,DeepSeek Flash 性价比突出(8 条相关)→
「模型」频道最新
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11