开发者开源Bug搜寻基准实测大模型查错能力
技术博主 Pawel Huryn 开源了名为 bug-hunt-bench 的 AI 模型基准测试。该基准在两个真实代码仓库中植入了 105 个隐藏 Bug,用于评估大模型的代码查错能力。基于 9 个前沿模型和 14 轮测试,他总结出了一套 AI 编程模型能力路由策略:在判断、策略与复杂场景下首选 Fable,而 Luna 的性价比远超 Fable,同时指出部分最贵的模型并不适合处理代码任务。
2026-08-01 ~ 2026-08-01 · 2 条相关
- 开发者开源 Bug 搜寻基准:实测大模型查 Bug 能力 — PawelHuryn · 2026-08-01
- 实测 105 个 Bug:最贵模型不碰代码,Luna 性价比远超 Fable — PawelHuryn · 2026-08-01