开发者开源Bug搜寻基准实测大模型查错能力

技术博主 Pawel Huryn 开源了名为 bug-hunt-bench 的 AI 模型基准测试。该基准在两个真实代码仓库中植入了 105 个隐藏 Bug,用于评估大模型的代码查错能力。基于 9 个前沿模型和 14 轮测试,他总结出了一套 AI 编程模型能力路由策略:在判断、策略与复杂场景下首选 Fable,而 Luna 的性价比远超 Fable,同时指出部分最贵的模型并不适合处理代码任务。

2026-08-01 ~ 2026-08-01 · 2 条相关