Bug Hunt Bench:针对真实植入 Bug 的代码模型评测

PawelHuryn · x · 2026-08-26

Pawel Huryn 发布了 Bug Hunt Bench,这是一个针对前沿代码模型的实时评测基准。该基准通过在代码库中植入真实 Bug 来测试模型修复能力,榜单包含 105 个 Bug。平台提供基于修复数量、成本(美元)和耗时(分钟)的多维排名,支持盲测和单一提示约束,旨在真实反映模型在调试场景下的性价比。

所属事件:Bug Hunt Bench 上线:实测模型修复真实 bug(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →