Bug Hunt Bench 上线:测试模型修复真实 bug

PawelHuryn · x · 2026-08-26

Pawel Huryn 发布了「Bug Hunt Bench」基准测试平台,旨在评估前沿代码模型在真实代码库中修复预埋 bug 的能力。该平台提供实时排行榜,对比不同模型的修复得分、成本与耗时。基准包含 105 个预埋 bug,强调盲测(Blind-graded)和单次提示(One prompt per repo)的真实场景模拟。

所属事件:Bug Hunt Bench 上线:实测模型修复真实 bug(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →