Bug Hunt Bench 上线:测试模型修复真实 bug
PawelHuryn · x · 2026-08-26
Pawel Huryn 发布了「Bug Hunt Bench」基准测试平台,旨在评估前沿代码模型在真实代码库中修复预埋 bug 的能力。该平台提供实时排行榜,对比不同模型的修复得分、成本与耗时。基准包含 105 个预埋 bug,强调盲测(Blind-graded)和单次提示(One prompt per repo)的真实场景模拟。
所属事件:Bug Hunt Bench 上线:实测模型修复真实 bug(2 条相关)→
「研究」频道最新
- 论文揭示自动化初级岗位或长期削弱经济 — soumitrashukla9 · 2026-08-26
- Mol-JEPA 分子基础模型:支持 14 种模态联合学习 — rbhar90 · 2026-08-26
- UIST 2026 研讨会聚焦 Agent 复现科研系统 — TobyJLi · 2026-08-26
- 谷歌 AgentHands:XR 中手势交互 Agent — DuRuofei · 2026-08-26
- Einstein Arena:Agent集体智能破解11维吻球数,刷新纪录至604 — AI Engineer · 2026-08-26
- 构建 Agent 评测需先进行世界建模 — Hacubu · 2026-08-26