Bug Hunt Bench:针对真实植入 Bug 的代码模型评测
PawelHuryn · x · 2026-08-26
Pawel Huryn 发布了 Bug Hunt Bench,这是一个针对前沿代码模型的实时评测基准。该基准通过在代码库中植入真实 Bug 来测试模型修复能力,榜单包含 105 个 Bug。平台提供基于修复数量、成本(美元)和耗时(分钟)的多维排名,支持盲测和单一提示约束,旨在真实反映模型在调试场景下的性价比。
所属事件:Bug Hunt Bench 上线:实测模型修复真实 bug(2 条相关)→
「编程与Agent」频道最新
- Agentmuxer 发布:Agent 能力的 OpenRouter,按量付费免订阅 — ycombinator · 2026-08-26
- 对抗上下文腐烂:定义 AGENTS.md 和 context.md 文件 — CSProfKGD · 2026-08-26
- CLAUDE.md 与 AGENTS.md 命名之争引发开发者吐槽 — carsonfarmer · 2026-08-26
- OpenPresence 将 Genny 变为全自主 Agent,实现内容日历自动化运营 — RichardsonDx · 2026-08-26
- GPT-Astra 优化内核代码,提速 50% 至 80% — daniel_mac8 · 2026-08-26
- devOS 让 coding agent 获得团队协作记忆 — black_phoenix9 · 2026-08-26