开发者开源 Bug 搜寻基准:实测大模型查 Bug 能力
PawelHuryn · x · 2026-08-01
技术博主 Pawel Huryn 开源了其最新的 AI 模型测试实验仓库,包含一个名为 bug-hunt-bench 的基准测试。
该基准在两个真实的代码仓库中植入了 105 个 Bug,用于评估前沿大模型(如 Claude、GPT 等)在自主发现和修复代码缺陷方面的实际能力。作者强调,所有实验脚本、原始日志和结果均完全开源且可复现。
「编程与Agent」频道最新
- Meta工程师分享 MLSys 演讲:用 AI 解放系统研究员 — salykova_ · 2026-08-01
- React Aria 推出 TokenField 组件,助力构建 AI 提示词输入框 — pacocoursey · 2026-08-01
- Supabase 推出 Evals,实测多款 AI 编码智能体真实表现 — tristanbob · 2026-08-01
- 让AI员工夜间自主开发软件:自主智能体的三大管理心得 — leebase65 · 2026-08-01
- 单板并行调度 11 款 AI 编码代理,Kanbots 开源 — tom_doerr · 2026-08-01
- OrionMCP:基于MCP实现本地化持久智能体记忆 — AuraCoreCF · 2026-08-01