开发者开源 Bug 搜寻基准:实测大模型查 Bug 能力

PawelHuryn · x · 2026-08-01

技术博主 Pawel Huryn 开源了其最新的 AI 模型测试实验仓库,包含一个名为 bug-hunt-bench 的基准测试。

该基准在两个真实的代码仓库中植入了 105 个 Bug,用于评估前沿大模型(如 Claude、GPT 等)在自主发现和修复代码缺陷方面的实际能力。作者强调,所有实验脚本、原始日志和结果均完全开源且可复现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →