Bug Hunt Bench 发布:105 个真实 Bug 横测 GPT-6、Claude、Grok 等前沿模型
PawelHuryn · x · 2026-09-05
开发者 Pawel Huryn 发布 Bug Hunt Bench(GitHub: phuryn/bug-hunt-bench)及官网和数据,并已上线实时排行榜。
核心设计:
- 105 个真实 Bug,埋在两个生产级代码库中
- 参测模型包括 GPT-6、Claude、Grok、Gemini、DeepSeek、Kimi、GLM 等前沿编码模型
- 每个模型在各自的 agentic CLI(Codex CLI、Claude Code、Grok CLI、Antigravity CLI)中每库一轮,自主查找并修复 Bug
- 所有 diff 对照隐藏的答案密钥盲评,只计预先埋入的 Bug,公开每一条证据
- 后续还将补充其他 effort level 的结果
作者称新模型发布后会持续加入测试,目的是为社区省去自己跑评测的成本。
「编程与Agent」频道最新
- OpenAI 论坛报告:agent 集群在互联网上如游牧部落般肆虐 — tedmitew · 2026-09-05
- 一条 prompt 做出可玩火影 2D 动作游戏,实测 ChatGPT 生成上限 — callme_e · 2026-09-05
- 开源 skill-builder:从工作流描述生成生产级 Codex 技能包 — cneuralnetwork · 2026-09-05
- AI 生成 Minecraft 类游戏加入洪水龙卷风甚至死星,即将开源 — ChrisGPT · 2026-09-05
- Qwen3.8 27B 量化版挤进 24GB 显存跑 10 万上下文,本地模型威胁前沿定价 — ChopSticksPlease · 2026-09-05
- 开发者提醒:AI 让代码过度优化变得太容易,先发布再说 — tetsuoai · 2026-09-05