Bug Hunt Bench:105 个真实 bug 实测 GPT-6、Claude 等前沿模型排位
PawelHuryn · x · 2026-09-13
开发者 Pawel Huryn 发布 Bug Hunt Bench:在两个生产级代码库中埋入 105 个真实 bug,让 GPT-6、Claude、Grok、Gemini、DeepSeek、Kimi、GLM 等前沿编码模型在各自的 agentic CLI(Codex CLI、Claude Code、Grok CLI、Antigravity CLI)中每库一轮,自主查找并修复。所有 diff 对照隐藏答案盲评,只计预先埋入的 bug。排行榜实时更新,含完整方法说明与每次运行记录。
首批发现示例:Muse Spark 1.3 的 xhigh 档比 high 档贵 50%、慢 13%,却只多修出 1 个 bug——max 档似乎带来最大的一次性跳跃。
所属事件:Bug Hunt Bench 实测:Muse Spark 1.3 并列登顶(5 条相关)→
「编程与Agent」频道最新
- 前微软高管:AI 编程助手让我从三块显示器变成一台笔记本 — MParakhin · 2026-09-13
- px0:单二进制只读 IDE,冷启动不足 1ms 专为 AI agent 验证而生 — arpit_bhayani · 2026-09-13
- 开发者弃用 Claude,改用浏览器版 Strawberry 工作流提效 — damienghader · 2026-09-13
- 2 万条笔记的 Obsidian 库里养一个 AI 助手:先有系统才有 AI — dSebastien · 2026-09-13
- Claude Skills 实测:会议记录一键变 Word 行动清单 — eyishazyer · 2026-09-13
- AllSpark 开源 Iris-mini/pro:同级最强开放权重搜索智能体 — The Decoder · 2026-09-13