Bug Hunt Bench:105 个真实 bug 实测 GPT-6、Claude 等前沿模型排位

PawelHuryn · x · 2026-09-13

开发者 Pawel Huryn 发布 Bug Hunt Bench:在两个生产级代码库中埋入 105 个真实 bug,让 GPT-6、Claude、Grok、Gemini、DeepSeek、Kimi、GLM 等前沿编码模型在各自的 agentic CLI(Codex CLI、Claude Code、Grok CLI、Antigravity CLI)中每库一轮,自主查找并修复。所有 diff 对照隐藏答案盲评,只计预先埋入的 bug。排行榜实时更新,含完整方法说明与每次运行记录。

首批发现示例:Muse Spark 1.3 的 xhigh 档比 high 档贵 50%、慢 13%,却只多修出 1 个 bug——max 档似乎带来最大的一次性跳跃。

所属事件:Bug Hunt Bench 实测:Muse Spark 1.3 并列登顶(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →