Bug Hunt Bench 实测 105 个真实 bug,DeepSeek-V4.1-Flash 高性价比夺目
PawelHuryn · x · 2026-09-10
开发者 Pawel Huryn 发布 Bug Hunt Bench:在两个生产代码库中埋入 105 个真实 bug,让 GPT-6、Claude、Grok、Gemini、DeepSeek、Kimi、GLM 等前沿模型在各自的 agentic CLI(Codex CLI、Claude Code 等)中一轮定位并修复,修复 diff 对照隐藏答案盲评,只计预埋 bug。
- DeepSeek-V4.1-Flash (high):max effort 24/105,耗时 42.6 分钟、花费 $1.80;high effort 19/105,花费仅 $0.31。
- 对比:Gemini 3.8 Flash (high) 20/105、$9.78;GLM-5.3 (default) 19/105、$19.73。
- deepseek-v4-pro 的 max/high effort 结果即将更新,榜单在 GitHub 与线上实时更新,附每个 bug 的完整凭据。
- 作者 FAQ 澄清:这些是 2026 年初前沿模型起初也难解的真实硬 bug;OpenAI 模型常报告真实但不相关的 bug,不计分以免膨胀分数;每家模型由另一模型家族盲评,校准已验证。
所属事件:Bug Hunt Bench 实测 105 个真实 bug,DeepSeek-V4.1-Flash 高性价比亮眼(2 条相关)→
「模型」频道最新
- Hy4 preview 实测:一条 prompt 产出可玩的 3D 生存游戏 — mhdfaran · 2026-09-10
- Gemini 2.5 Pro 独享 Google 搜索加持,高分或含水分 — Afinetheorem · 2026-09-10
- 官方确认:用户选择 opt-out 后,提示与回复不会用于任何形式的训练 — BlackHC · 2026-09-10
- 同场基准补测:GPT-6 Astra 低档 27 分、中档 34 分修 Bug — PawelHuryn · 2026-09-10
- ChatGPT 永远要「纠偏」?用户抱怨其过度谨慎不肯认账 — Due-Conference-5134 · 2026-09-10
- DeepSeek 应对需求暴涨的方案:把模型做得更便宜更快 — yacineMTB · 2026-09-10