Bug Hunt Bench 横评:105 个真实 bug,Gemini 3.8 Flash 升至 20/105
PawelHuryn · x · 2026-09-03
Pawel Huryn 在 Bug Hunt Bench(盲评、每仓库单 prompt)上测试了 Gemini 3.8 Flash (high) 并更新横评数据:2 个真实仓库、105 个隐藏植入 bug。
- Fable 5.1 (max):43/105,$77.55
- GPT-5.6 (max):42/105,$69.61
- Grok 4.6 (xhigh):27/105,$16.96
- Opus 5 (max):21/105,$51.33
- Gemini 3.8 Flash (high):20/105,$9.78
要点:
- 3.8 Flash 从 3.6 Flash 的 16/20 明显跃升,虽非榜首但性价比突出;成本在榜单上相差约两百倍
- 剩余 43 个 bug 尚无任何模型修好——作者强调这些不是随机 bug,而是 2026 年初 agent 们普遍漏掉的难题;「unplanted」未计入,因 OpenAI 系模型常报告并修复真实但不相关的 issue
- 实用建议:用不同家族的另一模型复核你的工作,避免共享盲区
所属事件:105 个隐藏 bug 实测:Fable 5.1 找出 43 个居首(3 条相关)→
「编程与Agent」频道最新
- 开发者晒多智能体全栈方案:加密中继、A2A 通信与统一 MCP — RileyRalmuto · 2026-09-03
- 分析 8351 个 Claude Code 插件:74% docs 提交实为运行时指令 — rohanpaul_ai · 2026-09-03
- 曝 Palo Alto Networks 以 5 亿美元收购 AI IT 服务商 Console — marcbhargava · 2026-09-03
- Grok Bot 发布 16 天,7 步搭建 24/7 多智能体工作流 — gekobraa · 2026-09-03
- 开发者用 ASC CLI + Agent 全程配置内购,App 一周过审零拒审 — rudrank · 2026-09-03
- Hermes Agent v0.21 发布:子代理升级为自协作的常驻团队 — gekobraa · 2026-09-03