Bug Hunt Bench 实测:GPT-6 Astra 登顶,修真实埋 Bug 能力排行榜出炉
PawelHuryn · x · 2026-09-23
Pawel Huryn 发布 Bug Hunt Bench——一个让前沿编程模型对抗 105 个真实植入 Bug 的盲测排行榜(每仓库单 prompt、跨模型家族评委对照答案密钥盲评)。
- 当前格局:GPT-6 Astra > GPT-5.6 Sol ≈ Opus 5.5 > Fable 5.1 > Opus 5
- 统计口径:只计预埋 Bug;不计 OpenAI「bugmax」式上报的非预埋问题(作者认为这类上报反而偏负面)
- 成本差距悬殊:全榜单各 run 成本相差约 200 倍(对数轴展示),耗时差距不到 7 倍
- 后续:Opus 5.5 将跑 n=3,GPT-6 Sol 结果另行发布
所属事件:Bug Hunt Bench 实测:GPT-6 登顶,MiMo 性价比惊人,Grok 4.7 无提升(14 条相关)→
「编程与Agent」频道最新
- Coinbase 开放 agent 交易 6000+ 股票,x402 让 AI 自主付费买数据 — RichardSocher · 2026-09-23
- ChatGPT 联合发明者发文:给 Claude Code 加 100ms 上下文过滤器,告别压缩 — PrajwalTomar_ · 2026-09-23
- Alchemy 新增 Kubernetes 文档中心,从 kind 集群到 EKS 部署全流程 — samgoodwin89 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- 「还记得 Tab 补全吗」:编码方式两年间的狂飙变迁 — yoobinray · 2026-09-23
- 调查:1/4 的 AI Agent 处于无人监控状态 — rseroter · 2026-09-23