Bug Hunt Bench 新数据:GPT-6 Sol(max)仍不及 Opus 5.5(medium)
PawelHuryn · x · 2026-09-23
Bug Hunt Bench(面向真实植入 bug 的编程模型榜单,blind 评分,105 个 bug)公布新数据:
- GPT-6 Sol(max)≈ GPT-5.6 Sol(medium)。
- GPT-6 Sol(max)< Opus 5.5(medium)。
榜单同时提供分数-成本、分数-耗时视图:各模型成本差距约 200 倍,耗时差距不到 7 倍,由 Pawel Huryn 运营,主打实测无吹捧。
「编程与Agent」频道最新
- 阿里 Qwen Intelligence 发布,三大手机智能体端到端成功率 90% — Alibaba_Qwen · 2026-09-23
- 删掉三个 Agent 换 40 行 if 语句:延迟降 9 秒到 0.8 秒,成本省 75% — Prestigious_Style267 · 2026-09-23
- 开源 digital-twins:用无状态假服务测试触 Gmail/Slack 的 Agent — aofu_dev · 2026-09-23
- 别把脚本吹成 Agent:自动化与 Agentic AI 的界线到底在哪 — forevergeeks · 2026-09-23
- 用 DORA 指标衡量 AI 编程代理:从 PR 到合并的效率观察 — vincent_koc · 2026-09-23
- AI 浏览器 Strawberry 实测:把代理装进浏览器替代多标签协作 — damienghader · 2026-09-23