Bug Hunt Bench 新数据:GPT-6 Sol(max)仍不及 Opus 5.5(medium)

PawelHuryn · x · 2026-09-23

Bug Hunt Bench(面向真实植入 bug 的编程模型榜单,blind 评分,105 个 bug)公布新数据:

榜单同时提供分数-成本、分数-耗时视图:各模型成本差距约 200 倍,耗时差距不到 7 倍,由 Pawel Huryn 运营,主打实测无吹捧。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →