自建 Bug Hunt 基准实测:GPT-6.1 Sol 更强且比上代便宜 10 倍

PawelHuryn · x · 2026-10-07

作者 Paweł Huryn 用自建的 Bug Hunt Benchmark(2 个真实仓库、105 个 2026 年初前沿模型都漏掉的 bug)实测 Opus 5.5、Sonnet 5.5、GPT-6.1 Sol 等新模型,关键发现:

全套数据与基准测量免费公开。

所属事件:自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →