Bug Hunt 实测:Sonnet 5.5 满分档夺魁,GPT-6.1 Sol 比 GPT-5.6 便宜 10 倍

PawelHuryn · x · 2026-10-07

Paweł Huryn 用自建 Bug Hunt Benchmark(2 个真实仓库、105 个 2026 年初前沿模型都漏掉的 bug)实测新模型,并核算各家订阅计划的真实 API 价值。

主要发现:

作者已免费公开全部数据与 benchmark 测量结果。

所属事件:自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →