自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁

开发者 Paweł Huryn 不信任公开基准,自建 Bug Hunt Benchmark,基于 2 个真实仓库、105 个 2026 年初前沿模型都漏掉的 bug,实测 Opus 5.5、Sonnet 5.5、GPT-6.1 Sol 等新模型并核算各家订阅的真实 API 成本。结果显示 Sonnet 5.5 位列满分档夺魁;Opus 5.5 性能追平 Fable 5.1 而成本仅其三分之二;GPT-6.1 Sol 表现更强且比上一代 GPT-5.6 便宜约 10 倍。

2026-10-07 ~ 2026-10-07 · 3 条相关

事件全程(共 2 集)→

另有 1 条近重复转述:PawelHuryn