实测新模型:Opus 5.5 性能追平 Fable 5.1 而成本仅三分之二

PawelHuryn · x · 2026-10-07

Paweł Huryn 不信任公开基准,用自建 Bug Hunt Benchmark(2 个真实仓库、105 个 2026 年初前沿模型漏掉的 bug)实测 Opus 5.5、Sonnet 5.5、GPT-6.1 Sol,结论:

全部数据与测量免费公开。

所属事件:自建Bug Hunt基准实测新模型:Sonnet 5.5夺魁(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →