105 个真实 Bug 实测:Sonnet 5.5 以 55.5 分大幅领先一众旗舰

PawelHuryn · x · 2026-09-29

PawelHuryn 公布了一项找 bug 基准结果:在 2 个真实代码仓库、共 105 个 bug 上让各模型查找并修复。

主要成绩(满分按修复数量计):

关键发现是「不偷懒」的代价:Sonnet 5.5 (max) 用约 1,330 turns(Astra 的 6 倍、Opus 5.5 的 3 倍)换来了多修 10–14 个 bug;而 xhigh 模式把 turns 砍掉一半以上,成绩反而掉到 Opus 5.5 之下。测试在带变异测试验证的流水线中运行,单个仓库跑了 2 小时以上、854 turns,作者计划每个配置至少重复 2 次取平均。

所属事件:105个真实Bug实测主流模型修bug能力(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →