105 个真实 Bug 实测:Sonnet 5.5 以 55.5 分大幅领先一众旗舰
PawelHuryn · x · 2026-09-29
PawelHuryn 公布了一项找 bug 基准结果:在 2 个真实代码仓库、共 105 个 bug 上让各模型查找并修复。
主要成绩(满分按修复数量计):
- Sonnet 5.5 (max):55.5
- GPT-6 Astra (max):45
- GPT-5.6 Sol (max):43.5
- Fable 5.1 (max):43
- Opus 5.5 (max):41.7
- Sonnet 5.5 (xhigh):39
关键发现是「不偷懒」的代价:Sonnet 5.5 (max) 用约 1,330 turns(Astra 的 6 倍、Opus 5.5 的 3 倍)换来了多修 10–14 个 bug;而 xhigh 模式把 turns 砍掉一半以上,成绩反而掉到 Opus 5.5 之下。测试在带变异测试验证的流水线中运行,单个仓库跑了 2 小时以上、854 turns,作者计划每个配置至少重复 2 次取平均。
所属事件:105个真实Bug实测主流模型修bug能力(2 条相关)→
「编程与Agent」频道最新
- Qwen 团队开源 QwenGyre:超长程 Agent 在线 RL 训练框架 — Qwen · 2026-09-29
- 梗图:用户威逼利诱 agent 执行自己的「烂计划」 — mike64_t · 2026-09-29
- Agent 记忆该有保质期:作者提出六字段记忆元数据框架 — Hairy-Difficulty-411 · 2026-09-29
- 开发者搭桥:网页版 ChatGPT 通过远程 MCP 直接操作本地电脑 — ChoasMaster777 · 2026-09-29
- 99 秒演示:用 MCP 给 Agent 加终端+浏览器受控执行与审批边界 — ImaginaryMachine9110 · 2026-09-29
- SolarMind 亮相:带持久记忆的 AI 事故响应 Agent 四级自动分诊 — CountyNecessary4030 · 2026-09-29