GPT-5.6 Sol 在双仓库基准中修复 105 个隐藏 bug 里的 31 个
PawelHuryn · x · 2026-07-27
这项基准测了什么
- 作者把 7 个前沿模型拉到 两个互不相关的代码库 上找 bug:一个是 VS Code 扩展,一个是 LMS。
- 每个模型对每个仓库只跑 一轮,并采用 严格 diff 评分:只有真正修掉问题才算数。
- 评测用的是 真实补丁作为真值,还配了盲审、匿名提交和隐藏答案键。
核心结果
- GPT-5.6 Sol:总共修复 31 个 bug
- Fable 5:24
- Opus 5:21
- Kimi K3:21
- Grok 4.5:16
- Opus 4.8:9
- Sonnet 5:9
主要结论
- 在仓库 1 中,45 个 bug 里有 28 个躲过了所有模型。
- 在仓库 2 中,60 个真实线上回归里有 33 个没被任何模型修掉。
- 作者强调:测试全绿不等于代码库干净,模型给出自信的“未发现问题”报告,也不代表真的查全了。
- 图表还展示了不同模型在 耗时 和 成本 上差异很大。
所属事件:前沿大模型实测:105个隐藏bug超半数未被捕获(4 条相关)→
「模型」频道最新
- Gemini 3.6 Flash 被看作能以低成本打 Sonnet 质量 — haider1 · 2026-07-27
- 用户吐槽 Opus 5 能力严重降级:满嘴胡言还算错题 — whatsallthiss · 2026-07-27
- Reddit 长文拆解 Kimi K3 背后的 MoE 和长上下文栈 — MohamedKadri_ · 2026-07-27
- Reddit 讨论本地编程模型怎么选,重点是规划和推理 — naunen · 2026-07-27
- Opus 5 刷爆 ARC-AGI-3?遭硬核打假:疑似背诵答案而非真实推理 — scaling01 · 2026-07-27
- MineBench 指出 Opus 5.0 质量更强但成本高 64% — ENT_Alam · 2026-07-27