GPT-5.6 Sol 在双仓库基准中修复 105 个隐藏 bug 里的 31 个
PawelHuryn · x · 2026-07-27
这项基准测了什么
- 作者把 7 个前沿模型拉到 两个互不相关的代码库 上找 bug:一个是 VS Code 扩展,一个是 LMS。
- 每个模型对每个仓库只跑 一轮,并采用 严格 diff 评分:只有真正修掉问题才算数。
- 评测用的是 真实补丁作为真值,还配了盲审、匿名提交和隐藏答案键。
核心结果
- GPT-5.6 Sol:总共修复 31 个 bug
- Fable 5:24
- Opus 5:21
- Kimi K3:21
- Grok 4.5:16
- Opus 4.8:9
- Sonnet 5:9
主要结论
- 在仓库 1 中,45 个 bug 里有 28 个躲过了所有模型。
- 在仓库 2 中,60 个真实线上回归里有 33 个没被任何模型修掉。
- 作者强调:测试全绿不等于代码库干净,模型给出自信的“未发现问题”报告,也不代表真的查全了。
- 图表还展示了不同模型在 耗时 和 成本 上差异很大。
所属事件:前沿大模型实测:105个隐藏bug超半数未被捕获(4 条相关)→
「模型」频道最新
- 工程师直言 Opus 5 留下阴影,称再也无法直视 Opus 模型 — josh_wills · 2026-09-23
- GPT-6 Sol/Luna 登陆 Gm 平台,上线即比官方定价低 12.9% — markjeffrey · 2026-09-23
- 曝 GPT-6 系列 Sol 与 Luna 已上线,用户称便宜好用可与 Opus 5.5 对比 — teortaxesTex · 2026-09-23
- 决策模型 Jev 接入 OM1,在 NVIDIA Isaac Sim 中驱动 Go2 机器人导航 — paigeinsf · 2026-09-23
- 网友辩称随机采样是智能必需:确定性模型或无法「思考」 — burny_tech · 2026-09-23
- 网友预测 2026 秋:Opus 5.5、GPT-6、Qwen4 同期登场 — IanAndrewsDC · 2026-09-23