前沿大模型实测:105个隐藏bug超半数未被捕获
一项基准测试将7个前沿大模型放入VS Code扩展和LMS两个真实代码库中,挑战修复共计105个隐藏bug。结果显示,表现最好的GPT-5.6 Sol仅修复了31个,其中在LMS的60个回归bug中额外解决了29个。整体而言,有多达63个bug躲过了所有模型的检测,暴露出当前AI在复杂代码排查能力上的明显局限。
2026-07-27 ~ 2026-07-27 · 4 条相关
- GPT-5.6 Sol 在双仓库基准中修复 105 个隐藏 bug 里的 31 个 — PawelHuryn · 2026-07-27
- GPT-5.6 Sol 在 60 个回归 bug 基准中又修了 29 个意外问题 — PawelHuryn · 2026-07-27
- 7 个前沿模型在 922 绿测下仍漏掉 44 个隐藏 bug — PawelHuryn · 2026-07-27
- 105 个隐藏 bug 里有 63 个躲过了所有前沿模型 — PawelHuryn · 2026-07-27