前沿大模型实测:105个隐藏bug超半数未被捕获

一项基准测试将7个前沿大模型放入VS Code扩展和LMS两个真实代码库中,挑战修复共计105个隐藏bug。结果显示,表现最好的GPT-5.6 Sol仅修复了31个,其中在LMS的60个回归bug中额外解决了29个。整体而言,有多达63个bug躲过了所有模型的检测,暴露出当前AI在复杂代码排查能力上的明显局限。

2026-07-27 ~ 2026-07-27 · 4 条相关