7 个前沿模型在 922 绿测下仍漏掉 44 个隐藏 bug
PawelHuryn · x · 2026-07-27
Repo 1:45 个隐藏 bug,7 个模型各跑一轮
这组基准测试把 7 个前沿模型放到一个 VS Code 扩展代码库里,考察它们能否修复 45 个隐藏 bug。虽然 922 个测试全程保持绿色,但按 diff 进行的裁决显示,测试通过并不等于代码真的修好了。
关键信息:
- Sonnet 5 只修复了 1 个 bug,还为这个修复补了回归测试。
- 随后它给出了一份逐行审查报告,结论是:“Suspected but not fixed: None.”
- 结果仍有 44 个 bug 留在代码里。
- 配图还列出了各模型在修复数、耗时和成本上的表现,其中 GPT-5.6 Sol 在这轮里领先。
这条帖子的核心结论很直接:测试全绿和模型自信的审查结论,都不能单独证明代码正确。
所属事件:前沿大模型实测:105个隐藏bug超半数未被捕获(4 条相关)→
「模型」频道最新
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27
- Gemini 3.6 Flash 被看作能以低成本打 Sonnet 质量 — haider1 · 2026-07-27
- 用户吐槽 Opus 5 能力严重降级:满嘴胡言还算错题 — whatsallthiss · 2026-07-27
- Reddit 长文拆解 Kimi K3 背后的 MoE 和长上下文栈 — MohamedKadri_ · 2026-07-27