7 个前沿模型在 922 绿测下仍漏掉 44 个隐藏 bug
PawelHuryn · x · 2026-07-27
Repo 1:45 个隐藏 bug,7 个模型各跑一轮
这组基准测试把 7 个前沿模型放到一个 VS Code 扩展代码库里,考察它们能否修复 45 个隐藏 bug。虽然 922 个测试全程保持绿色,但按 diff 进行的裁决显示,测试通过并不等于代码真的修好了。
关键信息:
- Sonnet 5 只修复了 1 个 bug,还为这个修复补了回归测试。
- 随后它给出了一份逐行审查报告,结论是:“Suspected but not fixed: None.”
- 结果仍有 44 个 bug 留在代码里。
- 配图还列出了各模型在修复数、耗时和成本上的表现,其中 GPT-5.6 Sol 在这轮里领先。
这条帖子的核心结论很直接:测试全绿和模型自信的审查结论,都不能单独证明代码正确。
所属事件:前沿大模型实测:105个隐藏bug超半数未被捕获(4 条相关)→
「模型」频道最新
- 继续实测:6 个 luna 模型照图作画,结果出乎意料地不差 — adonis_singh · 2026-09-23
- 用 computer use 让模型照参考图作画,Opus 与 Astra 实测对比 — adonis_singh · 2026-09-23
- AI 玩狼人杀说服众人投出对手,最终获胜 — pbbakkum · 2026-09-23
- 博主实测称 Anthropic Opus 5.5 对话体验出色 — daniel_mac8 · 2026-09-23
- AI 模型盈利榜分析:Opus 5.5 半价碾压 Fable 5.1,Grok 越用越亏 — Wsz2020 · 2026-09-23
- MachgenAI:账户余额超25美元可免费用Minimax H3 Turbo生成 — TheMoonMidas · 2026-09-23