Claude Opus 5 在同仓库修出 11 个 bug,Opus 4.8 只修 2 个
PawelHuryn · x · 2026-07-25
一位用户分享了 Claude Opus 5 的实测:在自己一个约 2.8 万行的 VS Code 扩展仓库里,埋了 45 个 bug,而且测试都能通过、不容易被发现。结果是 Opus 5 修复了 11 个,同条件下 Opus 4.8 只修复了 2 个。
更关键的是,Opus 5 不仅修到了 4.8 修到的那两个,还额外找出了 9 个更难的 bug,并且 没有误修。作者还提到它的行为有点“怪”——比如没有按要求去“分析这个解决方案”,反而去看 git 历史,但这些看似偏题的动作最终带来了意外洞察。作者称 Bug Hunt Bench 只是单项测试,但目前 Opus 5 已经是他最喜欢的模型。
所属事件:Bug实测:GPT-5.6修复22个bug领先Claude Opus 5(3 条相关)→
「编程与Agent」频道最新
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11
- 实测质疑 RTK 省 token 说法:成本基准显示并不成立 — michalwarda · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11