Claude Opus 5 在同仓库修出 11 个 bug,Opus 4.8 只修 2 个

PawelHuryn · x · 2026-07-25

一位用户分享了 Claude Opus 5 的实测:在自己一个约 2.8 万行的 VS Code 扩展仓库里,埋了 45 个 bug,而且测试都能通过、不容易被发现。结果是 Opus 5 修复了 11 个,同条件下 Opus 4.8 只修复了 2 个。

更关键的是,Opus 5 不仅修到了 4.8 修到的那两个,还额外找出了 9 个更难的 bug,并且 没有误修。作者还提到它的行为有点“怪”——比如没有按要求去“分析这个解决方案”,反而去看 git 历史,但这些看似偏题的动作最终带来了意外洞察。作者称 Bug Hunt Bench 只是单项测试,但目前 Opus 5 已经是他最喜欢的模型。

所属事件:多模型实测修 Bug:GPT-5.6 与 Opus 5 表现领先(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →