Claude Opus 5 在同仓库修出 11 个 bug,Opus 4.8 只修 2 个
PawelHuryn · x · 2026-07-25
一位用户分享了 Claude Opus 5 的实测:在自己一个约 2.8 万行的 VS Code 扩展仓库里,埋了 45 个 bug,而且测试都能通过、不容易被发现。结果是 Opus 5 修复了 11 个,同条件下 Opus 4.8 只修复了 2 个。
更关键的是,Opus 5 不仅修到了 4.8 修到的那两个,还额外找出了 9 个更难的 bug,并且 没有误修。作者还提到它的行为有点“怪”——比如没有按要求去“分析这个解决方案”,反而去看 git 历史,但这些看似偏题的动作最终带来了意外洞察。作者称 Bug Hunt Bench 只是单项测试,但目前 Opus 5 已经是他最喜欢的模型。
所属事件:多模型实测修 Bug:GPT-5.6 与 Opus 5 表现领先(2 条相关)→
「编程与Agent」频道最新
- OpenRouter 推出分类器测试版,给模型路由打标签并可视化 — AccBalanced · 2026-07-25
- Codex 工作流技巧:先画流程,再让它实现 — alex_frantic · 2026-07-25
- 微软 OpenForgeRL:在真实部署 harness 中训练智能体 — dair_ai · 2026-07-25
- 论文指出生产级 Agent 失效多因上下文失控 — omarsar0 · 2026-07-25
- Gemini CLI 修复 Windows diff 视图的 CRLF 行尾问题 — luisfelipe-alt · 2026-07-25
- VaynerX 用 Claude 在几小时内做出原本要价 2 万美元的内部应用 — tomcrawshaw01 · 2026-07-25