多模型找 Bug 评测:谁最会修代码
PawelHuryn · x · 2026-07-19
作者在自己的 VS Code 扩展仓库 `grok-build` 里埋了 45 个 bug,用五个模型在**各自原生 harness**、同一提示词、**高 effort** 条件下做找错与修复测试。 结果显示: - **GPT-5.6 Sol** 找到 13 个隐藏 bug,外加 9 个仓库里本来就存在的真实 bug,还新增了 7 个测试;作者认为它更像“追踪 bug 的疯子”,执行力最强。 - **Fable 5** 诊断最锋利,但成本最高,约 **$36**;更适合做判断,不一定最适合直接执行。 - **Grok 4.5** 性价比最好,约 **$6**,速度快,还会在未提示时自行生成子 agent,适合常规工作。 - **Kimi K3** 很慢,修 4 个 bug 花了 **62 分钟**,但全都修对了,适合夜间跑。 - **Opus 4.8** 只确认并报告自己完全验证过的内容,比较保守。 作者建议的组合是:**Fable 5 做判题/审查,GPT-5.6 Sol 负责执行**;若追求性价比,则用 **Grok 4.5 单独跑**,卡住时再用 Fable 或 Sol 辅助。最终有 **27/45** 个 bug 逃过了所有模型。
「编程与Agent」频道最新
- Codex 的 UI 能力实测 — CSProfKGD · 2026-07-20
- Obsidian CEO 开源日常 Claude Skills 配置 — Roger_M_Taylor · 2026-07-20
- GBrain为LLM挑选上下文 — garrytan · 2026-07-20
- 12个Agent实战项目清单 — Roger_M_Taylor · 2026-07-20
- HF 上的 lingbot-video 在热榜 — victor · 2026-07-20
- 用真实代码说服 AI 怀疑者 — alex_verem · 2026-07-20