多模型找 Bug 评测:谁最会修代码

PawelHuryn · x · 2026-07-19

作者在自己的 VS Code 扩展仓库 grok-build 里埋了 45 个 bug,用五个模型在各自原生 harness、同一提示词、高 effort 条件下做找错与修复测试。

结果显示:

作者建议的组合是:Fable 5 做判题/审查,GPT-5.6 Sol 负责执行;若追求性价比,则用 Grok 4.5 单独跑,卡住时再用 Fable 或 Sol 辅助。最终有 27/45 个 bug 逃过了所有模型。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →