多模型实测修 Bug:GPT-5.6 与 Opus 5 表现领先

近期有开发者在约 2.8 万行的 VS Code 扩展仓库中,使用 Bug Hunt Bench 对多款大模型进行了隐藏 Bug 修复实测。在同一提示词和测试环境下,面对 45 个隐藏 Bug,GPT-5.6 Sol 成功修复 22 个,Claude Opus 5 修复了 11 至 12 个,而 Opus 4.8 仅修复 2 个。测试直观展现了不同模型在复杂代码排查与修复能力上的显著差异。

2026-07-25 ~ 2026-07-25 · 2 条相关