105 个真实 bug 实测编码模型:GPT-6 Astra 修 48 个居首

PawelHuryn · x · 2026-09-05

PawelHuryn 在两个真实仓库上做了一场 105 个 bug 的「查找并修复」实测(Max effort 档):GPT-6 Astra 修出 48/105,Fable 5.1 修出 43/105,GPT-5.6 Sol 42/105,Gemini 3.8 Flash 仅 20/105,且 GPT-6 Astra 在耗时和成本上也效率突出。但他吐槽接入体验糟糕:OpenRouter 对 effort 档位支持不稳定,而 Meta 的 Muse Spark 1.3 API 在欧洲无法付费访问(试了 4 张 Visa/MasterCard 都失败)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →