105 个真实 bug 实测:GPT-6 Astra 得 45 分居首,GPT-6 Sol 大幅退化

JohnMcKeownn · x · 2026-09-24

Pawel Huryn 用两个真实仓库里的 105 个隐藏 bug 实测前沿编码模型,结果为:GPT-6 Astra (max) 修复 45 个、GPT-5.6 Sol 43.5、Opus 5.5 41.7、Muse Spark 1.3 32.2、GPT-6 Sol 仅 29.3,表现大幅退化。换算成 API 等效成本差距也很明显:GPT-6 Astra 约 $33,Opus 5.5 约 $58.5,GPT-5.6 Sol 高达 $95+。bug 清单不公开以保持基准有效性,但作者公布了测试覆盖范围。

所属事件:Bug Hunt Bench 实测 GPT-6:Astra 居首,Sol 版本大幅退化(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →