Bug Hunt Bench 实测 GPT-6:Astra 居首,Sol 版本大幅退化
Pawel Huryn 用两个真实仓库中的 105 个隐藏 bug 实测前沿编码模型:GPT-6 Astra (max) 修复 45 个居首,GPT-5.6 Sol 修复 43.5 个紧随其后,而 GPT-6 Sol 仅修复 29 个,较上代大幅退化。第三方账号 StatsWire 的结果也印证了这一退化现象,引发对 GPT-6 不同版本编码能力差异的关注。
2026-09-24 ~ 2026-09-25 · 2 条相关
- 第 1 集:OpenAI 发布 GPT-6 Sol 与 Luna:价格减半、幻觉大降,但非全面超越前代(2026-09-23,92 条)
- 第 2 集:GPT-6 Sol/Luna 上线口碑分化:降价换质量引争议(2026-09-23,9 条)
- 第 3 集:LMArena 上线 GPT-6 Sol/Luna 实测投票(2026-09-23,2 条)
- 第 4 集:四款新模型一周改写性价比前沿,Opus 5.5 登顶(2026-09-23,2 条)
- 第 5 集:OpenAI 与 Anthropic 同日降价,掀新一轮模型价格战(2026-09-23,7 条)
- 第 6 集:实测:GPT-6 Sol 随算力近线性提升,Bug Hunt 仍不敌 Opus 5.5(2026-09-23,3 条)
- 第 7 集:Bug Hunt Bench 实测 GPT-6:Astra 居首,Sol 版本大幅退化(2026-09-24,2 条)
- 第 8 集:GPT-6 命名流出:Sol 对应 Terra,Luna 疑退化(2026-09-24,3 条)
- 第 9 集:Bug Hunt Bench 发布:105 个真实 bug 横评前沿编码模型,成本差 200 倍(2026-09-24,3 条)
- 第 10 集:网友推测 OpenAI 高效新模型意在腾算力并适配超快推理(2026-09-25,2 条)
- 105 个真实 bug 实测:GPT-6 Astra 得 45 分居首,GPT-6 Sol 大幅退化 — JohnMcKeownn · 2026-09-24
- Bug Hunt Bench 实测:GPT-6 Sol 仅修 29/105,不如上代 — ssh4net · 2026-09-25