GPT-6 Sol 实测:算力拉满近线性提升但Bug修复仍落后
开发者 Pawel Huryn 实测 GPT-6 Sol 各 effort 档位表现,图表显示成绩随算力档位提升几乎呈直线增长。但另一边,面向真实植入 bug 的盲测编程榜单 Bug Hunt Bench(含105个bug)公布新数据显示,GPT-6 Sol(max)的成绩仍不及 Opus 5.5(medium)档,也与 GPT-5.6 Sol 水平相当,说明单纯拉满算力并未在真实缺陷修复任务上带来领先优势。
2026-09-23 ~ 2026-09-23 · 2 条相关
- 第 1 集:OpenAI 发布 GPT-6 Sol 与 Luna:价格减半但实测并非全面超越(2026-09-23,88 条)
- 第 2 集:LMArena 上线 GPT-6 Sol/Luna 实测投票(2026-09-23,2 条)
- 第 3 集:GPT-6 定价大降,OpenAI 与 Anthropic 掀价格战(2026-09-23,3 条)
- 第 4 集:GPT-6 Sol 实测:算力拉满近线性提升但Bug修复仍落后(2026-09-23,2 条)
- Bug Hunt Bench 新数据:GPT-6 Sol(max)仍不及 Opus 5.5(medium) — PawelHuryn · 2026-09-23
- GPT-6 Sol算力拉满近线性提升:各effort档位成绩对比实测 — PawelHuryn · 2026-09-23