GPT-6 Sol 实测:算力拉满近线性提升但Bug修复仍落后

开发者 Pawel Huryn 实测 GPT-6 Sol 各 effort 档位表现,图表显示成绩随算力档位提升几乎呈直线增长。但另一边,面向真实植入 bug 的盲测编程榜单 Bug Hunt Bench(含105个bug)公布新数据显示,GPT-6 Sol(max)的成绩仍不及 Opus 5.5(medium)档,也与 GPT-5.6 Sol 水平相当,说明单纯拉满算力并未在真实缺陷修复任务上带来领先优势。

2026-09-23 ~ 2026-09-23 · 2 条相关

事件全程(共 4 集)→