专题 · FULL STORY

GPT-6.1 Sol:实测亮眼,官方基准引争议

GPT-6.1 Sol 上线后,多位评测者在编程、3D 生成、翻译等任务实测,结论普遍认为其性能接近 GPT-6 Astra 而成本大幅更低。随后 OpenAI 内部基准称其大幅领先 Claude Opus 5.5,却因方法透明度遭到社区质疑。

2026-09-30 ~ 2026-10-01 · 2 集 · 18 条

第 1 集 · GPT-6.1 Sol 多项实测出炉:性能近 Astra、成本大幅更低(2026-09-30,16 条)

GPT-6.1 Sol 上线后,多位独立评测者在编程、3D 生成、翻译等任务上进行了实测,主流结论是:性能接近 GPT-6 Astra,而 token 成本大幅降低,性价比显著领先,但个别基准结果与官方「接近 Astra 级」的说法存在差距。

已确认

  • Pawel Huryn 在 2 个真实代码仓库植入 105 个 bug 进行盲测(Bug Hunt Bench):max 档下 GPT-6 Astra 修 45 个花 $33,GPT-6.1 Sol 修 44 个,花费仅 $6.56,成本约为 Astra 的 1/5 甚至更低;他判断这次是「真材实料」,不同于被视为削弱版 GPT-5.6 Terra 的 GPT-6 Sol。
  • Huryn 随后公布了全部 effort 档位成绩(max/xhigh 为 n=3,其余 n=2,追加复测进行中),结论是 Astra 更快但更贵,结合成本他认为没有理由再用 GPT-6 Astra。
  • adonissingh 的 eyebench-v3 榜单显示 GPT-6.1-Sol 排第二,取代 Opus-5.5 的位置;价格比 astra 便宜约 3.8 倍,约为 Opus-5.5 的 1/8;成本维度 Pareto 最优,但输出 token 效率在任何 effort 档位上均低于 Astra。
  • maxbittker 的 Runescape Bench(恶搞性质)上 GPT-6.1 Sol 排第二,价格约为 Astra 的 10%。
  • cedricchee 实测 3D 生成:质量接近 Astra,速度快约 30%,AA Index 比 GPT-6 Sol 高 4 分。
  • 开发者 codestantine 在自建低资源语言翻译基准上称 GPT-6.1 Sol 超过 Astra,提升幅度大于从 5.6 Sol 到 6 Astra 的跨越(nickbaumann 转发)。
  • Reddit 用户 therealjerseytom 称其「符合宣传」,同等工作量 token 成本远低于 6 Astra,而 6 Astra 此前成本昂贵且失败返工代价高。
  • 用户 chogku 称 GPT-6.1 Sol + Opus 5.5 组合质量好、价格便宜、能力接近 Astra,rudrank 转发称「梦想成真」。

尚未确认

  • 独立评测机构 BridgeBench 实测 GPT 6.1 Sol 仅比 GPT 6 Sol 高 3 分、落后 GPT 6 Astra 82 分,与 OpenAI 官方「接近 Astra 级智能」的表述及其他评测者的正面结论存在明显分歧,模型真实定位仍有争议。
  • Huryn 的追加 n=3 复测当时仍在进行,各档位最终成绩或有更新。

为什么重要

  • 成本结构变化是本轮评测的核心增量:多项独立实测一致显示接近旗舰性能的模型以 1/5 到 1/10 的价格交付,可能改变开发者默认模型选择与 agent 大规模部署的经济学。
  • 各第三方基准结论并不完全一致(如 BridgeBench),提示模型能力评估仍需按具体任务区分,不宜一概而论。

第 2 集 · OpenAI 内部基准称 GPT-6.1 Sol 大幅领先引质疑(2026-09-30,2 条)

9月30日 Reddit 用户发帖称,OpenAI 内部基准测试显示 GPT-6.1 Sol 在多项指标上大幅领先 Claude Opus 5.5,Anthropic 正努力追赶。次日有博主引用该帖并配文调侃,认为这类评测说法恰恰戳破了业界对基准分数的盲目崇拜,提醒用户理性看待未经证实的内部基准传闻。