专题 · FULL STORY

GPT-6 Sol/Luna 发布:降价实测与生态跟进

OpenAI 于 9 月 23 日发布 GPT-6 家族的 Sol 与 Luna,价格大幅下调并同步登陆 ChatGPT。发布当天 LMArena 开放盲测,开发者实测显示算力档位近线性提升但 Bug 修复仍落后,同时引发与 Anthropic 的价格战讨论。

2026-09-23 ~ 2026-09-23 · 4 集 · 95 条

第 1 集 · OpenAI 发布 GPT-6 Sol 与 Luna:价格减半但实测并非全面超越(2026-09-23,88 条)

9 月 23 日,OpenAI 官宣发布 GPT-6 家族的 GPT-6 Sol 与 GPT-6 Luna,两款模型当天上线 ChatGPT Work 与 Codex(覆盖 Plus/Pro/Business/Enterprise/Edu,Free 和 Go 用户可在桌面端用 Luna),并开放 API(gpt-6-sol 等),Sam Altman 称其在智能、对齐、编码与计算机操作等方面全面升级,每 token 价格为前代一半。Artificial Analysis 随后将其纳入 Intelligence Index v4.3 横评,多位用户实测则显示新模型并非全面超越前代:更便宜、更高效、幻觉更少,但在部分软件工程与知识工作评测上出现回退。

已确认

  • 定价减半:官方公告与多个信源确认,Sol 从 $4/$20 降至 $2/$10(每百万 tokens),Luna 输入 $0.10 / 输出 $0.50(从 $0.20/$1.20 下调);OpenAI 并宣称部分编码评测任务成本比 Claude Opus 5 最多便宜 93%(Polymarket 亦转述此口径),Altman 称按每任务定价「市场无对手」。官方定位口号为「用 Sol 构建,用 Luna 规模化」,两款模型均基于 GPT-6 Astra 的技术成果。
  • 编码代理提升:Codex 环境下 GPT-6 Sol (max) 在 Coding Agent Index 得 57 分,较 GPT-5.6 提升 2 分,每任务成本约为前代一半;Luna (max) 数据同步公布,其 Max 档在 DeepSWE 上与 Sol High、Astra Low 相当而价格仅约 Sol 的三分之一(Internet--Sensation 等转述)。
  • 幻觉率下降:AA-Omniscience 基准上 Sol 幻觉率从 92% 降至 60%,Luna 从 93% 降至 77%(max effort)。
  • 知识工作回退:GDPval-AA v2.1(改编自 OpenAI 覆盖 44 个职业的数据集)max effort 模式下 Sol 与 Luna 均回退,人工检查主因是回答更短、遗漏要点。
  • DeepSWE 下降:power97992、Angaisb 等多位用户实测及转述显示 GPT-6 Sol 在 DeepSWE 上低于 GPT-5.6 Sol;Luna 相比 5.6 Luna 则小幅提升且同样降价。kimmonismus 汇总的跑分(FrontierCode 48.4% xhigh 等)亦提供对比数据,并称 Sol 比对手便宜约 85% 打平 Fable 5.1。
  • AutomationBench 亮点:reachvb 与 orange 转述称 Sol (xhigh) 在 AutomationBench 上以约 9% 的成本反超 Opus 5;官方还称其采用类 Astra 训练方法,语言更清晰、黑话更少。
  • 正面实测:Every 的 Dan Shipper 称 GPT-6 Sol 已成其 Codex 日常主力,写作逼近 Astra、更快且比 5.6 Sol 便宜约 50%。

尚未确认

  • ns123abc 转述的爆料称 GPT-6 Sol 在 computer use、research debugging 上也差于 5.6 Sol,网络安全任务无提升,自称未经证实;kristoph 帖中有人讥讽其只是改名 Terra,同为传闻。
  • sytelus 称 GPT-6 Sol 在 HealthBench 及部分生物/化学安全评测上不及上一代,未附来源。
  • weswinder 与 adonissingh 怀疑厂商有意「埋掉」DeepSWE 基准,属推测,无官方回应。
  • power97992 称 Sol 的 xhigh 档在部分编码任务上输给 5.6 Sol 的 max 档,样本有限的个人实测;FalconsArentReal 亦转述用户侧初步对比称 Sol 复杂任务弱于 5.6 Sol、胜在成本与效率。

为什么重要

新模型未在所有指标上超过旧版较为反常,引发对代际进步是否放缓、厂商选择性披露评测的讨论;同时价格腰斩叠加幻觉率大幅下降(Reddit 用户 indiantruely 等认为该定价可能挤压大量开源与闭源模型),对成本敏感的生产场景吸引力明显。同日 Anthropic、Qwen 等竞品密集发布,编码类 API 市场竞争加剧。第三方基准、用户实测与日常使用评价方向不完全一致,提示应按自身任务负载实测选型,而非迷信「新一代」。

还有 68 条相关讨论 →

第 2 集 · LMArena 上线 GPT-6 Sol/Luna 实测投票(2026-09-23,2 条)

LMArena 宣布 OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 现已可在其平台上测试,支持 Battle Mode 盲测对战与 Agent Mode 两种模式,用户可对真实 agentic 任务投票评测。官方同时预告两款模型的榜单成绩即将公布,社区已有将其与 GPT-5.6 对比的实测结果流出。

第 3 集 · GPT-6 定价大降,OpenAI 与 Anthropic 掀价格战(2026-09-23,3 条)

OpenAI 推出更便宜的 GPT-6 系列:GPT-6 sol 价格约为 5.6-sol 的五分之一,GPT-6 Luna 定价砍半至输入 $0.10、输出 $0.50,让本已极低的前代价格都显得昂贵。与此同时,Anthropic 同期发布 Claude Opus 5.5。评论者指出,两家公司突然在成本上激烈竞争,焦点已从模型智力转向价格战。

第 4 集 · GPT-6 Sol 实测:算力拉满近线性提升但Bug修复仍落后(2026-09-23,2 条)

开发者 Pawel Huryn 实测 GPT-6 Sol 各 effort 档位表现,图表显示成绩随算力档位提升几乎呈直线增长。但另一边,面向真实植入 bug 的盲测编程榜单 Bug Hunt Bench(含105个bug)公布新数据显示,GPT-6 Sol(max)的成绩仍不及 Opus 5.5(medium)档,也与 GPT-5.6 Sol 水平相当,说明单纯拉满算力并未在真实缺陷修复任务上带来领先优势。