GPT-6 Sol/Luna 评测汇总:更便宜幻觉更少但未全面超越上代
GPT-6 Sol 与 Luna 发布后,Artificial Analysis 将两款模型纳入 Intelligence Index v4.3 横评并发布系列深度数据;同时多位用户实测称 GPT-6 Sol 在部分复杂任务上不敌上代 GPT-5.6 Sol,Every 团队则给出偏正面的日常使用评价。整体图景是:新模型更便宜、更高效、幻觉更少,但并非全面超越前代,在软件工程与知识工作评测上出现回退。
已确认
- 定价减半:Artificial Analysis 数据显示,Sol 从 $4/$20 降至 $2/$10(每百万 tokens),Luna 从 $0.20/$1.20 降至约一半。
- 编码代理提升:在 Codex 环境下,GPT-6 Sol (max) 在 Coding Agent Index 上得 57 分,较 GPT-5.6 提升 2 分,每任务成本约为前代一半;Luna (max) 同样有相应数据公布。
- 幻觉率下降:AA-Omniscience 基准上,Sol 幻觉率从 92% 降至 60%,Luna 从 93% 降至 77%(max effort)。
- 知识工作回退:在 GDPval-AA v2.1(改编自 OpenAI 覆盖 44 个职业的数据集)max effort 模式下,Sol 与 Luna 均出现回退,人工检查发现主要原因是交付更短、遗漏要点。
- DeepSWE 下降:多位用户(power97992、Angaisb 等)实测及转述均显示 GPT-6 Sol 在 DeepSWE 上得分低于 GPT-5.6 Sol;Luna 相比 GPT-5.6 Luna 则有小幅提升且同样降价。
- AutomationBench 亮点:博主 orange 总结称,Sol 在 AutomationBench 上超越 Opus 5 且仅用其 9% 的成本;其还提到 GPT-6 采用类 Astra 训练方法,语言风格更清晰、黑话更少。
- 正面实测:Every 的 Dan Shipper 称 GPT-6 Sol 已成为其 Codex 日常主力,写作水平逼近 Astra,速度更快且比 5.6 Sol 便宜约 50%,虽不完全比得上 Astra 但日常大部分工作够用。
尚未确认
- 用户 ns123abc 转述的爆料称 GPT-6 Sol 在 computer use、research debugging 上也差于 5.6 Sol、网络安全任务无提升,该说法自称未经证实。
- weswinder 及 adonissingh 怀疑厂商有意回避、「埋掉」DeepSWE 基准,属推测,无官方回应佐证。
- 用户 power97992 称 GPT-6 Sol 的 xhigh 档在部分编码任务上输给 5.6 Sol 的 max 档,为个人实测,样本有限。
为什么重要
新模型未在所有指标上超过旧版较为反常,引发对模型代际进步是否放缓、厂商选择性披露评测的讨论;同时价格腰斩叠加幻觉率大幅下降,对成本敏感的生产场景仍有明显吸引力。第三方基准、用户实测与日常使用评价(如 Every 的正面结论)方向不完全一致,提示按自身任务负载实测选型比迷信「新一代」更重要。
2026-09-23 ~ 2026-09-23 · 13 条相关
一手来源
- GPT-6 Sol/Luna 价格腰斩:Sol 幻觉率从 92% 降至 60% — ArtificialAnlys ·
- GPT-6 Sol/Luna 登上 Artificial Analysis 智能指数 v4.3 横评 — ArtificialAnlys ·
- Every 实测 GPT-6 Sol:写作逼近 Astra,比 5.6 Sol 便宜 50% — every ·
- GPT-6 Sol 评测意外不敌 GPT-5.6 Sol,仅价格更低 — Angaisb_ · 2026-09-23
- 【源头】Every 实测 GPT-6 Sol:写作逼近 Astra,比 5.6 Sol 便宜 50% — every · 2026-09-23
- 【源头】GPT-6 Sol/Luna 价格腰斩:Sol 幻觉率从 92% 降至 60% — ArtificialAnlys · 2026-09-23
- GPT-6 Sol 编程代理评测涨 2 分,成本仅为前代一半 — ArtificialAnlys · 2026-09-23
- GPT-6 两款模型幻觉率均显著低于前代 — ArtificialAnlys · 2026-09-23
- GPT-6 在 GDPval 知识工作评测上回退:交付更短、漏要点 — ArtificialAnlys · 2026-09-23
- 【源头】GPT-6 Sol/Luna 登上 Artificial Analysis 智能指数 v4.3 横评 — ArtificialAnlys · 2026-09-23
- AA 公布 GPT-6 智能指数 v4.3 各分项评测明细 — ArtificialAnlys · 2026-09-23
- 爆料称 GPT-6 Sol 在编码与调试任务上不敌 5.6 Sol — ns123abc · 2026-09-23
- 用户实测:GPT-6 Sol 高强度档反不如 5.6 Sol Max — power97992 · 2026-09-23
- GPT-6 sol 在 DeepSWE 基准上不升反降,被指刻意回避评测 — adonis_singh · 2026-09-23
- GPT-6 Sol 复杂任务弱于 5.6 Sol,胜在成本与效率 — FalconsArentReal · 2026-09-23
- GPT 6 全系更新:Sol/Luna 降价 50%,成本仅为 Opus 5 的 9% — oran_ge · 2026-09-23