GPT-6 Sol/Luna 价格腰斩:Sol 幻觉率从 92% 降至 60%
ArtificialAnlys · x · 2026-09-23
Artificial Analysis 发布 GPT-6 Sol 与 Luna 的深度评测:
- 定价减半:Sol 从 $4/$20 降至 $2/$10(每百万 tokens),Luna 从 $0.20/$1.20 降至 $0.10/$0.50,缓存读 9 折、写加价 25% 政策不变。Sol 每任务成本 $1.06(前代 $1.99),Luna $0.07(前代 $0.18),大幅改写成本效率帕累托前沿。
- Coding Agent Index:Sol 得 57 分(+2),Terminal-Bench 4.0 从 37% 升至 43%;Luna 反而降 2 分至 41。Sol 每任务 $2.99,成本减半。
- 幻觉显著下降:Sol 幻觉率从 92% 降到 60%(策略是多拒答,尝试率从 99% 降至 83%,准确率反而降 5 分至 54%);Luna 从 93% 降到 77%。
- 有升有降:AutomationBench、Terminal-Bench 提升,但知识工作类评测 GDPval-AA v2.1 上 Sol 掉约 100 Elo、Luna 掉 75,AA-Briefcase 上 Luna 掉 45——人工抽查发现回归主因是交付物更简短、遗漏评分要点。
所属事件:Artificial Analysis 深度评测 GPT-6:价格腰斩、幻觉率大降但 GDPval 回退(6 条相关)→
「模型」频道最新
- 开发者:硬核编码仍选 Fable 5.1,Opus 5.5 远不及 — bindureddy · 2026-09-23
- Opus 5.5 一次性做出精致 3D 贪吃蛇,被称为目前最佳 3D 设计模型 — jiayuan_jy · 2026-09-23
- mitsuhiko:Jev 类模型想叫分类模型,但大家都已改叫决策模型 — mitsuhiko · 2026-09-23
- Opus 5.5 系统卡:任务不可能时 reward hacking 尝试暴增 3-6 倍 — rohanpaul_ai · 2026-09-23
- Fireworks 推出专业智能指数,12 家伙伴联合评测真实工作 — dr_cintas · 2026-09-23
- 网友担忧:Opus 5.5 领先 Astra 6,OpenAI 前景承压 — rickasaurus · 2026-09-23