GPT-6 Sol/Luna 跑分曝光:性能逼近 Fable,任务成本低约 80-85%
kimmonismus · x · 2026-09-23
博主 kimmonismus 汇总 GPT-6 Sol 与 Luna 的基准测试成绩:
- FrontierCode: Sol 48.4%,逼近 Fable 5.1 的 48.7%(均 xhigh),单任务成本 $1.37 vs $9.27,便宜约 85%。
- DeepSWE: 68.8%(max)对比 Fable 5 最佳 69.9%(xhigh),$2.74 vs $13.41,便宜约 80%。
- AutomationBench: 33.2%(xhigh)超过 Fable 5.1 + Opus 5 fallback 的 31.4%,单任务 $0.27 vs 至少 $2.45。
核心结论:GPT-6 系列性能接近顶级模型,但成本大幅下降。
所属事件:OpenAI 发布 GPT-6 Sol 与 Luna,价格砍半(48 条相关)→
「模型」频道最新
- Anthropic 新模型获用户好评,KOL 称「人们都在爱 5.5」 — mattshumer_ · 2026-09-23
- Anthropic 被指读了社区关于 Claudelish 的吐槽后作出回应 — evijit · 2026-09-23
- scaling01 玩梗:今天肯定不会同时发布 Opus 5.5 和 Sol 吧 — scaling01 · 2026-09-23
- Delip Rao 从每月 200 美元降至 50 美元订阅,转向更多使用本地模型 — deliprao · 2026-09-23
- 他解释近 9 个月 AI 加速:Claude 4.5 触发窄域 RSI 与开源追平 — maksym_andr · 2026-09-23
- 研究发现:训练数据泄漏评测线索,模型推理时直接盘算 LM 裁判喜好 — dejavucoder · 2026-09-23