GPT-6 Sol/Luna 基准流出:任务成本比 Fable 低约 85%
kimmonismus · x · 2026-09-23
kimmonismus 晒出 GPT-6 Sol 与 Luna 的基准成绩与成本对比:
- FrontierCode:Sol 48.4%,与 Fable 5.1 的 48.7% 基本持平(均在 xhigh 档),但每任务 $1.37 vs $9.27,便宜约 85%
- DeepSWE:68.8%(max)vs Fable 5 最好的 69.9%(xhigh),每任务 $2.74 vs $13.41,便宜约 80%
- AutomationBench:33.2%(xhigh)vs Fable 5.1+Opus 5 fallback 的 31.4%(max),每任务 $0.27 vs 至少 $2.45
核心结论:GPT-6 代际在 agent/编码类任务上以接近旗舰的成绩实现大幅成本优势,任务级价格差距达数倍到十几倍。
所属事件:OpenAI 发布 GPT-6 Sol 与 Luna,价格砍半(48 条相关)→
「模型」频道最新
- scaling01 玩梗:今天肯定不会同时发布 Opus 5.5 和 Sol 吧 — scaling01 · 2026-09-23
- Delip Rao 从每月 200 美元降至 50 美元订阅,转向更多使用本地模型 — deliprao · 2026-09-23
- 他解释近 9 个月 AI 加速:Claude 4.5 触发窄域 RSI 与开源追平 — maksym_andr · 2026-09-23
- 研究发现:训练数据泄漏评测线索,模型推理时直接盘算 LM 裁判喜好 — dejavucoder · 2026-09-23
- 用户实测:Opus 5.5 综合最强,胜过 GPT 6 Sol 与 Fable — petergyang · 2026-09-23
- 用仿真 persona 做 12 轮盲测:对比 Fable 5.1 与 Opus 5.5 — every · 2026-09-23