GPT-5.6 三档位基准横评
docdavkitty · reddit · 2026-07-13
这条帖对 OpenAI GPT-5.6 的三个档位做了完整横评:Sol / Terra / Luna。
关键信息
- OpenAI 于 7 月 9 日 GA 发布 GPT-5.6
- 三个 tier 可以独立迭代:
- Sol:$5 / $30 per 1M tokens
- Terra:$2.50 / $15
- Luna:$1 / $6
- 新增了 max reasoning 和 ultra multi-agent 模式
主要基准表现
- Terminal-Bench 2.1:Sol 88.8%,Terra 87.4%,Luna 84.7%
- BrowseComp:Sol 92.2%,作者称为 SOTA
- AA Coding Agent Index:Sol 80,Terra 77.4,Luna 74.6
- SWE-Bench Pro:Sol 64.6%,但作者也指出 OpenAI 对这个 benchmark 有质疑
- DeepSWE value:Luna 的性价比被认为非常高,约 24 pts / $1,明显优于更贵的方案
路由结论
- Terra 是大多数工作负载的默认选择
- Sol 主要适合最难的 agentic / terminal 场景
- Luna 更适合高吞吐流水线,性价比很强
- Ultra mode 价格约高 3 倍,但只多出约 3 分,通常不划算
所属事件:OpenAI 发布 GPT-5.6 家族:三档位上线,主推 Sol 性价比(10 条相关)→
「模型」频道最新
- AxiomProver登顶LeanEval,末个未饱和数学形式化基准 — BenBlaiszik · 2026-09-03
- Muse Spark 1.3 把用户叫成 Judah 后又死不承认 — fragment_me · 2026-09-03
- 用户实测:Google AI Mode 对 TOFU 类查询完全不给出处引用 — gaganghotra_ · 2026-09-03
- 评测称 Fable 5.1 失败率减半:每百次仅 7 次失败、幻觉率 0.7% — ryanshrout · 2026-09-03
- Seroter 每日阅读清单:Gemini 3.8 Flash、agent 遥测与 7 种 skill 模式 — rseroter · 2026-09-03
- 爆料称 OpenAI Astra 有两个测试版,主打长时自主任务 — Ok_Display_3159 · 2026-09-03