基准表对比 GPT-5.6 Sol、Claude Fable 5 和 Gemini 3.6 Flash
iruletheworldmo · x · 2026-07-22
GPT-5.6 Sol、Claude Fable 5、Gemini 3.6 Flash 基准对比
这张基准表把三家前沿模型放在一起对比,覆盖编码、代理任务、计算机使用和定价等维度。
- GPT-5.6 Sol 在 DeepSWE v1.1 和 Terminal-Bench 2.1 上领先。
- Claude Fable 5 在 SWE-Bench Pro 和 OSWorld-Verified 上领先。
- Gemini 3.6 Flash 的价格明显更低,标注为 输入 $1.50 / 输出 $7.50(每百万 tokens),但在多个编码与 agent 评测上落后。
- 图中还展示了若干推理与工具使用任务上的接近结果,以及 GDM-MRCR v2 里 GPT-5.6 Sol 的优势。
这条帖子的核心信息不是某个单点分数,而是“能力 vs 成本”的整体对照。
所属事件:Gemini 3.6 Flash 基准出炉:智力停滞但效率提升(20 条相关)→
「模型」频道最新
- 曝某模型支持百万 token 上下文,价格低至 $0.33 — MickeySteamboat · 2026-07-22
- 谷歌发布三款 Gemini 模型,其中一款主攻网络安全 — Polymarket · 2026-07-22
- Google 称搜索信息代理将于今夏登陆 AI Pro 和 Ultra — gaganghotra_ · 2026-07-22
- Poolside 的 Laguna S 2.1 在 Nous Portal 免费开放两周 — NousResearch · 2026-07-22
- Qwen3.8 Max Preview 横评后被认为明显进步 — curiousily_ · 2026-07-22
- Moonshot 的 Kimi K3 登上 MathArena 第五名开源最佳 — xeophon · 2026-07-22