多模型实测:Gemini 推理称王,GLM 5.2 开源性价比高
iamsatvik20 · reddit · 2026-08-18
博主基于自测数据对比了 GPT 5.6、GLM 5.2、DeepSeek v4 Pro、Gemini 3.1 Pro 和 Opus 5。
能力表现:
- 综合与编码:GPT 5.6 Sol 和 Opus 5 领先,Opus 5 在代理编码任务上表现最佳。
- 推理:Gemini 3.1 Pro 在 ARC AGI 2 上得分 77.1%,大幅超越旧版,且拥有 100 万 token 上下文。
- 开源模型:GLM 5.2 性价比极高,在 SWE Bench Pro 上表现优异;DeepSeek v4 Pro 的实测成绩略低于宣发数值。
成本分析:DeepSeek v4 Pro 价格最低($0.435/M input),Opus 5 最贵($5/M input)。结论是:追求全能选 Opus/GPT,重推理选 Gemini,预算有限选 DeepSeek/GLM。
「模型」频道最新
- Qwen、GPT、Grok 同台竞技 Three.js 香水站开发 — Acceptable-Object390 · 2026-08-18
- 4B 小模型在浏览器内实现免费 Vibecoding — Mysterious_Hearing14 · 2026-08-18
- 实测 Qwen 3.8:3080Ti + Strix Halo 跑通 1M 上下文 — TrifleHopeful5418 · 2026-08-18
- FinCode-Reasoning-3B发布:金融数学零幻觉,CPU可跑 — coslinedev · 2026-08-18
- Qwen 和 DeepSeek 竟在基准测试中使用 Claude Code — goddamnit_1 · 2026-08-18
- Gemini vs Grok vs Claude vs Kimi 谁更懂草图? — eyishazyer · 2026-08-18