烧掉350亿token实测:ChatGPT 5.6 编程登顶,GLM-5.2 写作惊艳
thatroblennon · x · 2026-08-10
一位重度 AI 用户基于今年消耗的 350 亿+ tokens 真实使用体验,发布了最新的大模型战力榜:
- 🥇 ChatGPT 5.6 (Codex):日常编程首选。代码能力顶尖,废话比 Claude 少,Max 计划额度更足。建议常规问题用 Medium 思考模式,写作降到 Low 模式以防过度思考。
- 🥈 Claude Fable / Opus 5:创意、头脑风暴和写作主力。能找出 ChatGPT 漏掉的代码隐患,交流体验极佳。Opus 5 建议用 Medium/High,全天开 Max 容易让人崩溃。
- 🥉 GLM-5.2:虚构写作与内容创作黑马。对话和写作质量极佳,多项能力已逼近甚至超越 ChatGPT/Claude,作者考虑为其订阅每月 200 美元的 Max 计划。
- Grok:在追踪 X 平台最新动态和灰色地带任务上有优势,但在遵循复杂指令方面明显偏弱,桌面与移动端 App 体验被批为“灾难”。
此外,作者认为 Gemini 目前仅适合处理包含图表的视频;而 Kimi 模型在写作上极具特色,但在 OpenCode 中偶尔会出现工具调用错误。
「模型」频道最新
- Pinterest财报:开源模型微调成本仅为闭源的8% — juliey4 · 2026-08-10
- 字节发布抖音多模态嵌入模型,已上线搜索业务 — ByteDance · 2026-08-10
- 研究者称整合Cursor数据奏效,Grok 4.6编码能力将比肩前沿大模型 — DeryaTR_ · 2026-08-10
- 前沿模型行为观察:处理复杂任务时存在过度设计倾向 — eigenron · 2026-08-10
- Sol 模型意外展露暧昧人格,无缘无故称呼用户为甜心 — repligate · 2026-08-10
- GPT-5.6 Luna降价5倍后需求激增8倍 — benklieger · 2026-08-10