Reddit 测试:GPT、Claude、Gemini、Kimi 真实任务成本差 10.6 倍
pixelo2323 · reddit · 2026-07-23
这条 Reddit 做了一个很实用的横评:用 10 个真实产品任务 去测试 GPT、Claude、Gemini 和 Kimi 的实际成本,任务包括分类、RAG 问答、多轮对话,以及 agentic 的 plan-then-execute 流程。
结论很扎眼:真实任务成本差了 10.6 倍,但公开标价只差了 2 倍左右。作者认为,主要原因是隐藏的 reasoning / thinking tokens 被按输出价计费,却不会显示在最终回复里。帖子里举了一个例子:某个只需一句话的分类任务,模型却额外消耗了 197 个不可见推理 token。
帖子还把这个结果和几项研究联系起来:
- CostBench:领先模型经常选不到最省钱的计划
- TerminalWorld:失败的 agent 尝试会消耗更多 token,且和成功率显著相关(r = -0.62)
作者表示,完整方法、原始结果和 10 个任务提示词都已公开在 GitHub。
所属事件:实测四大AI模型真实任务成本差异超10倍(2 条相关)→
「模型」频道最新
- dots 称内部系统在上海 IMO 2026 拿到 42/42 — xeophon · 2026-07-23
- Antirez 指出 Laguna S2.1 连意大利语都写不好 — antirez · 2026-07-23
- Eyisha Zyer:模型血缘比 API 痕迹更能证明身份 — eyishazyer · 2026-07-23
- Claude 用户被提醒:Opus 5 若今天发布,额度可能重置 — CtrlAltDwayne · 2026-07-23
- 截图显示 Laguna 英文认 Poolside,中文却说自己是 Qwen — Serious-Affect-6410 · 2026-07-23
- X 传闻称 GPT-5.6、750 token/s 与 Opus 5 今日或将登场 — Scobleizer · 2026-07-23