Reddit 测试:GPT、Claude、Gemini、Kimi 真实任务成本差 10.6 倍

pixelo2323 · reddit · 2026-07-23

这条 Reddit 做了一个很实用的横评:用 10 个真实产品任务 去测试 GPT、Claude、Gemini 和 Kimi 的实际成本,任务包括分类、RAG 问答、多轮对话,以及 agentic 的 plan-then-execute 流程。

结论很扎眼:真实任务成本差了 10.6 倍,但公开标价只差了 2 倍左右。作者认为,主要原因是隐藏的 reasoning / thinking tokens 被按输出价计费,却不会显示在最终回复里。帖子里举了一个例子:某个只需一句话的分类任务,模型却额外消耗了 197 个不可见推理 token。

帖子还把这个结果和几项研究联系起来:

作者表示,完整方法、原始结果和 10 个任务提示词都已公开在 GitHub。

所属事件:实测四大AI模型真实任务成本差异超10倍(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →