实测GPT/Claude/Gemini/Kimi真实任务成本:价差2倍但实际成本差10.6倍
pixelo2323 · reddit · 2026-07-23
作者对OpenAI、Anthropic、Gemini和Kimi的实时API进行了10个真实产品任务测试(分类、RAG问答、多轮对话、agent规划执行等),使用各厂商成本优化层。结果显示总成本差异达10.6倍,而公布费率仅差2倍,主要原因是推理和思考token按输出费率计费但响应中不显示。最极端案例:一个单词的分类答案,某模型消耗了197个不可见推理token。该研究关联CostBench(ACL 2026)和TerminalWorld的发现。完整方法、原始结果和10个任务提示已公开在GitHub。
所属事件:实测四大AI模型真实任务成本差异超10倍(2 条相关)→
「模型」频道最新
- Qwen-Image-3.0 对上 GPT-Image-2 做复杂版式实测 — Scobleizer · 2026-07-23
- Dean Ball 认为 Kimi 编码很强,但开权重经济账仍吃亏 — koltregaskes · 2026-07-23
- Simon Willison:模型已能原生完成长任务,loops 正变得过时 — teropa · 2026-07-23
- 一个 Qwen 3.6 27B 衍生模型声称推理 token 减少 90% 以上 — AppealSame4367 · 2026-07-23
- Claude Opus 5 传闻、OpenAI Codex 语音 agent 与 Cerebras 750 tok/s — imjustnewatai · 2026-07-23
- BrowseComp 图表显示 Kimi K3 高分低成本,排在左上角 — iamfakhrealam · 2026-07-23