实测GPT/Claude/Gemini/Kimi真实任务成本:价差2倍但实际成本差10.6倍

pixelo2323 · reddit · 2026-07-23

作者对OpenAI、Anthropic、Gemini和Kimi的实时API进行了10个真实产品任务测试(分类、RAG问答、多轮对话、agent规划执行等),使用各厂商成本优化层。结果显示总成本差异达10.6倍,而公布费率仅差2倍,主要原因是推理和思考token按输出费率计费但响应中不显示。最极端案例:一个单词的分类答案,某模型消耗了197个不可见推理token。该研究关联CostBench(ACL 2026)和TerminalWorld的发现。完整方法、原始结果和10个任务提示已公开在GitHub。

所属事件:实测四大AI模型真实任务成本差异超10倍(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →