同一模型差价数倍:Batch 半价、缓存低至一折的账怎么算
AccBalanced · x · 2026-10-09
开发者社区常被问:为什么同一个模型,调用方式不同价格差很多?meggmcnulty 拆解了定价页之外的几个关键变量:
- 批量(Batching):Anthropic、OpenAI、Google 对异步任务统一打五折(最长 24 小时交付,实际多数远快于此),本质是拿闲置 GPU 容量换低价;Google 还反着卖加急档,溢价 75-100%。
- 提示词缓存:复用长前缀(system prompt、文档、代码库)时,Anthropic 和 OpenAI GPT-5 系列的输入 token 降到约一折;OpenAI 旧模型打 25-50%。Anthropic 写缓存另收费(5 分钟档 1.25 倍、1 小时档 2 倍),需要重复命中才划算。
- 缓存与批量可以叠加使用。
结论:定价页的每百万 token 单价只是起点,实际成本很大程度取决于调用方式。
「模型」频道最新
- Emad Mostaque:OpenAI 解 Navier-Stokes 花掉千万美元算力 — rohanpaul_ai · 2026-10-09
- 马斯克站台 Grok Bot:可调用 Opus 5.5、全量访问 X 数据 — elonmusk · 2026-10-09
- 开发者吐槽 Opus 5.5 不打招呼就塞进一堆小修复 — rickasaurus · 2026-10-09
- Mistral 高管澄清:FrontierCode 由 Cognition 私有评测,样本不外泄 — b_roziere · 2026-10-09
- Google 把决策模型塞进 Chrome,实测与 Gemini Nano、Decisions API 对比 — gaganghotra_ · 2026-10-09
- 用户随手录 60 秒屏幕,Grok Bot 竟自动剪出像样的教程视频 — elonmusk · 2026-10-09