DeepSeek 推理成本再估算
teortaxesTex · x · 2026-07-20
帖子基于 DSpark 论文和此前的 V4 serving report,重新估算了 DeepSeek V4 系列在不同上下文长度下的推理成本。图中给出:在 10K/100K/1M 上下文下,V4-Flash 约为 $0.764/$0.770/$0.821 每百万输出 token,V4-Pro 约为 $2.870/$2.878/$2.952。
作者进一步用生产环境吞吐量和 $2/GPU-hour 的假设,推算出更贴近实际的成本:V4-Flash 约 $0.035/M 输出 token,V4-Pro 约 $0.10/M,50/50 混合约 $0.067/M。
他强调,这些生产数值远低于 batch-1 的 roofline 估算,因为 continuous batching 能把 MoE 权重流量摊薄到大量并发请求上;而文中提到的 60–85% Flash、57–78% Pro 提升主要反映延迟/交互性改善,不能直接当作成本节省。
「Infra」频道最新
- NVIDIA 在 AMD AI 事件前公开 Vera CPU 架构细节 — ryanshrout · 2026-07-22
- oMLX 0.5.2 增加菜单栏统计和低比特解码内核 — awnihannun · 2026-07-22
- Strangeworks 推出 Aura,把企业运营变成优化系统 — whurley · 2026-07-22
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- HilbertRaum 开源一款完全本地运行的私有 AI 聊天应用 — Vladowski · 2026-07-22
- 混合与本地推理,正在成为 AI 能耗和 token 成本的解法 — dmitry140 · 2026-07-22