DeepSeek 推理成本再估算

teortaxesTex · x · 2026-07-20

帖子基于 DSpark 论文和此前的 V4 serving report,重新估算了 DeepSeek V4 系列在不同上下文长度下的推理成本。图中给出:在 10K/100K/1M 上下文下,V4-Flash 约为 $0.764/$0.770/$0.821 每百万输出 token,V4-Pro 约为 $2.870/$2.878/$2.952。

作者进一步用生产环境吞吐量和 $2/GPU-hour 的假设,推算出更贴近实际的成本:V4-Flash 约 $0.035/M 输出 token,V4-Pro 约 $0.10/M,50/50 混合约 $0.067/M。

他强调,这些生产数值远低于 batch-1 的 roofline 估算,因为 continuous batching 能把 MoE 权重流量摊薄到大量并发请求上;而文中提到的 60–85% Flash、57–78% Pro 提升主要反映延迟/交互性改善,不能直接当作成本节省。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →