DeepSeek 推理成本再估算
teortaxesTex · x · 2026-07-20
帖子基于 DSpark 论文和此前的 V4 serving report,重新估算了 DeepSeek V4 系列在不同上下文长度下的推理成本。图中给出:在 10K/100K/1M 上下文下,V4-Flash 约为 $0.764/$0.770/$0.821 每百万输出 token,V4-Pro 约为 $2.870/$2.878/$2.952。
作者进一步用生产环境吞吐量和 $2/GPU-hour 的假设,推算出更贴近实际的成本:V4-Flash 约 $0.035/M 输出 token,V4-Pro 约 $0.10/M,50/50 混合约 $0.067/M。
他强调,这些生产数值远低于 batch-1 的 roofline 估算,因为 continuous batching 能把 MoE 权重流量摊薄到大量并发请求上;而文中提到的 60–85% Flash、57–78% Pro 提升主要反映延迟/交互性改善,不能直接当作成本节省。
「Infra」频道最新
- Oracle Q1 云基建收入三位数增长,AI 算力需求持续爆发 — DavidLinthicum · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11