二手 R940 加双 3090 跑起 DeepSeek V4-Flash,33 tok/s
AbbreviationsSad5582 · reddit · 2026-08-04
二手 R940 加双 3090 跑起 DeepSeek V4-Flash,单流 33 tok/s
这条帖子给出了一个完整的本地推理实测:用一台二手 Dell R940 服务器加 2 张 RTX 3090,跑官方 DeepSeek V4-Flash-0731 全量 checkpoint,验证了对这类稀疏 MoE 模型来说,显存/内存容量比单卡算力更关键。
- 模型规模是 284B 总参数 / 13B 激活参数,官方 checkpoint 体积约 156 GB。
- 机器配置包括 4× Xeon Platinum 8268、768 GB DDR4-2933 和 2× RTX 3090 24 GB。
- 推理栈是 Lvllmds4-x v2.3.8,底层基于 vLLM fork,并用 lkmoe v2.3.1 做 NUMA 感知的 CPU-GPU 混合 MoE 执行。
- 因为 Ampere 没有原生 FP4/FP8 计算,权重通过 Marlin 内核跑;该 checkpoint 是 QAT 训练,路由专家以 MXFP4 形式原生提供。
- 实测吞吐为:单流 33 tok/s,4 并发总计 53–68 tok/s,8 并发总计 47–63 tok/s。
- 解码时整机功耗约 1000W,两张 3090 平均只吃 136–145W;按 $0.13/kWh 估算,24/7 运行大约 $94/月。
- 作者的结论是:用二手企业服务器 + 二手 GPU,大约 $6K 就能把这个全量 checkpoint 跑起来。
「Infra」频道最新
- 核能初创公司 Valar 获红杉领投 10 亿美元融资 — kleffew94 · 2026-08-04
- 2025 图表显示,AI API 收入仍远落后于云厂商 capex — SurpriseDog9000 · 2026-08-04
- 美国中部对 AI 数据中心的反弹正在升温 — altryne · 2026-08-04
- 半导体和数据中心的扩张,远慢于 AI 需求 — robleclerc · 2026-08-04
- Gemma 4 31B 的 KV Cache 内存开销比 DeepSeek V4 Flash 高 13 倍 — teortaxesTex · 2026-08-04
- 面向嵌入式板卡的 MCP 服务器支持结构化编译刷写调试 — Historical_Court795 · 2026-08-04