RTX 4090+Tesla P40 实测:本地 CPU 跑 DeepSeek v4 Flash
DigiDecode_ · reddit · 2026-08-09
作者分享了在本地硬件(RTX 4090 + Tesla P40 + 128GB 内存)上部署运行 DeepSeek v4 Flash 0731 的详细实践与踩坑经验。
部署细节与挑战:
- 量化方案选择:尝试了 Unsloth 4bit KXL(约144GB),但开启 DSpark MTP 会溢出内存,最终改用 IQ4XS 量化(约127GB)。
- 推理速度:在开启 MTP 和 5k+ 上下文的情况下,IQ4XS 实现了约 3 token/sec 的生成速度和 30 token/sec 的提示词处理速度。
- 硬件分配策略:由于 llama.cpp 暂不支持该模型的张量切分,需手动逐层分配。embed 和 output 层必须留在 RTX 4090 上(因 Tesla P40 不支持 Gated Delta Net 的某些算子),其余层分配给 P40 和 CPU。
- 参数优化:-dev 标志的设备顺序显著影响处理速度,将 RTX 4090 设为 CUDA0 能大幅提升 prompt 处理速度。
「Infra」频道最新
- Databricks 实践:通过 AI 网关与模型路由将内部 AI 成本暴降 90% — AdiPolak · 2026-08-10
- Autonomous Labs 双 GPU 自主计算机实拍:满载运行也安静 — dee_hw · 2026-08-10
- 3张5090混插AMD显卡跑DeepSeek:本地算力折腾实录 — fluffywuffie90210 · 2026-08-10
- 单卡RTX 5090实测:Minimax H3视频生成极限加速方案 — nik_amaze · 2026-08-10
- 四大科技巨头 2027 年 AI 资本开支预计达 9345 亿美元 — Beth_Kindig · 2026-08-10
- 开发者痛点:如何自动路由 API 以优化多模型成本? — MartinGTobias · 2026-08-10