DeepSeek-V4-Flash 本地部署实测:消费级显卡到 DGX Spark 全覆盖
DeepSeek-V4-Flash-0731 发布后,社区迅速展开本地部署实测,硬件覆盖从单张消费级显卡到多卡混插,再到 NVIDIA DGX Spark。测试结果显示,通过合理的量化方案与软件优化,该模型在个人硬件上具有极高的可玩性与实用价值,不同配置下的推理速度差异显著,为各类预算提供了详实参考。
已确认
- 消费级与专业级 N 卡实测:单张 RTX 3090 在未优化环境下仅 4.02 tok/s(m12),但搭配 128GB 内存与特殊参数优化后可达 12.5 tok/s(m1)。RTX A6000 配合 256GB 内存运行 Q8 量化版约为 17.2 tok/s(m3)。双卡 RTX PRO 6000 Blackwell 使用投机解码实现了 243 tok/s 的中位数吞吐量(m15)。
- 多卡混插与极限配置:3 张 RTX 3090 运行 Q3KXL 量化占用 119GB 显存(m11);5 张消费级显卡(2x3080, 2x3090, 5090)全显存加载时 Prompt 处理速度约 600 t/s(m7)。双 RTX 3060 加 96GB 内存也可在 Unsloth Studio 中运行(m4)。
- AMD 显卡可行:3 张 MI50 达 15 tok/s(m6),1 张 7900 XTX 混合 3 张 MI60 达 11 tok/s(m8)。
- 苹果 Mac 生态:M2 Ultra 192GB 内存可流畅运行长文本推理,Prefill 阶段性能强劲(m2)。
- DGX Spark 表现突出:单机 DGX Spark 运行 3bit 量化版可达 16.5 tok/s(m19),2-bit 量化版也能完整加载 155GB 模型(m10)。双机 DGX Spark 使用官方 FP8 权重,单流吞吐量达 82 tok/s(峰值 95),3 并发可达 135 tok/s(m18)。此外,单机 DGX Spark 在 12 并发下的聚合吞吐量可达 58.5 tok/s(m9)。
- 上下文与并发能力:双卡 RTX PRO 6000 最初被认为仅支持 131K 上下文(m20),但随后被证实得益于滑动窗口注意力机制,可运行完整百万上下文,且并发处理能力得到提升(m17)。
尚未确认
- m9 提及的单台 DGX Spark 在 agentic 工作流性能反超双卡 vLLM 版本,该结论依赖特定测试场景,普适性尚待验证。
- 部分极端优化数据(如 m15 的 243 tok/s)来自特定开发者的单一测试,需进一步复现以确认其在更广泛硬件上的一致性。
为什么重要
这些密集的实测表明,DeepSeek-V4-Flash 在多种硬件上均可本地运行,大幅降低了前沿大模型的部署门槛。投机解码、自定义多卡量化分配(如 m5)等优化手段,为本地 AI 部署提供了极具价值的实践参考,也凸显了个人 AI 超级计算机(如 DGX Spark)在性价比上的潜力(m16)。
2026-08-01 ~ 2026-08-03 · 22 条相关
一手来源
- RTX 3090 跑 DeepSeek-V4-Flash:128GB 内存 + 特殊参数实现 12.5 tok/s — Ok_Ninja7526 ·
- 双卡 RTX 6000 实测 DeepSeek:投机解码跑出 243 tok/s — TheZachMueller ·
- 双机 DGX Spark 实测跑满 DeepSeek v4 Flash — andrewchen ·
- 单张 3090 极限跑 DeepSeek V4:每秒生成 4 tokens — Altruistic_Heat_9531 · 2026-08-01
- 【源头】双卡 RTX 6000 实测 DeepSeek:投机解码跑出 243 tok/s — TheZachMueller · 2026-08-02
- 【源头】双机 DGX Spark 实测跑满 DeepSeek v4 Flash — andrewchen · 2026-08-02
- 双 3060 外加 96GB 内存跑 DeepSeek 实测:速度与功耗成本一览 — esw123 · 2026-08-02
- 多卡满载部署 DeepSeek V4,Prompt 处理速度仅 600 t/s — fragment_me · 2026-08-02
- 本地跑 DeepSeek V4-Flash:双卡 RTX 6000 实测仅支持单人使用 — dee_hw · 2026-08-02
- DeepSeek V4 Flash 3bit 量化版 3x3090 实测:119GB 占用 — consultkitapp · 2026-08-02
- DeepSeek 新发布大幅提升 Nvidia DGX Spark 本地部署价值 — firstadopter · 2026-08-02
- 【源头】RTX 3090 跑 DeepSeek-V4-Flash:128GB 内存 + 特殊参数实现 12.5 tok/s — Ok_Ninja7526 · 2026-08-02
- DeepSeek-V4-Flash 在 RTX PRO 6000 eGPU 上跑出 44-59.5 tok/s 解码速度 — backslashHH · 2026-08-02
- DeepSeek-V4-Flash 自定义 IQ3 量化方案:多卡混插提升 40% 解码速度 — HockeyDadNinja · 2026-08-02
- 3张MI50实测本地运行DeepSeek V4:速度达15 t/s — Kamal965 · 2026-08-02
- DeepSeek v4 Flash 单块 DGX Spark 跑赢双卡,agentic 工作流性能反超 — pbaylies · 2026-08-02
- DeepSeek-V4 本地实测:A6000+256GB 内存跑 17 t/s — USBhost · 2026-08-02
- 双 DGX Spark 搭配 DeepSeek V4 Flash:实现前沿模型本地运行 — lifebypixels · 2026-08-02
- 双卡跑满 DeepSeek V4-Flash 百万上下文:并发提升 1.5 倍 — dee_hw · 2026-08-02
- 混合 4 张 AMD 显卡本地跑大模型,推理速度达 11 t/s — Hyungsun · 2026-08-02
- 两台 DGX Spark 跑智能体编码:日处理 1 亿 token 的经济账 — HarveenChadha · 2026-08-02
- Mac本地跑大模型:M2 Ultra 192G长文本推理实测 — Badger-Purple · 2026-08-02
- 单台 DGX Spark 跑满 DeepSeek V4 Flash 155G:2-bit 量化与 MTP 提速实测 — Puzzleheaded_Base302 · 2026-08-03
- DGX Spark 本地跑大模型实测:DeepSeek V4 Flash 夺魁 — andersonbcdefg · 2026-08-03
- DeepSeek-V4-Flash单机推理实测:6.5GB模型实现48.9 tok/s — max_paperclips · 2026-08-03