DeepSeek V4 Flash本地跑通:万元组装机实现700pp/s推理

reto-wyss · reddit · 2026-08-03

一位开发者在搭载 RTX 5090 和 512GB DDR4 内存的工作站上,成功完成了 DeepSeek-V4-Flash-0731 的本地部署与性能测试。

通过使用 llama.cpp 并开启 -b 8192 -ub 8192 --cpu-moe 参数,系统在 10 万 token 长上下文下依然保持了 700 pp/s 的提示词处理速度和 18 tg/s 的生成速度。作者指出,目前 llama.cpp 尚未原生支持该模型的 FP8 缓存,导致显存占用翻倍。

此外,作者还分享了一套极具性价比的平民级组装方案:建议购买二手服务器主板和 EPYC 7002/7003 处理器,搭配廉价 DDR4 ECC 内存组建大内存基座,再辅以中端消费级显卡(如双 RTX 5060 Ti),即可用约 1000 美元的硬件底座实现大参数量 MoE 模型的本地化运行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →