DeepSeek V4 Flash本地跑通:万元组装机实现700pp/s推理
reto-wyss · reddit · 2026-08-03
一位开发者在搭载 RTX 5090 和 512GB DDR4 内存的工作站上,成功完成了 DeepSeek-V4-Flash-0731 的本地部署与性能测试。
通过使用 llama.cpp 并开启 -b 8192 -ub 8192 --cpu-moe 参数,系统在 10 万 token 长上下文下依然保持了 700 pp/s 的提示词处理速度和 18 tg/s 的生成速度。作者指出,目前 llama.cpp 尚未原生支持该模型的 FP8 缓存,导致显存占用翻倍。
此外,作者还分享了一套极具性价比的平民级组装方案:建议购买二手服务器主板和 EPYC 7002/7003 处理器,搭配廉价 DDR4 ECC 内存组建大内存基座,再辅以中端消费级显卡(如双 RTX 5060 Ti),即可用约 1000 美元的硬件底座实现大参数量 MoE 模型的本地化运行。
「Infra」频道最新
- 巨头 Q2 财报揭示 AI 算力账本:需求强劲,云利润持续扩张 — RihardJarc · 2026-08-04
- AI 军备竞赛反噬:科技巨头自由现金流将跌至负 1000 亿 — peterwildeford · 2026-08-04
- 单节点 B300 跑 2.8T 模型,K3 解码吞吐量达 947 tokens/s — casper_hansen_ · 2026-08-03
- Teknium:DeepSeek V4 Flash本地推理可达70 tokens/s — Teknium · 2026-08-03
- AI圈热议:开源模型已足够好,真正的壁垒是OpenAI的吉瓦级算力 — yacineMTB · 2026-08-03
- Fluidstack 大规模招聘数据中心工程人才,发力 GW 级 AI 算力设施 — MxMnr · 2026-08-03