开发者自建混合架构跑 DeepSeek 460GB 权重,prefill 提速至 960 tok/s
一名开发者分享将 DeepSeek v4.1 的 MXFP4 量化模型(约 460GB)部署在自建 CPU/NVMe/GPU 混合架构上的本地推理实验。经过一周持续调优,prefill 速度从 216 tok/s 提升至 960 tok/s,提升约 4.4 倍,展示了在消费级混合硬件上运行超大规模模型的可行性。
2026-09-25 ~ 2026-09-25 · 3 条相关
- DeepSeek v4.1 MXFP4 混合 CPU/NVMe/GPU 推理:prefill 提速至 960 tok/s — HankYeomans · 2026-09-25
- CPU/NVMe/GPU 混合跑 DeepSeek 460GB 权重:prefill 提速至 960 tok/s — HankYeomans · 2026-09-25
- 自搭 CPU/NVMe/GPU 混合推理,把 460GB DeepSeek 预填速度提升 4.4 倍 — HankYeomans · 2026-09-25