开发者自建混合架构跑 DeepSeek 460GB 权重,prefill 提速至 960 tok/s

一名开发者分享将 DeepSeek v4.1 的 MXFP4 量化模型(约 460GB)部署在自建 CPU/NVMe/GPU 混合架构上的本地推理实验。经过一周持续调优,prefill 速度从 216 tok/s 提升至 960 tok/s,提升约 4.4 倍,展示了在消费级混合硬件上运行超大规模模型的可行性。

2026-09-25 ~ 2026-09-25 · 3 条相关