CPU/NVMe/GPU 混合跑 DeepSeek 460GB 权重:prefill 提速至 960 tok/s

HankYeomans · x · 2026-09-25

作者分享了一周的本地推理实验:将 DeepSeek v4.1 的 MXFP4 量化权重(约 460GB)跑在自建的 CPU/NVMe/GPU 混合系统上,把 prefill 速度从 216 tok/s 提升到 960 tok/s,decode 速度从 13 tok/s 提到 42 tok/s。

关键发现:当前迭代的瓶颈不在 GPU,而在 CPU/内存/NVMe 侧供给不足——约 20 张 GPU 中只有 1 张能达到 100% 利用率,其余仅 20-30%。作者下一步计划从 base checkpoint 入手,做端到端的模型创建、优化与消融实验,认为「唯一的学习方式就是动手做」。

所属事件:开发者自建混合架构跑 DeepSeek 460GB 权重,prefill 提速至 960 tok/s(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →