DeepSeek v4.1 MXFP4 混合 CPU/NVMe/GPU 推理:prefill 提速至 960 tok/s

HankYeomans · x · 2026-09-25

开发者将 460GB 的 DeepSeek v4.1 MXFP4 量化模型跑在 CPU/NVMe/GPU 混合架构上,经过持续调优,prefill 速度从 216 tok/s 提升到 960 tok/s,解码速度从 13 tok/s 提升到 42 tok/s。作者自谦虽已有更强的公开方案,但这是其亲手实践的完整项目。下一步计划从 base checkpoint 出发做端到端的模型创建、优化与消融实验。

所属事件:开发者自建混合架构跑 DeepSeek 460GB 权重,prefill 提速至 960 tok/s(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →