自搭 CPU/NVMe/GPU 混合推理,把 460GB DeepSeek 预填速度提升 4.4 倍

HankYeomans · x · 2026-09-25

作者分享本周用 DeepSeek MXFP4 量化版(约 460GB)自建 CPU/NVMe/GPU 混合推理系统的实验结果:

对想在大内存/多卡环境跑超大模型本地的开发者有直接参考价值。

所属事件:开发者自建混合架构跑 DeepSeek 460GB 权重,prefill 提速至 960 tok/s(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →