CPU/NVMe/GPU 混合跑 DeepSeek 460GB 权重:prefill 提速至 960 tok/s
HankYeomans · x · 2026-09-25
作者分享了一周的本地推理实验:将 DeepSeek v4.1 的 MXFP4 量化权重(约 460GB)跑在自建的 CPU/NVMe/GPU 混合系统上,把 prefill 速度从 216 tok/s 提升到 960 tok/s,decode 速度从 13 tok/s 提到 42 tok/s。
关键发现:当前迭代的瓶颈不在 GPU,而在 CPU/内存/NVMe 侧供给不足——约 20 张 GPU 中只有 1 张能达到 100% 利用率,其余仅 20-30%。作者下一步计划从 base checkpoint 入手,做端到端的模型创建、优化与消融实验,认为「唯一的学习方式就是动手做」。
所属事件:开发者自建混合架构跑 DeepSeek 460GB 权重,prefill 提速至 960 tok/s(3 条相关)→
「Infra」频道最新
- VeriTile:用 Lean 形式化验证 Triton GPU 内核,AI 智能体自动写正确性证明 — KaiyuYang4 · 2026-09-25
- Merge Gateway 推出 Batch API,批量推理约半价 — shensi · 2026-09-25
- 工程师发文详解生产环境 LLM 推理扩容实践 — abhijithneil · 2026-09-25
- Lambda 工程师详解本地推理装机:27B 模型需 24-32GB 显存 — TheZachMueller · 2026-09-25
- Pokee AI 现场演示 36B agent 模型跑在 32GB 内存的骁龙笔记本上 — Kyrannio · 2026-09-25
- AMD 讲师亮相 PyTorchCon:1K+ MI355X 上实现 MXFP8 预训练扩展 — PyTorch · 2026-09-25