自搭 CPU/NVMe/GPU 混合推理,把 460GB DeepSeek 预填速度提升 4.4 倍
HankYeomans · x · 2026-09-25
作者分享本周用 DeepSeek MXFP4 量化版(约 460GB)自建 CPU/NVMe/GPU 混合推理系统的实验结果:
- 性能提升:prefill 从 216 tok/s 提升到 960 tok/s;首 token 后生成速度从 13 tok/s 提到 42 tok/s。
- 瓶颈观察:当前迭代中瓶颈在 CPU/内存/NVMe 侧,喂不满 GPU——21 张卡里只有 1 张达到 100% 利用率,其余仅 20-30%。
- 方法论:作者强调通过亲手搭建观察系统如何失败、在哪里失败,比读别人的总结更有收获;下一步计划从 base checkpoint 入手做端到端的模型创建、优化与消融实验。
对想在大内存/多卡环境跑超大模型本地的开发者有直接参考价值。
所属事件:开发者自建混合架构跑 DeepSeek 460GB 权重,prefill 提速至 960 tok/s(3 条相关)→
「Infra」频道最新
- Google 启动 Project Suncatcher:TPU 集群上太空组 ML 基础设施 — rseroter · 2026-09-25
- Nebius/WEKA 实测:分布式 KV cache 让单节点 agent 推理吞吐提升 2.4 倍 — AccBalanced · 2026-09-25
- Burkov AI 周报 #179:GPU 租买账、llm-d 低成本部署 753B 开源模型 — burkov · 2026-09-25
- 音乐模型 YuE2 完整版被压到 1.7GB 内存跑上 iPhone — Acceptable-Cycle4645 · 2026-09-25
- 微软 Fabric Efficient Scaledown 让 Shuffle 重型任务成本降 43% — adnan_hashmi · 2026-09-25
- 曝谷歌下周用猎鹰9号送TPU上天,测试轨道AI数据中心 — McDonaghMatthew · 2026-09-25