DeepSeek v4.1 MXFP4 混合 CPU/NVMe/GPU 推理:prefill 提速至 960 tok/s
HankYeomans · x · 2026-09-25
开发者将 460GB 的 DeepSeek v4.1 MXFP4 量化模型跑在 CPU/NVMe/GPU 混合架构上,经过持续调优,prefill 速度从 216 tok/s 提升到 960 tok/s,解码速度从 13 tok/s 提升到 42 tok/s。作者自谦虽已有更强的公开方案,但这是其亲手实践的完整项目。下一步计划从 base checkpoint 出发做端到端的模型创建、优化与消融实验。
所属事件:开发者自建混合架构跑 DeepSeek 460GB 权重,prefill 提速至 960 tok/s(3 条相关)→
「Infra」频道最新
- Perplexity 推出 Fast Search 检索 API,95% 结果 230 毫秒内返回 — perplexity_ai · 2026-09-25
- Bittensor 团队用普通互联网连 5 数据中心训出 100B 模型 — markjeffrey · 2026-09-25
- 分析师:AMD 若夺下 10 点 GPU 份额将是转折性事件 — Beth_Kindig · 2026-09-25
- Google 预计 2030 年代中期轨道 AI 数据中心成本与地面持平 — McDonaghMatthew · 2026-09-25
- 高盛大幅上调 AI 算力预测:2030 全球数据中心容量升至 217GW — McDonaghMatthew · 2026-09-25
- 4400 美元在 RTX 5090 上预训练出媲美 Qwen2-1.5B 的开源 2B 模型 — IgorCarron · 2026-09-25