网友自组混合部署 DeepSeek:GPU+CPU 专家+SSD,TTFT 从75秒降到8.9秒
HankYeomans · x · 2026-10-10
作者搭建了一套自称 "Frankenstein Deepseek v4.1" 的异构本地部署:226 个专家放 GPU、165 个专家放 CPU、engrams(嵌入)放 SSD。经过持续优化:TTFT 从 75 秒降到 8.9 秒;prefill 从 215 tokens/s 提升到 1910 tokens/s;上下文窗口从 32k 成功测到 2624 和 1M。作者表示这个项目是极佳的学习经历。
所属事件:DIY 混合架构跑 DeepSeek 首字延迟降至 8.9 秒(2 条相关)→
「Infra」频道最新
- 开发者给 Meta Muse 配免费模型池自动路由,长任务零成本跑 — sven_ai · 2026-10-10
- vLLM 线程(4/5):用 locality domain 优化 MoE,decode 提速 1.2 倍 — vllm_project · 2026-10-10
- vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍 — vllm_project · 2026-10-10
- AMD 联手 ai& 办东京黑客松:4.5 小时用 Kimi、GLM、Qwen、MiniMax 搭建 — DavidBennett__ · 2026-10-10
- 芝加哥市中心将建 AI 数据中心,空置写字楼迎来新用途 — willcb · 2026-10-10
- 开源 sparkDash 2.0:私有化 GPU token 工厂的产能看板 — aigclink · 2026-10-10