DIY 混合架构跑 DeepSeek:TTFT 从 75 秒优化到 8.9 秒
HankYeomans · x · 2026-10-10
作者自建「弗兰肯斯坦」式分层推理系统运行 DeepSeek(作者称 v4.1):226 个专家放 GPU、165 个专家放 CPU、engram 存 SSD。经持续优化,16K prefill 的 TTFT 从 75 秒降到 8.9 秒,prefill 吞吐从 215 tokens/s 提升到 1910 tokens/s;上下文窗口也从 32K 扩展到成功测试 262K×4 直至 1M。作者称这是很好的学习项目。
所属事件:DIY 混合架构跑 DeepSeek 首字延迟降至 8.9 秒(2 条相关)→
「Infra」频道最新
- 192GB 显存跑 1M 上下文:混合推理把 TTFT 从 75 秒压到 8 秒 — HankYeomans · 2026-10-10
- 清华 TokenRouter 论文:token 级大小模型路由,吞吐最高提升 64 倍 — rohanpaul_ai · 2026-10-10
- 开发者给 Meta Muse 配免费模型池自动路由,长任务零成本跑 — sven_ai · 2026-10-10
- 网友自组混合部署 DeepSeek:GPU+CPU 专家+SSD,TTFT 从75秒降到8.9秒 — HankYeomans · 2026-10-10
- vLLM 线程(4/5):用 locality domain 优化 MoE,decode 提速 1.2 倍 — vllm_project · 2026-10-10
- vLLM 适配 NVIDIA Vera Rubin,MiniMax M3 吞吐达 GB200 的 7.8 倍 — vllm_project · 2026-10-10