创客用混合架构本地跑 DeepSeek,TTFT 从 75 秒压到约 9 秒
海外创客 Hank Yeomans 基于 Threadreader Pro 与 192GB 显存、Kingston Fury CL32 内存和三星 9100 Pro NVMe,自建一套被称为「弗兰肯斯坦 DeepSeek v4.1」的异构混合推理系统:226 个专家放在 GPU、165 个专家放在 CPU、engram(嵌入)存于 SSD,尝试在本地运行 1M 上下文。经过持续优化,首字延迟(TTFT)从 75 秒压缩到约 88.9 秒,展示了消费级硬件跑超大模型的长上下文混合部署思路。
2026-10-10 ~ 2026-10-10 · 3 条相关
- 网友自组混合部署 DeepSeek:GPU+CPU 专家+SSD,TTFT 从75秒降到8.9秒 — HankYeomans · 2026-10-10
- DIY 混合架构跑 DeepSeek:TTFT 从 75 秒优化到 8.9 秒 — HankYeomans · 2026-10-10
- 192GB 显存跑 1M 上下文:混合推理把 TTFT 从 75 秒压到 8 秒 — HankYeomans · 2026-10-10