创客用混合架构本地跑 DeepSeek,TTFT 从 75 秒压到约 9 秒

海外创客 Hank Yeomans 基于 Threadreader Pro 与 192GB 显存、Kingston Fury CL32 内存和三星 9100 Pro NVMe,自建一套被称为「弗兰肯斯坦 DeepSeek v4.1」的异构混合推理系统:226 个专家放在 GPU、165 个专家放在 CPU、engram(嵌入)存于 SSD,尝试在本地运行 1M 上下文。经过持续优化,首字延迟(TTFT)从 75 秒压缩到约 88.9 秒,展示了消费级硬件跑超大模型的长上下文混合部署思路。

2026-10-10 ~ 2026-10-10 · 3 条相关