192GB 显存跑 1M 上下文:混合推理把 TTFT 从 75 秒压到 8 秒
HankYeomans · x · 2026-10-10
Hank Yeomans 用 Threadripper Pro + 192GB VRAM、Kingston Fury CL32 内存和三星 9100 Pro NVMe,搭建了一套「弗兰肯斯坦」式 DeepSeek 混合推理系统:226 个专家放 GPU、165 个专家放 CPU、engrams(缓存)放 SSD。经过持续优化,16K prefill 的 TTFT 从 75 秒降到 8.9 秒,目前 32K prefill 下 TTFT 为 7.2 秒、解码 58 tok/s,prefill 吞吐从 215 tokens/s 提升到 1910 tokens/s,并成功跑通 262K×4 与 1M token 上下文窗口。作者称这个项目本身就是极好的学习过程。
所属事件:创客用混合架构本地跑 DeepSeek,TTFT 从 75 秒压到约 9 秒(3 条相关)→
「Infra」频道最新
- Starship 发射成本有望降至 18.5 万美元,入轨价格缩水百倍 — claud_fuen · 2026-10-10
- DuckDB v2.0 CLI 推出 Agent 模式,token 消耗直降 59% — josh_wills · 2026-10-10
- MosaicML Streaming 作者背书,Datology 发布确定性数据加载器 Zephon — josh_wills · 2026-10-10
- 清华 TokenRouter 论文:token 级大小模型路由,吞吐最高提升 64 倍 — rohanpaul_ai · 2026-10-10
- 开发者给 Meta Muse 配免费模型池自动路由,长任务零成本跑 — sven_ai · 2026-10-10
- 黄仁勋女婿任英伟达VP,苹果iPhone 18 Pro订单削减15%起 — 创业邦 · 2026-10-10