456GB 大模型塞进 192GB 显存:混合 offload 推理实测跑通
HankYeomans · x · 2026-10-12
作者在 192GB 显存 + 256GB 内存 + NVMe 的配置上离线运行一个 456GB 参数的大模型,性能已「相当可用」:
- C1 解码 60.1 tok/s,C4 聚合解码 124.8 tok/s
- 16K prefill 4,361 tok/s(TTFT 3.7s),32K prefill 4,513 tok/s(TTFT 7.1s)
- 支持 1M 上下文或 4×262K 上下文,作者认为足以在其上再派生前沿级 agent
作者称接下来会在真实任务上进一步验证。
「Infra」频道最新
- 工程师晒入职满月动态:加入英伟达做 Groq LPU 编译器 — blelbach · 2026-10-12
- Linus Ekenstam 立目标:要在手机上跑千亿参数模型 — LinusEkenstam · 2026-10-12
- Brookings:AI 建设融资十年将耗 10.3 万亿美元,占 GDP 3.63% — KyeGomezB · 2026-10-12
- Fireworks 实战:开源模型加微调可追平闭源,Cursor 推理快 13 倍 — AI Engineer · 2026-10-12
- VitalOps 上线:智能体自动优化推理栈,实测提速 2.6 倍 — abhijithneil · 2026-10-12
- AMD 7900 XTX 本地跑 Qwen3.8 Flash-Next:500k 上下文 105-160 tok/s — human_in_the_looop · 2026-10-12