六千美元纯CPU方案本地全量跑前沿万亿模型
8 月 27 日,开发者 carrigmat 通过一组连续发帖,系统性地反驳了「万亿参数级开源模型必须靠十万美元级 GPU 才能运行」的普遍看法,并给出了一套完整、已实测的纯 CPU 本地部署方案:以双 AMD EPYC、768GB DDR5 内存、无 GPU 的服务器为基础,用 Q8 量化(接近最高质量)在本地运行原版(非蒸馏)DeepSeek-R1,整套软硬件成本约 6000 美元,帖子附全部配件清单与下载链接。
已确认
- 实测数据:4 盘 NVMe 阵列 + 768GB RAM,基于 llama-server 推理速度约 2 tok/s;此前同机跑 DeepSeek-R1 Q8 速度约 1.x tok/s(帖子截断,具体数值以原帖为准)
- 核心原理:权重并非全部驻留内存。现代 LLM 多数参数是稀疏激活的专家,仅间歇性访问,这部分留在 NVMe 上;持续访问的热权重驻内存,从而用有限 RAM 跑超大规模模型
- 带宽论证:单块 Gen5 NVMe 约 13GB/s,16 块 RAID 0 可达约 208GB/s,等效四通道 DDR5 水平
- 成本论证:不需要大容量盘,缓存小、写入寿命短的便宜 1TB Gen5 盘即可(场景以读取为主),16 块约 3500 美元
- 工程可行性:每条 PCIe 槽可通过转接拆出 4 个 NVMe 口,解决主板接口不足问题
优化路径与展望
- 作者承认官方 llama.cpp 目前没有充分利用 NVMe 阵列、速度偏慢,需要性能调优,并认为 Kimi 恰好擅长此类工作,可直接让 AI 代码 agent 改造 llama.cpp
- 具体优化:参考 llama.cpp PR #25294,实现投机性预取——把当前层激活传入下一层 router,提前预测并预加载专家权重,实现计算与加载重叠;改完重编译即可运行,作者正尝试将优化合入上游
- 作者称配满 16 盘阵列后,这套系统到 2027 年也能应对 10T(10 万亿)参数级模型
为什么重要
该方案把前沿开源模型的本地全量运行成本从十万美元级压缩到数千美元级,且所有环节(硬件选型、带宽、寿命、接口、软件)均给出可复现的论证与实测数据,对本地推理和隐私敏感场景具有直接参考价值。
2026-08-27 ~ 2026-08-27 · 14 条相关
一手来源
- 不用十万美元 GPU,768GB 内存双 EPYC 本地跑满血 Kimi — carrigmat ·
- 实战实测:4 盘阵列跑 LLM 达 2tok/s — carrigmat ·
- 16 块 NVMe 组 RAID 跑大模型,带宽匹敌 DDR5 — carrigmat ·
- 实测本地全量运行 Kimi K3 (2.8T) 的方案 — carrigmat · 2026-08-27
- 【源头】不用十万美元 GPU,768GB 内存双 EPYC 本地跑满血 Kimi — carrigmat · 2026-08-27
- 万亿模型塞进个人电脑:热权重驻内存,专家放 NVMe — carrigmat · 2026-08-27
- 【源头】16 块 NVMe 组 RAID 跑大模型,带宽匹敌 DDR5 — carrigmat · 2026-08-27
- 16 块 Gen5 NVMe 组 RAID 0,带宽 208GB/s 等效四通道 DDR5 — carrigmat · 2026-08-27
- 主板没有16个NVMe口?每个PCIe槽可拆出4个 — carrigmat · 2026-08-27
- 16块1TB Gen5硬盘约3500美元即可本地跑前沿模型 — carrigmat · 2026-08-27
- 【源头】实战实测:4 盘阵列跑 LLM 达 2tok/s — carrigmat · 2026-08-27
- llama.cpp未吃满NVMe阵列?作者直接让Kimi改代码调优 — carrigmat · 2026-08-27
- 让 AI 代码 agent 自主优化 llama.cpp — carrigmat · 2026-08-27
- 实测优化技巧: speculate prefetch 加速 MoE — carrigmat · 2026-08-27
- 投机预取MoE专家:参考llama.cpp PR #25294 — carrigmat · 2026-08-27
- 改完代码重编译,本地即可跑前沿模型并备战10T时代 — carrigmat · 2026-08-27
- 六千美元自建主机:完整跑本地原版DeepSeek-R1 — carrigmat · 2026-08-27