从一张 3090 到 20 台 DGX Spark:家庭本地推理集群的完整进化史
ciprianveg · reddit · 2026-10-04
一位 Reddit 用户详细记录了自己从单卡 3090 跑 LLaMA 33B,一路升级到与兄弟合建 16 台 NVIDIA DGX Spark 集群跑 Kimi K3(2.8T)的全过程,全程只用本地模型、从未付费订阅商用 API:
- 起步:3090 ×2 跑 LLaMA 65B 与小型编码任务;DeepSeek 671B 出现后升级 Threadripper + 512GB DDR4,以专家卸载到内存的方式跑到 8 t/s,并用 Qwen 235B 在工作中真实写码。
- 16×3090 阶段:100Gbit 网络上搭 P620 节点跑 MiniMax M2、Qwen 397B,用它完成了一个付费项目;但家用电路成为瓶颈——机柜和电烤箱同时开就跳闸,功耗 6kW。
- 转向 DGX Spark:4 台 GB10 串联后 Qwen 397B 以 400W 跑出 30 t/s(对比 6kW 下的 50-60 t/s),稳定近无声;自己摸索出 8 节点集群方案并首发于 NVIDIA 论坛,让 397B 升到 FP8 且快 20%。
- 兄弟合体:说服哥哥也买了 8 台,两家相距步行 5 分钟;Kimi K3(2.8T)发布后合并两个集群,迭代 vLLM/SGLang 配置,把它从 100k 上下文 7 t/s 调到 300k 上下文 20 t/s 的可用水平。
- 下一步:再加 4 台 Spark,常驻小模型 GLM 5.3 Flash 全天候运行,大集群按需跑 GLM 5.3 + MiMo 2.6 Pro 双 8 节点、16 节点 Kimi K3 或 Qwen 3.8 2.4T;还打算给弟弟也配 4 台。
「Infra」频道最新
- TPU 每百万 token 成本对比 Blackwell,Google 占优 — cgarciae88 · 2026-10-04
- 跑一次校准解码快 3 倍:16GB 显卡跑 256K 上下文的调优实录 — MoonsvnLyn · 2026-10-04
- 4xB200 实测并发扫描:用 TTFT/ITL/tok/s 看本地模型负载表现 — TheZachMueller · 2026-10-04
- NVIDIA 开源 AIPerf:面向 AI 模型的性能测试工具发布 — TheZachMueller · 2026-10-04
- 一句提示清掉 39.7GB:用 ccmd MCP 让 Claude Code 安全清缓存 — julsimon · 2026-10-04
- 开源工具 llm-inference-bench 力推本地 LLM 推理测速统一标准 — TheZachMueller · 2026-10-04