DGX Spark 实战手册:128GB 内存低带宽小盒子如何跑满本地推理
mervenoyann · x · 2026-09-30
Hugging Face 上的社区文章《The DGX Spark Handbook》是一份 NVIDIA DGX Spark 的本地推理实战指南。
作者起初并不看好它:虽有 128GB 统一内存,但 273GB/s 的带宽只有 RTX 5090(1792GB/s)的约 1/6.5。随着智能被压缩进越来越小的模型,加上投机解码普及,这台小机器的实用性大幅提升——如今它已能以与云服务相当的单用户体验速度运行高智能模型。
核心论点:
- 云端硬件虽快,但被多用户共享、按每 token 成本调优,单人分到的吞吐有限;DGX Spark 全部算力归你一人。
- 功耗极低,加载模型服务时约 95W,散热安静,2-4 台可堆叠在普通家用电路而不跳闸,适合多机链接扩展。
- 推理工程需求增长,LLM 本身也日益擅长推理优化,智能被高效用于系统改进。
「Infra」频道最新
- GMI Cloud 融资 6.68 亿美元,NVIDIA 参投加码 GPU 云 — testingcatalog · 2026-09-30
- IBM 用 CRCR 把 Torch Spyre 接入 PyTorch 上游 CI 全流程 — PyTorch · 2026-09-30
- Vultr 以 12 亿美元向 HPE 下单,拿下首笔 AMD Helios 订单 — wkmyrhang · 2026-09-30
- Cloudflare AI Gateway 推出 User Insights,可识别团队模型过度使用 — michellechen · 2026-09-30
- Cloudflare 创新周连发:容器启动快 6 倍、AI 网关自动选最省模型 — ritakozlov · 2026-09-30
- 陈天奇团队推出开源教材:用编译器驱动 Agent 自动优化 GPU 算子 — sh_reya · 2026-09-30