两台 DGX Spark 跑 320B MoE 模型,262K 上下文前要先修 11 个坑
TechPreacher · x · 2026-09-29
作者详细复盘在两台 NVIDIA DGX Spark(各配 GB10、128GB 统一内存,2×200GbE 互联)上以 NVFP4 量化、262K 上下文部署 GLM-5.3-Flash(320B 总参/18B 激活 MoE)的完整过程。
关键要点
- 显存账:181GiB 权重 TP=2 后每节点常驻 88.63GiB,预算 103.4GiB,只剩约 12.9GiB 给 KV cache 与激活;GB10 统一内存意味着每次 GPU 分配都占主机内存。
- 原版 vLLM 完全跑不了:该模型用 NoPE MLA(qkropeheaddim=0),而原生 sparse-attention kernel 假设 DeepSeek 的 pedim=64。
- 必须用带 SM121 day-0 修复的社区镜像:SM90 NoPE sparse-MLA 经 FA2 扩展到 SM121、FlashInfer 钉在 0.6.18(0.6.17 在 batch 64–256 行产生 NaN)、NCCL 2.30.7、FA2 fp8-KV tile 上限。
- 实践建议:镜像按 digest 钉死而非 tag,并用脚本 gate 校验上层 Ray 层未破坏任何基础 pin。
共修了 11 个问题才跑通,是一篇端侧/双节点部署超大 MoE 的实战教程。
「Infra」频道最新
- 三大 AI 厂商拒绝披露能耗,研究机构反推模型耗电排行榜 — relianceschool · 2026-09-29
- Agent 90 分钟跑 322 个 Hugging Face Jobs,总账单仅约 4 美元 — victormustar · 2026-09-29
- 超8万个代理服务器隐藏流向,被盗AI订阅凭据催生黑产经济 — ChuckDBrooks · 2026-09-29
- antirez:本地推理别只看生成速度,缩短思考阶段与加速 prefill 才是关键 — antirez · 2026-09-29
- 投资人呼吁建「算力长城」,输出智能而非美元 — McDonaghMatthew · 2026-09-29
- 用 Claude Code 指挥本地模型干活,省云端额度的混合工作流可行吗? — Ambitious_Fold_2874 · 2026-09-29