两台 DGX Spark 跑 320B MoE 模型,262K 上下文前要先修 11 个坑

TechPreacher · x · 2026-09-29

作者详细复盘在两台 NVIDIA DGX Spark(各配 GB10、128GB 统一内存,2×200GbE 互联)上以 NVFP4 量化、262K 上下文部署 GLM-5.3-Flash(320B 总参/18B 激活 MoE)的完整过程。

关键要点

共修了 11 个问题才跑通,是一篇端侧/双节点部署超大 MoE 的实战教程。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →