16×H100 集群 Dynamo 部署指南:P/D 分离与 KV offload 实测
TheZachMueller · x · 2026-09-20
Junup Park 与 Jaga Prasanna 发布了一份在 2 节点 16×H100 集群上的 NVIDIA Dynamo 部署指南(Lambda 提供集群)。内容包括:
- 从裸 Ubuntu 起步的 K8s/Dynamo 搭建 runbook,覆盖网络配置(RoCE、NVLS)调试;
- 多模型部署与运维文档(模型缓存、NIXL/Grafana 监控、NVLS 恢复等);
- 对 vLLM 与 SGLang 的 benchmark,实测 P/D 分离(prefill/decode disaggregation)、KV-aware 路由、CPU KV offload、并行度与自动伸缩各自带来多少收益。
仓库已开源,适合做生产级 LLM 推理部署参考。
「Infra」频道最新
- 本地 Qwen3 27B 首跑即修复商业应用 bug,速度约为 Claude Opus 两倍 — julianharris · 2026-09-20
- Reddit 热议:多智能体系统至今没有生产级通信底座 — One_Two_2229 · 2026-09-20
- 预测:2031 年开源本地模型将主导隐私与成本敏感场景推理 — QuixiAI · 2026-09-20
- Celesto 开源 AI Agent 专用持久云电脑,microVM 毫秒级启动 — aniketmaurya · 2026-09-20
- K8s 学习系列更新:日志监控与 Helm 讲解视频分享 — _jaydeepkarale · 2026-09-20
- 开发者分享系列视频:搞懂 Kubernetes 为什么存在 — _jaydeepkarale · 2026-09-20