vLLM 联合 DigitalOcean 详解 Kimi K3 零日推理部署方案
vllm_project · x · 2026-07-31
DigitalOcean 联合 vLLM 项目团队,成功在发布首日(Day 0)将总参数量达 2.8T 的 Kimi K3 模型推向生产环境。
部署架构与硬件
- 选用 NVIDIA HGX B300 和 AMD Instinct MI350X GPU,单节点 8 卡总显存为 288GB。
- K3 权重约 1.56 TB,加载后单卡需占用约 195 GiB 显存,剩余空间用于 KV cache 和激活值。
- 采用 llm-d 构建分布式推理栈,原生支持异构 GPU,实现跨平台快速部署。
模型结构挑战
K3 包含 896 个路由专家,注意力层交替使用 69 层 KDA(Kimi Delta Attention)与 24 层 MLA(多头潜在注意力)。
所属事件:Kimi K3开源首日获vLLM及AMD等多平台支持(14 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23