vLLM 联合 DigitalOcean 详解 Kimi K3 零日推理部署方案
vllm_project · x · 2026-07-31
DigitalOcean 联合 vLLM 项目团队,成功在发布首日(Day 0)将总参数量达 2.8T 的 Kimi K3 模型推向生产环境。
部署架构与硬件
- 选用 NVIDIA HGX B300 和 AMD Instinct MI350X GPU,单节点 8 卡总显存为 288GB。
- K3 权重约 1.56 TB,加载后单卡需占用约 195 GiB 显存,剩余空间用于 KV cache 和激活值。
- 采用 llm-d 构建分布式推理栈,原生支持异构 GPU,实现跨平台快速部署。
模型结构挑战
K3 包含 896 个路由专家,注意力层交替使用 69 层 KDA(Kimi Delta Attention)与 24 层 MLA(多头潜在注意力)。
所属事件:vLLM 首日支持 Kimi K3:8张B300跑满2.8T模型(14 条相关)→
「Infra」频道最新
- Atomic-Chat:支持完全离线运行的开源本地 AI 助手 — rohanpaul_ai · 2026-08-01
- Kimi K3 1-bit 量化实测:2.8T 模型压缩至 590GB 本地跑通 — rohanpaul_ai · 2026-08-01
- 96GB Mac Ultra 搭建团队本地 LLM 服务实战指南 — BrandBikeRepeat · 2026-08-01
- 论文分享:Chunked Prefill 技术如何提升 LLM 推理服务效率 — Abhishekcur · 2026-08-01
- Agentic AI 的算力瓶颈:推理与执行的双重挑战 — charles_irl · 2026-08-01
- AI股市回调预警:内存芯片股杠杆过高,投资者债务创纪录 — binarybits · 2026-08-01