vLLM 官宣支持 Kimi K3 部署,需至少 8 张 GB300
vllm_project · x · 2026-08-07
vLLM 宣布已通过 Moonshot 官方验证,可提供高性能的 Kimi K3 模型推理服务。
模型与部署细节:
- 架构:Kimi K3 为 2.8 万亿参数的原生多模态 MoE 模型,每 token 激活 16 个专家(共 896 个)。采用了 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 技术,支持 100 万 token 上下文及原生视觉。
- 硬件要求:生产环境至少需要 8 张 GB300(多节点)或 8 张 MI355X/MI350X(ROCm)。
- 环境配置:提供专用 Docker 镜像,要求 CUDA 13 (cu130) 环境与 r580+ 英伟达驱动。
- 推理优化:支持 TP8、TEP16 等并行策略,跨节点通信推荐使用 deepepv2 后端。
「Infra」频道最新
- 本地跑 AI 模型致显卡高温,用户求助散热方案 — Inner_West_4997 · 2026-08-07
- 麦当劳薯条供应商如何意外成为美国 DRAM 芯片的救星 — DynamicWebPaige · 2026-08-07
- NVIDIA 开源全套本地语音栈:ASR、TTS 与编解码器皆可量化部署 — ImaginaryRea1ity · 2026-08-07
- 避开电网瓶颈:超大规模数据中心转向「表后」自发电 — BenBajarin · 2026-08-07
- 大厂2026年AI资本开支料超7300亿,万亿规模近在咫尺 — Beth_Kindig · 2026-08-07
- 分析称 AI 算力光模块部署呈定制化,因客户需求而异 — BenBajarin · 2026-08-07