AWS 官方详解 Kimi K3 部署:需 8 张 B300 GPU
AWS ML Blog · rss · 2026-07-31
AWS 官方博客发布了在云端部署 Kimi K3 模型的详细指南。Kimi K3 拥有 2.8 万亿参数,采用 MoE 架构,单次推理激活约 1040 亿参数,并支持 100 万 tokens 上下文。
文章提供了两种部署方案:
- Amazon SageMaker HyperPod:通过 Inference Operator 简化容器编排和模型加载,需使用 Flexible Training Plans 预留算力。
- Amazon EKS:适合自行管理 Kubernetes 集群的团队,通过 EC2 Capacity Blocks 预留实例。
硬件与推理要求:部署该模型必须使用 ml.p6-b300.48xlarge 实例(配备 8 张 NVIDIA B300 GPU)。推理引擎推荐使用 vLLM 的专用容器,模型权重以 MXFP4 格式分发以平衡质量和内存效率。
「Infra」频道最新
- 三星财报:Agentic AI 带动企业级 SSD 需求激增 — davidyin44 · 2026-07-31
- vLLM 发布 Inkling-Small 部署指南:最低180GB显存可跑 — vllm_project · 2026-07-31
- 马来西亚居民抗议成功,逼停当地数据中心建设 — im_mansigupta · 2026-07-31
- Meta AI基础设施租赁义务三个月激增53%,总额近2790亿美元 — Polymarket · 2026-07-31
- SGLang登陆Google TPU:实现多款主流大模型无缝迁移 — BanghuaZ · 2026-07-31
- RTX 5090本地跑GLM-5.2与Kimi K3:速度可达129 tok/s — markjeffrey · 2026-07-31