vLLM 实现 Kimi K3 Day 0 支持,8 张 B300 即可跑起 2.8T MoE
vllm_project · x · 2026-07-30
vLLM 团队发文宣布,在 Moonshot AI 开源 Kimi K3 权重的首日,vLLM 即提供了高效的生产级推理支持。
架构与部署挑战
- 模型规模:Kimi K3 是 2.8 万亿参数的 MoE 模型(每个 token 激活 16 个专家),具备 100 万 token 上下文窗口和原生视觉能力。
- 核心架构:基于 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 构建。
- 工程难点:团队重点解决了 KDA、MXFP4 MoE、KV 缓存管理、prefill/decode 分离、推测解码以及长上下文部署的协同运行难题。
部署命令
最简部署仅需 8 张 NVIDIA B300 或 AMD MI355X GPU,通过添加特定参数即可启用 Inferact 开源的 DSpark 推测器以进一步提升推理速度。
所属事件:vLLM 与 AMD 实现 Kimi K3 首日推理支持(7 条相关)→
「Infra」频道最新
- 微软云业务年化收入破千亿美元,Azure撑起整体营收 — tomwarren · 2026-07-30
- 向量数据库 turbopuffer 支持 late interaction 模型 — lateinteraction · 2026-07-30
- 高通Q3营收超预期但下季EPS指引疲软,手机业务承压 — firstadopter · 2026-07-30
- Sam Altman 表态:理解民众不愿社区建 AI 数据中心的担忧 — businessinsider · 2026-07-30
- 扎克伯格:外部算力报价远高于我们的采购价 — firstadopter · 2026-07-30
- 4090加3060双卡推理会降速吗?社区经验分享 — cosmoschtroumpf · 2026-07-30