vLLM 为 Moonshot 2.8 万亿参数 Kimi K3 上线 day-0 推理支持
vllm_project · x · 2026-07-28
vLLM 发布 Kimi K3 的 day-0 推理部署指南
vLLM 说自己已经对 Moonshot 的 Kimi K3 做到 day-0 支持,因为该模型权重已公开。帖子本身是一篇面向生产部署的实操指南,而不是单纯的模型宣传。
文中给出的关键信息包括:
- Kimi K3 是一个 2.8 万亿参数的 MoE 模型,每个 token 激活 896 个专家中的 16 个。
- 模型采用 Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes)。
- 支持 100 万 token 上下文,并且具备 原生视觉能力。
- 这篇指南重点讨论如何把 KDA、MXFP4 MoE 执行、KV cache 管理、prefill/decode 解耦、speculative decoding 和长上下文部署 组合到一个可实际运行的 serving engine 里。
配图里还展示了缓存结构、解码吞吐和不同残差方案的内存/性能权衡。
所属事件:vLLM 为 2.8 万亿参数 Kimi K3 提供 day-0 支持(2 条相关)→
「Infra」频道最新
- 高通称 NPU 延迟优势让端侧 AI Agent 更实用 — qdrant_engine · 2026-07-28
- MLA 机制每百万 token 需 12GB KV,KDA 状态约 230MB — zephyr_z9 · 2026-07-28
- 70B 模型在 AMD R9700 上加载卡住,显存已到 30GB — Developer-Y · 2026-07-28
- Reddit 讨论本地跑 K3 的最低成本方案 — ylchao · 2026-07-28
- K3 上线一天就被拿去刷免费额度 — Mediocre-Witness-778 · 2026-07-28
- TRELLIS.2 INT8 ConvRot 已能在 AMD ROCm 上原生跑 ComfyUI — DrBearJ3w · 2026-07-28