vLLM Day-0 支持 Kimi K3:2.8T 参数 MoE 模型部署实战
vllm_project · x · 2026-07-30
vLLM 团队宣布为 Moonshot AI 开源的 Kimi K3 模型提供高效的 Day-0 支持。Kimi K3 是拥有 2.8 万亿参数的混合专家(MoE)模型,单 Token 激活 16 个专家,支持 100 万 Token 上下文及原生视觉能力。
文章深入解析了 vLLM 适配该模型的底层工程挑战与解决方案:
- 架构适配:针对 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 以及 MXFP4 MoE 等新架构特性进行了专门的算子与缓存优化。
- 推理加速:Inferact 训练并开源了 DSpark 投机采样器,结合预填充/解码分离和长上下文部署方案,大幅提升推理效率。
- 部署指南:提供了基于 8 张 NVIDIA B300 或 AMD MI355X GPU 的完整 Docker 启动命令与配置参数。
所属事件:vLLM 与 AMD 实现 Kimi K3 首日推理支持(7 条相关)→
「Infra」频道最新
- 高通Q3营收超预期但下季EPS指引疲软,手机业务承压 — firstadopter · 2026-07-30
- Sam Altman 表态:理解民众不愿社区建 AI 数据中心的担忧 — businessinsider · 2026-07-30
- 扎克伯格:外部算力报价远高于我们的采购价 — firstadopter · 2026-07-30
- 4090加3060双卡推理会降速吗?社区经验分享 — cosmoschtroumpf · 2026-07-30
- 未来百万亿参数模型训练成本超 2500 亿 — JosephJacks_ · 2026-07-30
- 推理算力成 AI 新前沿,CoreWeave 高管解读扩展法则变迁 — agihouse_org · 2026-07-30