vLLM 为 Moonshot Kimi K3 提供 Day-0 支持

vLLM 表示,Moonshot AI 的 Kimi K3 在权重公开后即可在其栈上实现 day-0 推理部署,并已发布面向生产环境的部署指南与技术详解。此次重点不只是 K3 具备 2.8 万亿参数、100 万 token 上下文和原生视觉能力,更在于 vLLM 给出了针对超大 MoE 的服务化方案:其认为真正难点是缓存而非参数量,并通过推测解码把单流吞吐提升到 370 tok/s。对行业而言,这展示了开源推理栈如何快速适配架构特殊的超大模型。

已确认

为什么重要

对 2.8T 级别的 MoE 来说,能否稳定、低延迟地在线服务,关键往往在系统工程而非纸面参数规模。vLLM 这次公开的 KDA state 缓存思路,以及通过复用隐藏状态训练草稿模型的做法,为后续超大 MoE 的开源部署提供了可参考的工程路径。

2026-07-27 ~ 2026-07-29 · 11 条相关

事件全程(共 9 集)→

一手来源

另有 1 条近重复转述:woosuk_k