Kimi K3 开源:2.8 万亿参数,百万上下文,vLLM 同步适配

青稞AI · wechat · 2026-07-28

这条公众号内容讲的是 Kimi K3 正式开源,并且 vLLM day-0 支持同步上线。

文章重点不只是“开源”本身,还系统解释了 K3 的推理挑战:它是一个 2.8 万亿参数的原生多模态 MoE 模型,每个 token 从 896 个专家里激活 16 个,上下文长度最长可到 100 万 token。因此在 vLLM 上要同时处理混合注意力架构、KDA 循环状态缓存、PagedKVCache、专家并行和多模态输入适配。

后半部分主要是推理优化实践,包括 FlashKDA prefill、融合式 KDA decode kernel、LatentMoE tail fusion、KVCache offloading、SequenceParallelism、投机解码 等。官方测试里,DSpark 把单用户生成速度从 118 tok/s 提升到 370 tok/s,KDAMetadataBuilder 的准备延迟也从 870 微秒降到 34 微秒。

所属事件:Kimi K3 公开后焦点转向架构(25 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →