Kimi K3 开源:2.8 万亿参数,百万上下文,vLLM 同步适配
青稞AI · wechat · 2026-07-28
这条公众号内容讲的是 Kimi K3 正式开源,并且 vLLM day-0 支持同步上线。
文章重点不只是“开源”本身,还系统解释了 K3 的推理挑战:它是一个 2.8 万亿参数的原生多模态 MoE 模型,每个 token 从 896 个专家里激活 16 个,上下文长度最长可到 100 万 token。因此在 vLLM 上要同时处理混合注意力架构、KDA 循环状态缓存、PagedKVCache、专家并行和多模态输入适配。
后半部分主要是推理优化实践,包括 FlashKDA prefill、融合式 KDA decode kernel、LatentMoE tail fusion、KVCache offloading、SequenceParallelism、投机解码 等。官方测试里,DSpark 把单用户生成速度从 118 tok/s 提升到 370 tok/s,KDAMetadataBuilder 的准备延迟也从 870 微秒降到 34 微秒。
所属事件:Kimi K3 公开后焦点转向架构(25 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11