vLLM:K3 的 2.8T 参数不难,难的是缓存
vllm_project · x · 2026-07-27
vLLM 的重点是:K3 的 2.8T 参数并不算最难,真正难的是怎么把它们缓存起来。
由于 K3 大量层使用的是固定大小的 KDA state,而不是会持续增长的 KV cache,所以不存在按 token 追加并哈希 KV 的传统路径。围绕这一点,prefix caching 被重新设计;帖子还说,K3 之后的混合模型都会继承这套结果。
配图进一步展示了该架构的几块核心组件:
- Stable LatentMoE
- Gated MLA
- KDA
整体是在说明一个面向超大模型的缓存与推理服务实现问题,而不只是模型参数规模本身。
「Infra」频道最新
- Kimi K3 被指服务成本比 V4 高出两倍以上 — teortaxesTex · 2026-07-27
- Cisco 发布面向本地漏洞定位的开源模型 Antares — thione · 2026-07-27
- Etched 融资 3 亿美元,估值升至 103 亿美元 — thione · 2026-07-27
- Etched 融资 3 亿美元,估值升至 103 亿美元 — thione · 2026-07-27
- 梗图把“数据中心上云”画成仓库大火 — evilsocket · 2026-07-27
- Google DeepMind 发布 LLM 规模化训练与 GPU 指南 — mdancho84 · 2026-07-27