vLLM:K3 的 2.8T 参数不难,难的是缓存
vllm_project · x · 2026-07-27
vLLM 的重点是:K3 的 2.8T 参数并不算最难,真正难的是怎么把它们缓存起来。
由于 K3 大量层使用的是固定大小的 KDA state,而不是会持续增长的 KV cache,所以不存在按 token 追加并哈希 KV 的传统路径。围绕这一点,prefix caching 被重新设计;帖子还说,K3 之后的混合模型都会继承这套结果。
配图进一步展示了该架构的几块核心组件:
- Stable LatentMoE
- Gated MLA
- KDA
整体是在说明一个面向超大模型的缓存与推理服务实现问题,而不只是模型参数规模本身。
所属事件:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(11 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23