vLLM:K3 的 2.8T 参数不难,难的是缓存

vllm_project · x · 2026-07-27

vLLM 的重点是:K3 的 2.8T 参数并不算最难,真正难的是怎么把它们缓存起来。

由于 K3 大量层使用的是固定大小的 KDA state,而不是会持续增长的 KV cache,所以不存在按 token 追加并哈希 KV 的传统路径。围绕这一点,prefix caching 被重新设计;帖子还说,K3 之后的混合模型都会继承这套结果。

配图进一步展示了该架构的几块核心组件:

整体是在说明一个面向超大模型的缓存与推理服务实现问题,而不只是模型参数规模本身。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →