LMCache 用KV缓存提速LLM
kalyan_kpl · x · 2026-07-19
LMCache 是一个用于 LLM serving 的扩展,目标是降低首 token 延迟(TTFT)并提升吞吐,尤其适合长上下文场景。
它的做法是把可复用文本的 KV cache 存到多种位置,包括 GPU、CPU DRAM 和本地磁盘;当相同文本再次出现时直接复用缓存,从而减少 GPU 计算和用户等待时间。作者称,和 vLLM 结合后,在多轮问答、RAG 等场景里可带来约 3–10 倍的延迟/算力节省。
「Infra」频道最新
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11