腾讯开源 FlexKV 分布式 KV 缓存:TTFT 最高降 70%,吞吐提升 16%
Roger_M_Taylor · x · 2026-09-17
腾讯云 TACO 团队联合社区开源 FlexKV,一个面向大规模 LLM 推理的分布式 KV 缓存与多级缓存管理系统,已在 GitHub 发布(Apache-2.0)。
针对的核心问题:长上下文场景下,KV 缓存放在 GPU 显存之外时,取回数据的速度常让 GPU 干等——缓存命中了也白搭。
关键技术点:
- 分层恢复:前面的层边算,后面的层边加载
- 预取 + 异步回写:把缓存 I/O 与推理计算重叠
- 无损压缩 KV,用 CPU 内存、SSD、远端存储扩展缓存容量
- 集群级前缀复用,并把请求路由到缓存所在位置
- 作为推理引擎下挂层,无需改动现有架构,兼容 SGLang、vLLM、TensorRT-LLM、Dynamo
实测效果:TTFT(首 token 延迟)最高降低 70%,吞吐提升 16%。
「Infra」频道最新
- llama.cpp 加载 Qwen3.8 MTP 草稿模型报错,tensor 缺失无解 — Ambitious_Fold_2874 · 2026-09-17
- 预测:18个月内Kimi K3级智能将跑在单张RTX 5090上 — TheZachMueller · 2026-09-17
- 有用户称愿为 AI 订阅月付 1000 美元,但定价过高会推向本地部署 — draginol · 2026-09-17
- NVIDIA 上架 DeepSeek-V4.1-Flash NVFP4 量化版,MIT 协议开源 — TheZachMueller · 2026-09-17
- Bittensor 挖矿优化被 vLLM 收编,Qwen3 吞吐提升约 4% — const_reborn · 2026-09-17
- vLLM 出现 DiffusionGemma 结构化生成 PR,单机 DGX Spark 延迟亮眼 — generativist · 2026-09-17