vLLM+LMCache 生产实战:KV 缓存复用加速长上下文 Agent
Old_Ad_6033 · reddit · 2026-08-19
一位从 6 月起深入本地推理的开发者分享了 Qwen 27B 在 vLLM 上的高效生产配置笔记:
- vLLM + LMCache:把被淘汰的 KV cache 存到内存或磁盘,下次请求直接复用、无需重新 prefill。对于大量使用 100k–200k+ token 的 agent 场景提升显著。
- 投机解码:vLLM 已支持 DSpark,DFlash2 需打补丁。实测解码代码类 token 时比非投机配置快近 2–3 倍,且 MTP/DSpark/DFlash 理论上无损。
- 踩坑警告:在 prefix caching + hybrid 模型的组合下存在 bug——前缀缓存会逐渐破坏 MTP 的 KV cache head,累积到完全损坏、输出全错。作者认为 vLLM 0.27.1 可能已修复(仅测了少量长 agent 任务),仍需确认。
完整细节在 uraniumchonk/vllm-hybrid-mamba-notes,作者建议把它交给 agent 转成 skill 便于调试。
「Infra」频道最新
- Gatana 推出 MCP Gateway 网关内持久化加密存储 — Gatana_Official · 2026-08-20
- Bittensor 数据分析:子网质押稳定,算力市场走向透明化 — bittingthembits · 2026-08-20
- 技术探讨:llama.cpp 为何不实现 GTT 显存卸载? — pneuny · 2026-08-20
- 支付基建 Natural 获 1 亿美元信贷,专供 AI 智能体资金流转 — _sonith · 2026-08-20
- Unsloth 发布 Qwen3.8-27B 新量化版:精度提升 10% — danielhanchen · 2026-08-20
- Contained:macOS 原生 SwiftUI 容器管理工具发布 — tom_doerr · 2026-08-20