实战:让 vLLM Prefix Cache 在 Agent 多轮间保持命中
bolts98 · reddit · 2026-09-17
一篇工程博客讲解如何在 agent 多轮对话中保持 vLLM 的 prefix cache 命中,避免每轮重复计算 KV cache。要点:
- agent 每轮在上下文后追加新内容,prefix cache 理论上可复用此前所有 token 的 KV,但实践中常因请求被路由到不同 worker 或上下文被重排而失效
- 作者分析了 cache 失效的常见原因,并给出保持前缀稳定、会话亲和(session affinity)与缓存预热的具体做法
- 对多 agent / 长对话场景可显著降低延迟与算力开销
「编程与Agent」频道最新
- 约90%企业Agent试点难落地,AGI House办黑客松攻坚交付 — agihouse_org · 2026-09-17
- Codex 全自动开发 iOS 应用并自助完成 App Store 提审 — ezshine · 2026-09-17
- Hermes Agent 插件生态扩张,用户称可取代整个操作系统 — max_paperclips · 2026-09-17
- Muse 内置浏览器 computer use:视觉加操作循环可通用任何网站 — armand_ruiz · 2026-09-17
- DuckDB 扩展用 LLM 给 CSV 行分类,千行约 10 秒 — josh_wills · 2026-09-17
- Claude Code 子代理加 omitClaudeMd,10 个代理省 88% 上下文 — This_Cell_1829 · 2026-09-17