vLLM 共享前缀批量调用怎么优化?开发者求证 KV cache 暖启动策略

Theboyscampus · reddit · 2026-09-30

一位开发者在 Reddit 分享其 Agent 工作流的推理架构:在 asyncio.gather 中并发 10 个 vLLM API 调用,让它们共享相同的前缀 prompt,末尾才分叉出各自的查询指令;请求经带 KV cache 感知路由算法的 vllm-router/llm-d 路由到 vLLM worker 池。

他提出的优化思路是:先发一个请求让 vLLM 完成一个 cache block 并开始解码,再发出剩余批量请求,并依靠路由器把它们都打到同一个 worker,从而最大化前缀缓存命中。帖子在征询这种「先热身再并发」策略是否为处理共享前缀批量请求的最佳实践。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →