vLLM 跑 AI-SQL 为何慢 27 倍:宿主开销叠加丢弃 5000 万 token 的 KV

sh_reya · x · 2026-09-25

作者分析用通用引擎 vLLM 跑 AI-SQL 的失败案例:某查询耗时 6.84 小时,而光速估算只要 15 分钟。原因有二:

结论:AI-SQL 是特殊负载——请求几乎全部可预先知晓、可提前规划 KV、只关心整条查询吞吐、且完全由 prefill 构成,与交互式推理场景不同,值得专用推理引擎,这正是 Quail 的立项动机。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →