vLLM 跑 AI-SQL 查询耗时 6.84 小时,理论极限仅 15 分钟

sh_reya · x · 2026-09-25

Quail 团队披露的对比数据:把 AI-SQL 查询的所有 LLM 调用跑在手调 vLLM 基线上,多条查询出现大量 host 侧开销,且 vLLM 丢弃了后续还要用的 KV cache,导致额外处理了 5000 万 token。

最终一条查询耗时 6.84 小时,而光速估计显示理论上只需 15 分钟——差距约 27 倍,说明查询计划与推理调度必须协同设计,单纯调优推理引擎远远不够。

所属事件:UC Berkeley 开源 AI-SQL 引擎 Quail:单 H100 吞吐破 10 亿 token/分钟(9 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →