vLLM 跑 AI-SQL 为何慢 27 倍:宿主开销叠加丢弃 5000 万 token 的 KV
sh_reya · x · 2026-09-25
作者分析用通用引擎 vLLM 跑 AI-SQL 的失败案例:某查询耗时 6.84 小时,而光速估算只要 15 分钟。原因有二:
- 宿主开销:大量 LLM 调用带来显著 host overhead。
- KV 丢弃:vLLM 丢弃了后续仍需要的 KV cache,导致重复处理 5000 万个额外 token。
结论:AI-SQL 是特殊负载——请求几乎全部可预先知晓、可提前规划 KV、只关心整条查询吞吐、且完全由 prefill 构成,与交互式推理场景不同,值得专用推理引擎,这正是 Quail 的立项动机。
「Infra」频道最新
- 曝 AI 芯片创企 DensityAI 拟融资数亿美元,估值 100 亿美元 — steph_palazzolo · 2026-09-25
- 曝 xAI 三个月内点亮 66 万张 GB300,年底 GPU 总量达 144 万 — ns123abc · 2026-09-25
- Epoch AI 图表:同等智能水平 AI 价格持续跳水,降幅超其他技术 — jeff_weinstein · 2026-09-25
- 多智能体通信催生新基建:Agent 间的「全局总线」会是下一个原语 — madhavsinghal_ · 2026-09-25
- 投资人预言:3-5 年内芯片到 PCB 设计将融合成一条连续流 — ai · 2026-09-25
- 高通 2nm 骁龙8至尊版发布:CPU 首破 5GHz,全线为智能体重写架构 — 量子位 · 2026-09-25