UC Berkeley 开源 AI-SQL 引擎 Quail:单 H100 吞吐破 10 亿 token/分钟
UC Berkeley 全栈数据实验室与 Modal 的 Charles Frye 合作发布开源 AI-SQL 推理引擎 Quail(MIT 协议),附博客、代码与在线 demo。它面向「AI 驱动的数据算子」这一新场景:用户可在 SQL 中直接写自然语言条件,例如 SELECT FROM reviews WHERE AI.IF("评论讨论了结局"),从而触发数百万次 LLM 调用。团队称在单张 H100 上对单个查询达到 1B+ input tokens/min 吞吐。
已确认
- Quail 以 MIT 协议开源,发布方为 UC Berkeley 团队,合作方为 Modal 的 Charles Frye,附博客、代码与在线 demo。
- 提速来自查询规划与推理的联合优化:对 AI 算子重新排序、流水线化行处理,使 KV cache 常驻 GPU HBM 并通过批处理保持 GPU 满载;AI join 优化借鉴 Speculative Execution 思路;利用树注意力(tree attention)复用前向计算。
- 基准成绩:在 29 条基准查询上,Quail 比手工调优的 vLLM 基线平均快 1.84 倍;最快的一条医疗报告查询快 14 倍(29 分钟 vs 6.84 小时),且 KV regret 显著更低。
- 对比数据:把 AI-SQL 查询的全部 LLM 调用跑在手调 vLLM 基线上,多条查询出现大量 host 侧开销,且 vLLM 丢弃了后续还要用的 KV cache,导致额外处理约 5000 万 token;团队估算理论极限约 15 分钟。
- 作者承认 Quail 尚未实现自动前缀缓存:在分析带相同前缀的 agent trace 场景下,vLLM 靠自动 prefix cache 匹配跨行重复前缀,比 Quail 快 2.32 倍;前缀缓存已列入 Quail 路线图。
为什么重要
- AI-SQL 让自然语言条件直接进入数据库查询,是 LLM 推理与数据系统结合的新方向;Quail 表明把查询规划与推理联合优化(而非把 LLM 当黑盒调用)可带来数量级吞吐差异,为高吞吐 AI 数据算子提供了开源参考实现。同时作者坦承在特定场景(重复前缀的 agent trace 分析)仍落后于 vLLM 的自动前缀缓存,说明其优势有明确适用边界。
2026-09-25 ~ 2026-09-25 · 9 条相关
一手来源
- UC Berkeley 开源 Quail:用查询计划优化百万次 LLM 调用的 AI-SQL 引擎 — sh_reya ·
- 开源 AI-SQL 引擎 Quail:单张 H100 跑出每分钟 10 亿+ token 吞吐 — sh_reya ·
- Quail 基准成绩:29 条查询平均快 1.84 倍,医疗报告查询快 14 倍 — sh_reya ·
- 【源头】开源 AI-SQL 引擎 Quail:单张 H100 跑出每分钟 10 亿+ token 吞吐 — sh_reya · 2026-09-25
- vLLM 跑 AI-SQL 查询耗时 6.84 小时,理论极限仅 15 分钟 — sh_reya · 2026-09-25
- Quail 提速细节:AI 算子排序、KV 常驻 HBM、树注意力复用前向计算 — sh_reya · 2026-09-25
- 【源头】Quail 基准成绩:29 条查询平均快 1.84 倍,医疗报告查询快 14 倍 — sh_reya · 2026-09-25
- Quail 追平短板:vLLM 自动前缀缓存仍快 2.32 倍,已列入路线图 — sh_reya · 2026-09-25
- 【源头】UC Berkeley 开源 Quail:用查询计划优化百万次 LLM 调用的 AI-SQL 引擎 — sh_reya · 2026-09-25