UC Berkeley 开源 Quail:用查询计划优化百万次 LLM 调用的 AI-SQL 引擎
sh_reya · x · 2026-09-25
UC Berkeley 全栈数据实验室发布 Quail,一个 MIT 协议开源的超高吞吐 AI-SQL 引擎,与 Modal 的 Charles Frye 合作完成,附博客、代码和在线 demo。
- 背景:Snowflake Cortex、BigQuery、Databricks、MotherDuck 等纷纷支持 AI-SQL(用自然语言 prompt 定义 SQL 函数),但逐行调用 LLM 使一条查询可能产生数十万到数百万次模型调用,成本极高。
- 已有优化:学术系统如 Berkeley 的 DocETL、Stanford 的 LOTUS、MIT 的 Palimpzest、Cornell 的 ThalamusDB,通过减少 LLM 调用(MOAR、Task Cascades、Abacus)和用更便宜模型(BARGAIN)降本,但仍剩大量调用。
- Quail 的关键思路:以查询计划为核心组织执行;本次更新新增 AI filters 和 joins 支持。
- 已知短板:在分析前缀大量重叠的 agent trace 时,vLLM 的自动前缀缓存比 Quail 快 2.32 倍,自动前缀缓存已列入路线图。
所属事件:UC Berkeley 开源 AI-SQL 引擎 Quail:单 H100 吞吐破每分钟 10 亿 token(10 条相关)→
「Infra」频道最新
- GPU 成新资产类别:H100 一年回报 +76%,B300 租金指数涨 66% — KyeGomezB · 2026-09-25
- 开源 Jev 玩法:SGLang Radix Cache 助 Qwen3.6-35B-A3B 一秒跑完 64 个决策 — multiply_matrix · 2026-09-25
- Ramp 实测 Jev 替代 LLM 重排:尾延迟降 10 倍至 300ms、成本省 3 倍 — multiply_matrix · 2026-09-25
- 高通骁龙峰会主打'手机是 AI 中枢',欲造安卓版苹果式跨设备体验 — BenBajarin · 2026-09-25
- 5090本地跑Qwen3.8-Flash-Next:40tok/s且几乎不占内存 — nirurin · 2026-09-25
- 开发商仅付1美元押金,Exelon拒为200亿美元数据中心供电 — SumitGup · 2026-09-25