Quail 提速细节:AI 算子排序、KV 常驻 HBM、树注意力复用前向计算
sh_reya · x · 2026-09-25
Quail 的提速来自查询规划与推理的联合优化:
- 算子排序:对 AI 算子重新排序,流水线化行处理,让 KV cache 常驻 GPU HBM,并通过批处理保持 GPU 满载。
- AI join 优化:借鉴 SpecInfer、Hydragen 的树注意力(tree attention)技巧,在一份文档与多份文档比较时复用前向传播计算。
- 背景:AI-SQL 是特殊负载——几乎所有请求可预先知晓(可提前规划 KV)、只关心整条查询的总吞吐、且请求完全由 prefill 构成,与通用推理引擎优化的交互式场景截然不同,因此值得做专用推理引擎。
所属事件:UC Berkeley 开源 AI-SQL 引擎 Quail:单 H100 吞吐破每分钟 10 亿 token(10 条相关)→
「Infra」频道最新
- GPU 成新资产类别:H100 一年回报 +76%,B300 租金指数涨 66% — KyeGomezB · 2026-09-25
- 开源 Jev 玩法:SGLang Radix Cache 助 Qwen3.6-35B-A3B 一秒跑完 64 个决策 — multiply_matrix · 2026-09-25
- Ramp 实测 Jev 替代 LLM 重排:尾延迟降 10 倍至 300ms、成本省 3 倍 — multiply_matrix · 2026-09-25
- 高通骁龙峰会主打'手机是 AI 中枢',欲造安卓版苹果式跨设备体验 — BenBajarin · 2026-09-25
- 5090本地跑Qwen3.8-Flash-Next:40tok/s且几乎不占内存 — nirurin · 2026-09-25
- 开发商仅付1美元押金,Exelon拒为200亿美元数据中心供电 — SumitGup · 2026-09-25