开源 AI-SQL 引擎 Quail 上线 prefix sharing:token 省 3 倍、提速 2.6 倍
sh_reya · x · 2026-10-08
shreya 宣布其开源 AI-SQL 引擎 Quail 支持 prefix sharing。实测案例:用 qwen3-4b 给 1,772 条长 agent trace 打问题类型标签,token 计算量减少 3 倍,查询提速 2.6 倍。
后续线程补充了实现细节:
- 原理:与各推理引擎采用的 prefix/radix caching 相同,但由于 LLM 调用通过 AI-SQL 查询进入,Quail 可在查询优化阶段就预先规划全部复用,不依赖请求到达顺序或 KV cache 驱逐
- 三种复用形式:KV rewind(同一文档多个问题/join 对象间复用)、prefix sharing(共享前缀的文档间复用)、KV retention(跨算子保留文档 KV)
- 实现:KV 按 16 token 分页存储,多文档可引用同一页;优化器以规则形式决定是否启用 prefix sharing,基于文档间重叠程度与 KV 写入成本的对比自动权衡
- 文档配有成本模型,按 GPU 算力与显存带宽估算执行时间,支持 explain(analyze=True) 对比估算与实测
所属事件:开源 AI-SQL 引擎 Quail 支持前缀共享(2 条相关)→
「Infra」频道最新
- Windows 现场 demo:编码任务被自动路由到本地模型,llama.cpp 已接入 Windows ML — ryanshrout · 2026-10-08
- exe.dev 详解超线程侧信道风险:用 core scheduling cookie 做团队级隔离 — davidcrawshaw · 2026-10-08
- NVIDIA 发布 LoGRA:强化学习训练显存最高省 45.7% — mark_k · 2026-10-08
- 6 卡 3090 无 NVLink 跑 Qwen3.8-Flash-Next:prefill 快 8-10 倍,长文解码快 2-3 倍 — flynth92 · 2026-10-08
- DeepMind Philipp Schmid:每个 Agent 都该有自己的云端沙盒 — AI Engineer · 2026-10-08
- GitHub 全球宕机,工程师吐槽「正在抢修」 — iannuttall · 2026-10-08