vLLM 跑 AI-SQL 查询耗时 6.84 小时,理论极限仅 15 分钟
sh_reya · x · 2026-09-25
Quail 团队披露的对比数据:把 AI-SQL 查询的所有 LLM 调用跑在手调 vLLM 基线上,多条查询出现大量 host 侧开销,且 vLLM 丢弃了后续还要用的 KV cache,导致额外处理了 5000 万 token。
最终一条查询耗时 6.84 小时,而光速估计显示理论上只需 15 分钟——差距约 27 倍,说明查询计划与推理调度必须协同设计,单纯调优推理引擎远远不够。
所属事件:UC Berkeley 开源 AI-SQL 引擎 Quail:单 H100 吞吐破 10 亿 token/分钟(9 条相关)→
「Infra」频道最新
- Horace He 解析怪现象:数据「可预测」时 GPU 矩阵乘法跑得更快 — goyal__pramod · 2026-09-25
- PyTorch 官方宣布 ExecuTorch 端侧黑客松,10 月旧金山开战 — PyTorch · 2026-09-25
- 网友推测 GPT 6 Luna/Sol 主打效率,意在配合 Cerebras 千 tok/s 推理 — brandon_galang · 2026-09-25
- Stripe 公布欧洲创业算力数据,Nina Schick 称美国独占智能基建优势 — ZeroStateReflex · 2026-09-25
- Apple M5 芯片数据已上架基准库,跑分结果可查 — bronzeagepapi · 2026-09-25
- 按公斤算账:GB300 机柜单价密度已超大麻、堪比芬太尼 — dylan522p · 2026-09-25