Quail 团队用 roofline 模型估算 AI-SQL 延迟:5k 条评论过滤下限仅 6.6 秒
sh_reya · x · 2026-10-02
UC 研究者 Shreya Shankar 介绍其开源 AI-SQL 引擎 Quail 的成本估算方法。要点:
- 逐行调用 LLM API 处理批量数据是糟糕方案:享受不到查询规划的收益,性能远非最优。
- 团队不做逐系统 profile(每换模型/GPU/负载都要重测),而是用 roofline 模型:按查询的计算量与访存量,除以 GPU 峰值算力和内存带宽,得到 speed-of-light (SoL) 延迟下限。
- 博文覆盖:transformer 前向传播中影响成本的因素、单个 AI filter 的延迟估算、多个 filter 组合时的代价与过滤顺序选择,并用 Qwen3-4B-fp8 + H100 给出可交互示例。
- 结论:在单张 H100 上对 5k 条影评跑一个 AI filter,理论下限约 6.6 秒——现有系统(包括 Quail 自己)都远未达到。
对做 LLM 批处理/查询优化的人是很有参考价值的工程方法论。
「Infra」频道最新
- 180B 模型塞进单台 DGX Spark:2.39-bit 量化仅损失 4.5% — TheZachMueller · 2026-10-02
- Google 称太空数据中心需 Starship 发射 1600 次才能落地 — TechCrunch AI · 2026-10-02
- 开源本地 AI 数字人应用:LM Studio 加 Chatterbox 克隆语音 — TheRedHairedHero · 2026-10-02
- 大科技 Capex 已占华尔街利润增长的一半 — speckx · 2026-10-02
- Modal Runtime 大会上 Einar 当场启动百万个 sandbox — graceisford · 2026-10-02
- 投机解码框架 Uno 获推理厂商采用:28k 长上下文提速至 DFlash 两倍 — yuntiandeng · 2026-10-02