用 vLLM 内核做 SQL 式 AI 过滤:定制调度器与工作负载感知 KV 缓存
charles_irl · x · 2026-09-25
一拨推理引擎与查询引擎深度整合的工程讨论:团队没有把 LLM 当通用服务,而是把 vLLM 内部当库用,替换掉通用调度器,专为大批量、高吞吐、prefill-only 的 AI 过滤/join 查询设计了定制调度器。
关键点:
- 定制调度器支持工作负载感知的 KV 缓存管理
- 执行层重写了 attention kernel,避免多个查询重复读取同一批共享 KV
- 作者 shreya 表示惊讶于 prefill-only 查询竟有如此大优化空间:SQL 中早已知道查询形状(如 join 的结构),因此值得为特定场景实现不同的 attention;预计语义 groupby 等其他算子也会走同样的路线
- 引用者类比 agent 工作负载的 workload-aware 推理调度:用 session 感知的 KV TTL 避免环境交互期间缓存被逐出
「Infra」频道最新
- 投资人预言:3-5 年内芯片到 PCB 设计将融合成一条连续流 — ai · 2026-09-25
- 博主警告:AI 数据中心债务滚动叠加利率上升,恐难善终 — AIFlow_ML · 2026-09-25
- 马斯克披露 xAI 算力版图:Colossus 2 将部署 44 万颗 GB300 — elonmusk · 2026-09-25
- Qwen-Image-2.1 出 GGUF 量化版,骁龙865手机或可跑文生图 — ResidentAping · 2026-09-25
- 金融业用户抱怨AI开销失控,寻求替代Codex的本地方案 — Startup__Sam · 2026-09-25
- 扩散架构推理提速:Augment Code 换用 Mercury 2.5,延迟降 82% 成本降 90% — cen6wkf · 2026-09-25