用 vLLM 内核做 SQL 式 AI 过滤:定制调度器与工作负载感知 KV 缓存

charles_irl · x · 2026-09-25

一拨推理引擎与查询引擎深度整合的工程讨论:团队没有把 LLM 当通用服务,而是把 vLLM 内部当库用,替换掉通用调度器,专为大批量、高吞吐、prefill-only 的 AI 过滤/join 查询设计了定制调度器。

关键点:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →