专用推理引擎兴起,vLLM/SGLang 通用性遭遇挑战

围绕越来越多专用推理引擎的出现,JiaZhihao(贾志豪)与 Baris Kasikci 等人展开讨论:vLLM/SGLang 覆盖海量「模型×硬件×工作负载」组合,单一系统难以在所有组合上都最优,聚焦更窄场景可留出更大优化空间;而编码 agent 降低了实现成本,使专用引擎更易落地。SGLang 作者旧部 shreya 则认为,OpenAI API 式「一批独立字符串提示」的抽象已不合适,若用声明式 DSL 并把推理做进算子,可能需要新的中间层表示。

2026-09-17 ~ 2026-09-17 · 3 条相关