Reddit 长文论断:一次性推理引擎将成为常态,vLLM/llama.cpp 或被边缘化

netherreddit · reddit · 2026-09-30

作者提出一个引起热议的论断:针对单一模型/硬件组合「过拟合」的一次性推理引擎将成为常态,而 llama.cpp、vLLM 等通用引擎会因速度落后被大多数人抛弃。

论证骨架基于三条公理:

推论:通用引擎在开发速度和 token 速度上会永远落后于一次性引擎;而一次性引擎又无法在保持通用性的同时维持开发速度,于是不断有新引擎涌现又消亡(ninfer、dwarfstar、Splash、llamAmpere、gufo 等)。

延伸思考:

反面情景:通用引擎若能把模型/硬件特定的 kernel 与计算图插件化(下载模型时附带 .inferencerecipe),或用 AI 大幅加速自身开发流程,这一未来可能不会发生。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →