Reddit 长文论断:一次性推理引擎将成为常态,vLLM/llama.cpp 或被边缘化
netherreddit · reddit · 2026-09-30
作者提出一个引起热议的论断:针对单一模型/硬件组合「过拟合」的一次性推理引擎将成为常态,而 llama.cpp、vLLM 等通用引擎会因速度落后被大多数人抛弃。
论证骨架基于三条公理:
- 代码库越小、越不通用,迭代越快;
- AI 编码能力提升让造一个推理引擎的门槛持续下降;
- 「让 tok/s 变高」这类目标完全可规范化,是全自动 AI 编码的理想任务,没有人类瓶颈。
推论:通用引擎在开发速度和 token 速度上会永远落后于一次性引擎;而一次性引擎又无法在保持通用性的同时维持开发速度,于是不断有新引擎涌现又消亡(ninfer、dwarfstar、Splash、llamAmpere、gufo 等)。
延伸思考:
- 推理之外的部分(API、CLI、GUI、benchmark、日志、模型格式)可能走向标准化,存在一个帮助一次性引擎快速接入的开源项目机会;
- 可能出现只针对单一硬件、对模型保持通用的「半通用」引擎;
- 硬件特定社区会围绕具体配置形成。
反面情景:通用引擎若能把模型/硬件特定的 kernel 与计算图插件化(下载模型时附带 .inferencerecipe),或用 AI 大幅加速自身开发流程,这一未来可能不会发生。
「Infra」频道最新
- 教授算账:与其月薪一半烧 token,不如 4 台 Mac Studio 跑 1T 模型 — DimitrisPapail · 2026-09-30
- 独立开发者造浏览器插件:本地压缩聊天记录跨 AI 工具搬运省 token — hakxajszzhzjU · 2026-09-30
- Yacine 建议用大厂 token 搭自用软件:留好退出坡道防算力绑架 — MikeBirdTech · 2026-09-30
- GPU 主动发网络请求:PyTorch GIN 让 all-to-all 提速 30% — PyTorch · 2026-09-30
- OpenAI 推出 Ultrafast 极速档:Codex 最高 300 tokens/秒、快 8 倍 — OpenAI · 2026-09-30
- OpenAI Responses API 流量一年涨 100 倍,可用性达 99.9% — TheMoonMidas · 2026-09-30