自研 LLM 推理引擎:比 vLLM 快 10-20%
AlpinDale · x · 2026-08-20
作者分享过去两年多来从零开始构建的 LLM 推理引擎,包含自有的 MLIR 编译器。
- 性能表现:在大多数 GPU 上比 vLLM 快 10-20%,预计编译器优化后差距更大。
- 当前功能:功能较基础,仅支持 Qwen3/3.5、FP8/NVFP4 量化、KV Cache 量化和 dflash。
- 未来计划:希望今年发布,现向社区征集反馈,询问大家在 vLLM/SGLang/llama.cpp 中常用的功能需求(如 KV offloading、混合推理等)。
「Infra」频道最新
- AI 数据中心用水量引争议,动画展示实际影响 — ATTlKA · 2026-08-20
- 本地 LLM 量化避坑指南:FP8/NVFP4 等格式的硬件门槛 — Ill_Dragonfruit_3547 · 2026-08-20
- Mojo集成MLIR栈运行矩阵乘法,ModCon大会演示异构计算 — clattner_llvm · 2026-08-20
- 硬件迭代工具 Blueprint 获 a16z 领投超百万美元 — Scobleizer · 2026-08-20
- Mac 本地运行 27B 多模态模型,三年前不可想象 — TheMoonMidas · 2026-08-20
- RTX PRO 6000 Blackwell 评测:多 GPU 塔式工作站首选 — TheZachMueller · 2026-08-20