零依赖推理引擎 ZSE:冷启动比 vLLM 快 30 倍,无需 PyTorch

tom_doerr · x · 2026-08-14

ZSE 是一个零依赖的 LLM 推理引擎,完全不用 PyTorch、Triton、bitsandbytes 或 transformers,而是通过纯 Python、ctypes 和内核编译器直接生成 CUDA、ROCm 和 Metal 代码。在 Modal 的 T4、L4、A10G、A100 以及 DigitalOcean 的 MI300X 和 Apple M1 上验证,INT4 量化下与 vLLM AWQ 对比,冷启动速度大幅提升:例如 Qwen2.5-7B 在 T4 上冷启动仅 7.25 秒,而 vLLM 需要 218.96 秒,提速 30.2 倍;在 L4 上提速 26 倍。模型加载只需数秒,内存占用也大幅降低。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →