零依赖推理引擎 ZSE:冷启动比 vLLM 快 30 倍,无需 PyTorch
tom_doerr · x · 2026-08-14
ZSE 是一个零依赖的 LLM 推理引擎,完全不用 PyTorch、Triton、bitsandbytes 或 transformers,而是通过纯 Python、ctypes 和内核编译器直接生成 CUDA、ROCm 和 Metal 代码。在 Modal 的 T4、L4、A10G、A100 以及 DigitalOcean 的 MI300X 和 Apple M1 上验证,INT4 量化下与 vLLM AWQ 对比,冷启动速度大幅提升:例如 Qwen2.5-7B 在 T4 上冷启动仅 7.25 秒,而 vLLM 需要 218.96 秒,提速 30.2 倍;在 L4 上提速 26 倍。模型加载只需数秒,内存占用也大幅降低。
「Infra」频道最新
- OpenAI发布GPT-5.6构建者指南:账单从33美元降至1.33美元 — xiaohu · 2026-08-14
- Google免费发布GPU大师课,助你掌握硬件优化 — mdancho84 · 2026-08-14
- AMD Linux跑ComfyUI不再折腾:Docker固定ROCm运行时方案 — zychu- · 2026-08-14
- 美光科技市盈率仅9倍,AI芯片股估值引热议 — JOBhakdi · 2026-08-14
- 双 MI50 32GB 构建求助:如何配置 Hermes 与 vLLM? — opoot_ · 2026-08-14
- K8s CPU limits 为何有害?深度分析揭示性能陷阱 — iljanevo · 2026-08-14