vLLM transformers 后端已达原生速度,接入即免移植
ariG23498 · x · 2026-09-28
Hugging Face 宣布 vLLM 的 transformers modeling backend 现已达到甚至超过 vLLM 手写原生实现的速度。模型作者只要把模型集成进 transformers,就可在 vLLM 中自动获得极速推理,无需任何移植。
- transformers 是 450+ 架构的参考实现库,vLLM 负责连续批处理、自定义 attention kernel 等推理优化
- 官方在三种场景下与原生实现对跑:单卡 4B 稠密模型、张量并行的 32B 稠密模型、8×H100 上 235B FP8 MoE 的数据+专家并行
- 结果:transformers 后端在多数 LLM 架构上已持平或超越原生实现
- 升级命令:uv pip install --upgrade vllm --torch-backend auto
「Infra」频道最新
- 开发者转向本地 AI:不为隐私,为的是对代码与数据的掌控权 — Aiden_Tech_Ai · 2026-09-28
- Meta 开源推荐系统分析工具,按子模块剖析 TB 级模型性能 — _reachsumit · 2026-09-28
- 开源 apple-llm:一行代码调用 Mac 内置本地 LLM,附踩坑指南 — light_2earth · 2026-09-28
- 8 张水冷 GPU 实战派:本地推理训练强烈建议给 GPU 上水冷 — HanchungLee · 2026-09-28
- 创业者算账:租 5 年自建集群算力要花超 10 亿美元 — ericzelikman · 2026-09-28
- 用自托管 K3 集群跑自主 Infra 研究,token 随便烧不限量 — Xianbao_QIAN · 2026-09-28