vLLM transformers 后端实测:速度追平甚至超越原生实现
ben_burtenshaw · x · 2026-08-04
Hugging Face 宣布,transformers 的 vLLM 建模后端在许多 LLM 架构上,已经能达到甚至超越手写的原生 vLLM 实现的速度。
- 核心价值:模型作者现在可以直接利用其在 transformers 中的实现,免费获得 vLLM 的超快推理能力(如连续批处理和自定义注意力内核),无需再单独移植。
- 实测对比:官方在三种差异巨大的 Qwen3 模型上进行了对比测试,包括单 GPU 的 4B 稠密模型、张量并行的 32B 稠密模型,以及基于 8×H100 节点的 235B FP8 混合专家模型。结果显示,该后端在各项吞吐量指标上均达到或超过了原生实现。
「Infra」频道最新
- Runware 推出模块化推理数据中心,成本降低 10 倍 — aziz4ai · 2026-08-04
- 单卡RTX 5090跑满DeepSeek-V4 1M上下文,附详细配置 — BlackBeardAI · 2026-08-04
- MiniMax H3 加速实测:TE-Speed 最高提速1.785倍 — Commercial_Board9219 · 2026-08-04
- Cloudflare 推出 CI SDK:支持集成 AI 修复代码 — dinasaur_404 · 2026-08-04
- Gavin 透露 SSI 计划八月发布模型,并深聊 AI 算力基建与 GPU 涨价 — zephyr_z9 · 2026-08-04
- AI交易进入选股阶段:算力供需基本面与股市叙事脱节 — tengyanAI · 2026-08-04