Transformers 可直接跑进 vLLM
huggingface · x · 2026-07-14
Hugging Face 转发称,Transformers 模型现在可以在 vLLM 中以原生速度运行,很多情况下吞吐量接近甚至超过手写实现。
核心变化是:以前一种新架构往往要维护两份实现——一份在 Transformers 里用于训练/研究,另一份在 vLLM 里用于高性能推理。现在模型作者只要在 Transformers 中实现一次,就能直接吃到 vLLM 的优化推理栈。
他们的基准显示,这个后端在 4B 到 235B 参数规模的模型上都能保持与原生 vLLM 相当或更高的吞吐,覆盖了张量并行和 MoE 场景。作者强调,这意味着一份可读的模型实现可以同时服务训练、微调、评估、RL rollout 和生产推理。
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11