vLLM 集成 Transformers 后端,文本图像音频视频全模态统一推理
LysandreJik · x · 2026-10-06
vLLM 宣布其 Transformers modelling backend 现已支持文本、图像、音频、视频全部模态,无需任何手写的 vLLM 模型适配代码——模型只需以 --model-impl transformers 启动即可直接服务。视频支持由 Harshal Janjani 贡献,将随 vLLM v0.32.0 发布。这意味着任何 Transformers 支持的模型都能零适配成本接入 vLLM 推理栈。
「Infra」频道最新
- 长文拆解:Nvidia 有护城河但无垄断,Google 自研 TPU 占全球算力近四分之一 — AryHHAry · 2026-10-06
- 4090 跑 Qwen 本地模型,上下文窗口约 32k 就爆显存 — BLUECOW009 · 2026-10-06
- DDR5 超频实测:MoE 模型显存外推理提速最高 14% — EvolvingDior · 2026-10-06
- 曝 DeepSeek 融资至少 120 亿美元,拟 2027 年初 IPO — teortaxesTex · 2026-10-06
- SEC 文件曝光:Anthropic 5180 亿算力承诺中 80% 不用也得付 — rohanpaul_ai · 2026-10-06
- llama.cpp 新 PR 让 Metal 上投机解码提速 3 倍 — pmttyji · 2026-10-06