vLLM 首日支持 Qwen3.8 2.4T 模型,提供开箱即用 4-bit 量化

vllm_project · x · 2026-08-13

vLLM 项目宣布 Day-0 支持阿里巴巴最新发布的超大规模开源模型 Qwen3.8-2.4T-A95B(总参数量 2.4T,激活参数 95B,含 512 个专家)。

官方已在 NVIDIA 和 AMD 硬件上完成验证,并联合 Inferact 提供了开箱即用的 4-bit 量化检查点:

用户无需自行进行格式转换或校准,直接使用 vllm serve 即可部署。

所属事件:vLLM首发支持通义Qwen3.8 2.4T大模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →