vLLM 首日支持 Qwen3.8 2.4T 模型,提供开箱即用 4-bit 量化
vllm_project · x · 2026-08-13
vLLM 项目宣布 Day-0 支持阿里巴巴最新发布的超大规模开源模型 Qwen3.8-2.4T-A95B(总参数量 2.4T,激活参数 95B,含 512 个专家)。
官方已在 NVIDIA 和 AMD 硬件上完成验证,并联合 Inferact 提供了开箱即用的 4-bit 量化检查点:
- NVFP4 版本(1.32 TiB):可在单节点 8xNVIDIA B300 上运行。
- MXFP4 版本(1.45 TiB):可在单节点 8xAMD MI355X 上运行。
用户无需自行进行格式转换或校准,直接使用 vllm serve 即可部署。
所属事件:vLLM首发支持通义Qwen3.8 2.4T大模型(2 条相关)→
「Infra」频道最新
- Nebius Q2财报:AI云收入暴涨514%,2026年算力容量提至5GW — demian_ai · 2026-08-13
- 推演 DeepSeek V4:超低 API 成本与 SSD KV Cache 革命 — Xianbao_QIAN · 2026-08-13
- Vercel AI Gateway 零加价上线 Grok 与 DeepSeek 模型 — brandon_galang · 2026-08-13
- AI 能耗度量新视角:每 token 能耗需结合质量、任务等多维因素 — prateekj · 2026-08-13
- 实测:单台 DGX Spark 跑 124B 模型达 38.7 tok/s — AcanthisittaOk1699 · 2026-08-13
- 仅 32G 内存能否跑得动 MiniMax H3? — Puzzleheaded_Emu8419 · 2026-08-13