vLLM首发支持通义Qwen3.8 2.4T大模型,单节点即可跑
vllm_project · x · 2026-08-13
祝贺阿里通义千问发布了迄今为止最大的开源权重模型之一:Qwen3.8-2.4T-A95B。该模型总参数量达 2.4 万亿,激活参数为 950 亿,包含 512 个专家。
vLLM 项目宣布为其提供 Day-0 支持,并在英伟达和 AMD 硬件上完成了验证。官方还提供了开箱即用的 4-bit 量化检查点:
- NVIDIA 方案:可在单个 8xB300 节点上运行(1.32 TiB)。
- AMD 方案:可在单个 8xMI355X 节点上运行(1.45 TiB)。
所属事件:vLLM首发支持通义Qwen3.8 2.4T大模型(2 条相关)→
「Infra」频道最新
- 推演 DeepSeek V4:超低 API 成本与 SSD KV Cache 革命 — Xianbao_QIAN · 2026-08-13
- Vercel AI Gateway 零加价上线 Grok 与 DeepSeek 模型 — brandon_galang · 2026-08-13
- AI 能耗度量新视角:每 token 能耗需结合质量、任务等多维因素 — prateekj · 2026-08-13
- 实测:单台 DGX Spark 跑 124B 模型达 38.7 tok/s — AcanthisittaOk1699 · 2026-08-13
- 仅 32G 内存能否跑得动 MiniMax H3? — Puzzleheaded_Emu8419 · 2026-08-13
- 80张RTX 5090跑满Kimi K3全量模型,Bittensor网络提供半价平替API — markjeffrey · 2026-08-13