阿里发布2.4T参数开源模型Qwen3.8-Max
NVIDIAAI · x · 2026-08-13
阿里巴巴发布了其最大的开源权重模型 Qwen3.8-2.4T-A95B(即 Qwen3.8-Max),总参数量达 2.4T,每个 token 激活 95B 参数。
- 架构设计:采用细粒度混合专家架构,结合全注意力与线性注意力机制,支持最高 100 万 token 上下文及 128K 输出,专为高难度推理和智能体任务设计。
- 推理性能:NVIDIA 技术博客指出,在无需额外调优的情况下,该模型可在 NVIDIA GB300 NVL72 上以 FP8 精度实现单 GPU 超过 4K tokens/秒的吞吐量和单用户超 350 tokens/秒的推理速度。
- 基础设施:部署此类万亿参数模型需要数据中心级别的加速计算,NVIDIA 正与开源生态合作提供多节点部署方案。
所属事件:阿里发布Qwen3.8-Max:2.4T参数开源模型(13 条相关)→
「Infra」频道最新
- 开源项目 mlx-dspark 让 Mac 跑大模型提速 3.3 倍 — A-Rahim · 2026-08-13
- Fluidstack 现身纽交所:探讨美国 AI 算力基建投资 — MxMnr · 2026-08-13
- 开源CUDA替代方案:实现AMD GPU代码跨平台移植 — tom_doerr · 2026-08-13
- AMD 7900 XT 跑 Gemma 模型掉速:131K 上下文成性能瓶颈 — opoot_ · 2026-08-13
- 4GB 显存挑战:低端 PC 搭建本地开源智能体 — ComplexHuman26 · 2026-08-13
- Polymarket 数据:今年 AI 泡沫破裂概率仅 15% — Polymarket · 2026-08-13