专题 · FULL STORY

阿里Qwen3.8-Max发布及生态适配

阿里巴巴发布2.4T参数开源旗舰模型Qwen3.8-Max,模型迅速登顶Hugging Face热门榜。随后vLLM与Together AI等平台相继提供首发支持与托管服务,生态快速铺开。

2026-08-12 ~ 2026-08-13 · 3 集 · 21 条

第 1 集 · 阿里开源2.4T参数旗舰Qwen3.8-Max(2026-08-12,17 条)

阿里巴巴通义千问团队正式发布了最新超大规模模型 Qwen3.8-Max(即 Qwen3.8-2.4T-A95B),并冲上 Hugging Face 热门趋势榜。该模型总参数量达 2.4 万亿,采用混合专家架构,每次推理激活约 950 亿参数,是千问团队迄今发布的最大模型,也是其首个超万亿参数的多模态模型。团队宣布开放模型权重,引发了 AI 社区的广泛关注。

已确认

  • 模型已在 Hugging Face 上发布页面,提供 FP8 版本,并冲上平台热门趋势榜。Together AI、Baseten 等平台也已宣布上线该模型,Together AI 指出其专为编码和长程 Agent 工作流设计。
  • 模型原生支持 1M 上下文长度,具备可调推理能力与并行工具调用能力,结合了 Gated DeltaNet 等技术。
  • 团队宣布开放模型权重,采用类似 MIT 的开源许可,但对大型 AI 基础设施或编程助手业务设定了明确的商业收入门槛限制。对大多数初创公司和商业产品来说,该许可依然相当宽松。
  • 推理引擎 SGLang 和 Nebius Token Factory 宣布提供 Day-0 支持。SGLang 团队实测分享,该模型具备极强的复杂工程任务处理能力,甚至能在无人值守的情况下,自主运行 4.5 小时优化其自身的 SGLang 推理服务并验证性能。

尚未确认

  • 根据开发者 @multimodalart 查看的泄露配置信息,该模型原生支持强大的视觉能力,此功能细节目前源自泄露信息。

为什么重要

  • 作为 Qwen 系列的最新大型模型,2.4T 的参数规模使其成为当前业界备受瞩目的超大规模模型之一。其开放权重的举措以及展示出的自主优化推理引擎等复杂工程能力,引发了 AI 社区的广泛关注。

第 2 集 · vLLM首发支持通义Qwen3.8 2.4T大模型(2026-08-13,2 条)

vLLM项目宣布对阿里巴巴最新发布的超大规模开源模型Qwen3.8-2.4T-A95B实现Day-0支持。该模型总参数量高达2.4万亿,激活参数为950亿,包含512个专家。通过提供开箱即用的4-bit量化,vLLM使得这一巨量模型能够在单节点上高效运行。

第 3 集 · Together AI推出Qwen3.8-2.4T-A95B无服务器推理服务(2026-08-13,2 条)

Together AI 宣布其 Serverless Inference 服务已为 Qwen3.8-2.4T-A95B 模型提供托管高吞吐路径,专为应对高强度的编码与 Agent 工作负载而设计。该模型具备 256K 超长上下文,能够轻松处理大型代码库。此外,它还支持任务状态调度与恢复,并具备跨构建、单元测试及函数调用等长程 Agent 工作流优势。