Qwen3.8-27B 发布:单 GPU 支持 1M 上下文,vLLM 即日可用
Alibaba_Qwen · x · 2026-08-14
阿里 Qwen 团队宣布 Qwen3.8-27B 模型发布,该模型为 27B 参数密集混合注意力模型,其中 48/64 层使用线性注意力,原生上下文 262K,可扩展至 1M。模型支持多模态,内置 MTP 草稿头,在 vLLM 0.17.0 中即日可用,单张 Blackwell GPU 即可运行(NVFP4 精度下仅需 24.6 GiB)。
所属事件:Qwen3.8-27B开源发布,登顶HF趋势榜(36 条相关)→
「Infra」频道最新
- 得州收紧AI数据中心审批:要求审计电力、水与社区影响 — rohanpaul_ai · 2026-08-15
- 8GB 显存跑 Qwen3.8-27B 仅 5 token/s,如何到可用速度 — SoAp9035 · 2026-08-15
- Harvey 训练垂直模型:Review Table 成本大幅降低 — ypatil125 · 2026-08-15
- TrendForce 上调 AI 加速器出货预测至增长 31% — Beth_Kindig · 2026-08-15
- NInfer 推理引擎 Day-0 支持 Qwen3.8-27B,RTX 5090 上生成速度达 200 tok/s — FormOne2615 · 2026-08-15
- Orion-16B突破100B训练token,采用去中心化算力 — const_reborn · 2026-08-15