Qwen3.8-27B 发布:单 GPU 支持 1M 上下文,vLLM 即日可用

Alibaba_Qwen · x · 2026-08-14

阿里 Qwen 团队宣布 Qwen3.8-27B 模型发布,该模型为 27B 参数密集混合注意力模型,其中 48/64 层使用线性注意力,原生上下文 262K,可扩展至 1M。模型支持多模态,内置 MTP 草稿头,在 vLLM 0.17.0 中即日可用,单张 Blackwell GPU 即可运行(NVFP4 精度下仅需 24.6 GiB)。

所属事件:Qwen3.8-27B开源发布,登顶HF趋势榜(36 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →