Qwen3.8-Flash-Next 技术解构:GDN+QSA 混合注意力,显存占用降低 23.5GB

ying11231 · x · 2026-08-27

Qwen3.8-Flash-Next (Qwen4 架构预览) 发布,125B MoE (6B 激活),由 SGLang 提供首发支持。架构创新:采用 36 层 Gated DeltaNet + 12 层 Qwen Sparse Attention 的混合架构,兼顾长上下文计算效率与检索精度;使用 51B N-gram embeddings,通过 host offloading 将显存占用降低 23.5 GiB (TP4),KV 容量提升 78.5%。性能优化:在 NVIDIA B200 上达到 540 tok/s 解码速度;HyperConnection Kernels 带来 2.05x 内核加速与 7.6% 端到端提升。合作:由阿里巴巴 Qwen、NVIDIA、AMD 及 RadixArk 共同优化,提供了 NVFP4 量化版本。

所属事件:阿里开源Qwen3.8-Flash-Next:6B激活的Qwen4架构预览(15 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →