Qwen3.8-Flash-Next 技术解构:GDN+QSA 混合注意力,显存占用降低 23.5GB
ying11231 · x · 2026-08-27
Qwen3.8-Flash-Next (Qwen4 架构预览) 发布,125B MoE (6B 激活),由 SGLang 提供首发支持。架构创新:采用 36 层 Gated DeltaNet + 12 层 Qwen Sparse Attention 的混合架构,兼顾长上下文计算效率与检索精度;使用 51B N-gram embeddings,通过 host offloading 将显存占用降低 23.5 GiB (TP4),KV 容量提升 78.5%。性能优化:在 NVIDIA B200 上达到 540 tok/s 解码速度;HyperConnection Kernels 带来 2.05x 内核加速与 7.6% 端到端提升。合作:由阿里巴巴 Qwen、NVIDIA、AMD 及 RadixArk 共同优化,提供了 NVFP4 量化版本。
所属事件:阿里开源Qwen3.8-Flash-Next:6B激活的Qwen4架构预览(15 条相关)→
「Infra」频道最新
- RootCrak 推出 x402,为自主 Agent 交易构建安全层 — Thionne_WTZ · 2026-08-27
- Max Hodak 指出匿名模型测试致数据流入中国数据中心 — ohlennart · 2026-08-27
- 专栏文章:为何针对数据中心是环保主义的误区 — AndyMasley · 2026-08-27
- 呼吁建立独立安全集群:开放科学需要开放算力 — gajesh · 2026-08-27
- 预算硬件自托管 LLM 实战:硬件选型、优化与前端配置 — jflesch · 2026-08-27
- Stas Bekman 开源 ML 工程书大改版:PDF 已达 498 页 — StasBekman · 2026-08-27