社区热议 Qwen 4 架构:Sparse Attention 还是 MLA 混合?

challis88ocarina · reddit · 2026-08-25

针对即将发布的 Qwen 4 模型架构,社区成员提出了几种猜测:可能是 Embedding 卸载的线性架构,其中 51B n-grams 跟踪语义和上下文;也可能是稀疏全注意力配合密集路由;或者是多头潜在注意力 (MLA) 混合架构,通过压缩 KV 并按需解压 Embedding 来实现高效推理。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →