Qwen 架构解析:MoE 推理与 N-gram 记忆的分工
Beamsters · reddit · 2026-08-27
帖子解析了 Qwen4Exp 架构中混合专家模型与 N-gram 表的结合机制。
核心观点:
- MoE (Experts):负责算术与推理工作。路由器在层开始后较晚才做出选择,且需搬运大量数据,不适合放入磁盘。
- N-gram 表:负责记忆与召回。基于前几个 token 的哈希寻址,地址存在即知,仅需读取少量数据(几 kB),适合存储在 SSD 中。
数据与效益:
- Qwen 3.8 Flash Next 将约 125B 参数保留在 MoE 网络,另 51B 存于 N-gram 表。
- 每个 token 仅激活约 6B 参数,既保持了 176B 大模型的容量,又具备小模型的推理速度。
- 在固定预算下,N-gram 表承担 20-25% 的总参数比例效益最佳,能让浅层专注于模式重建,深层专注推理。
「Infra」频道最新
- 观点:HF 被 NVIDIA 收购后或丧失硬件中立性 — QuixiAI · 2026-08-27
- 英伟达手握算力分配权:AI 公司成败皆由它裁决 — matt_slotnick · 2026-08-27
- 英伟达财报炸裂,分析师称这是历史性觉醒时刻 — PTrubey · 2026-08-27
- 担心 HuggingFace 变天?用 BT 下载与备份 AI 模型指南 — SeyAssociation38 · 2026-08-27
- 两套 Blackwell vLLM 方案:NVFP4 KV 缓存换来 26 万上下文 — SeanHighness · 2026-08-27
- 为提升 SlimServe 性能,开发者修改 Nvidia 驱动解锁 PCIe P2P — QuixiAI · 2026-08-27