MoE 模型推理算力分析:Qwen 27B 与 Flash-Next 288B 对比
EyalToledano · x · 2026-08-29
作者对比了 Qwen 2.5 27B 密集模型与 Flash-Next REAP-288B MoE 模型在 M5 Pro 64GB 设备上的推理性能。
核心原理:
- Qwen 2.5 27B (密集):每个 token 需读取全部 27B 权重。
- Flash-Next 288B (MoE):总权重 288B,但每个 token 仅激活 6B 权重。
M5 Pro 带宽限制 (307 GB/s):
- Qwen 2.5 27B @ 4-bit:显存占用约 18GB,每 token 读取约 16GB。基础解码上限约 19 tok/s (实际约 15 tok/s);配合 MTP drafter 可达 35-50 tok/s。
- Flash-Next REAP-288B @ 4-bit:每 token 仅读取约 2.3GB (比 Qwen 少 7 倍)。带宽不再是瓶颈,预计基础 15-20 tok/s,配合 MTP drafter 约 25-40 tok/s。
结论:MoE 模型在推理速度上远快于同等总参数量的密集模型,同时保持比小参数密集模型更强的能力。
「Infra」频道最新
- 德国警告 AI 算力不足,计划 2030 年算力翻四倍 — Polymarket · 2026-08-29
- WaveZip 推出:号称将芯片仿真存储成本降低 100 倍 — ycombinator · 2026-08-29
- QuixiAI 开源高性能推理服务 SlimServe — QuixiAI · 2026-08-29
- Ollama 新增 Claude 开关:本地模型可直接接入 Claude Desktop — dr_cintas · 2026-08-29
- AI 数据中心遭遇实体阻力,基础设施 backlash 升级 — AccBalanced · 2026-08-29
- 单卡 DGX Spark 运行 Qwen 3.8 MoE 实测方案 — QuixiAI · 2026-08-29