实测:MoE 模型将本地 Agent 并发吞吐提升 8 倍

AIForOver50Plus · reddit · 2026-08-21

作者在 MacBook Pro M3 Max 上对比了 Dense 27B 和 MoE 30B-A3B 模型的本地并发性能。结果显示,Dense 模型在 2 个 Agent 后吞吐即因内存带宽瓶颈持平(约 20 tok/s),而 MoE 模型因每 Token 仅激活约 3B 参数,吞吐随 Agent 数量线性增长(8 Agent 时达 158.6 tok/s)。MoE 模型在首字延迟(0.8s vs 32.2s)和单 Agent 速度上均有巨大优势,证明了在内存带宽受限场景下 MoE 架构的显著优势。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →