MoE 推理里活跃参数更重要

giffmana · x · 2026-07-20

在回复里,作者讨论了 MoE 在本地推理 + SSD 流式加载 场景下的取舍:由于只需要激活一部分参数,模型的总参数量本身影响变小,推理瓶颈更多转向实际参与计算的参数和调度方式。

他进一步强调,降低活跃参数数通常总是收益;但代价是这类方案在 batch size = 1 的本地推理里,矩阵乘法效率可能会很差。

所属事件:MoE结合SSD流式推理打破总参数限制(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →