MoE 模型高并发时会退化为加载全部权重吗?

LocalLLaMa_reader · reddit · 2026-08-18

作者提出一个 MoE 服务机制的问题:dense 模型下并发能让多请求共享一次权重遍历从而摊薄带宽成本,但 MoE 的每请求只激活部分专家——当并发请求足够多且路由各异时,每个 token 周期内被激活的「不同专家集合」是否会逼近全模型,使 MoE 的并发优势消失?作者猜测实际处于单请求激活权重与全模型之间的均衡点。

由此延伸出一个部署层面的判断问题:大规模服务场景下,dense 模型(如 Mistral 的 123B dense)是否反而可能比激活参数更少的大 MoE(如 700B 级)更适合 agentic 高并发工作负载。帖子本身是提问,尚无结论性答案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →