MoE 模型高并发时会退化为加载全部权重吗?
LocalLLaMa_reader · reddit · 2026-08-18
作者提出一个 MoE 服务机制的问题:dense 模型下并发能让多请求共享一次权重遍历从而摊薄带宽成本,但 MoE 的每请求只激活部分专家——当并发请求足够多且路由各异时,每个 token 周期内被激活的「不同专家集合」是否会逼近全模型,使 MoE 的并发优势消失?作者猜测实际处于单请求激活权重与全模型之间的均衡点。
由此延伸出一个部署层面的判断问题:大规模服务场景下,dense 模型(如 Mistral 的 123B dense)是否反而可能比激活参数更少的大 MoE(如 700B 级)更适合 agentic 高并发工作负载。帖子本身是提问,尚无结论性答案。
「Infra」频道最新
- 哈佛研究:LLM 服务缓存效率受流量模式影响 — rohanpaul_ai · 2026-08-18
- 混搭 3060 和 5060 Ti 显卡跑 30B 本地模型? — MkGod · 2026-08-18
- Parlor:可在 MacBook M3 Pro 本地运行的类 GPT-Live 开源项目 — tom_doerr · 2026-08-18
- Unsloth Studio 桌面版翻车,Windows 上跑 MoE 量化还有哪些 GUI 可选 — IngwiePhoenix · 2026-08-18
- 观点:transformer 终将被替换,英伟达能否「自己革自己的命」 — yangyi · 2026-08-18
- 文件系统成为 AI 时代数据交互的核心范式 — blaizedsouza · 2026-08-18