MoE 推理优化:为何不按文档而非 token 选专家?

nbvehrfr · reddit · 2026-08-25

作者质疑当前 MoE 大模型让每个 token 独立选择所有专家的做法,认为这导致了推理时显存需求过高。文章提出了一种替代方案:使用小型草稿模型读取文档前 100 个 token,预测相关的专家池,将该池加载至 VRAM 并常驻,随后仅在该池内进行 token 级别的路由。作者指出,对于长上下文任务,语义领域通常不会在短时间内频繁跳变。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →