Dynamic REAP:每 256 token 异步换 4 个专家,只存 25% 也不伤推理

Tim_Dettmers · x · 2026-09-22

压缩后的模型通过 Dynamic REAP 部署:即使每层只保留约 25% 的专家,被移除专家的路由概率仍忠实反映当前分布需要哪些专家,据此决定从 CPU RAM / NVMe 向 GPU 传输哪些专家。系统每 256 个 token 在 token 边界异步换入 4 个专家,不打断推理。令人意外的是,这比在测试集上拟合 REAP 的分布外泛化更好——说明 MoE 路由分布在处理文档过程中频繁变化(agent 场景会交替出现文档、代码、用户交互等分布)。

所属事件:Dettmers 详解逐层敏感度探测与动态专家交换(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →