Dynamic REAP:每 256 token 异步换 4 个专家,只存 25% 也不伤推理
Tim_Dettmers · x · 2026-09-22
压缩后的模型通过 Dynamic REAP 部署:即使每层只保留约 25% 的专家,被移除专家的路由概率仍忠实反映当前分布需要哪些专家,据此决定从 CPU RAM / NVMe 向 GPU 传输哪些专家。系统每 256 个 token 在 token 边界异步换入 4 个专家,不打断推理。令人意外的是,这比在测试集上拟合 REAP 的分布外泛化更好——说明 MoE 路由分布在处理文档过程中频繁变化(agent 场景会交替出现文档、代码、用户交互等分布)。
所属事件:Dettmers 详解逐层敏感度探测与动态专家交换(2 条相关)→
「Infra」频道最新
- Reka EdgeQ 端侧 VLM 登陆骁龙 8 Elite,首 token 仅 0.73 秒 — RekaAILabs · 2026-09-23
- Ben Bajarin:FMS 大会释放信号,CXL 解体式内存明年起规模部署 — BenBajarin · 2026-09-23
- 想让 AI Agent 安全跑 ComfyUI?单卡 GPU 半虚拟化是个坑 — johnshedletsky · 2026-09-23
- Unsloth 量化让 Qwen-Image-2.1 仅需 6GB 显存本地运行 — danielhanchen · 2026-09-23
- H Company 用 SkyPilot 训练 computer-use 模型,沙盒秒级冷启动 — skypilot_org · 2026-09-23
- MiniMax H3 上跑 M5 Ultra 实测:768p 视频约 2 分 22 秒生成 — bakawolf123 · 2026-09-22