MoE 推理实验称丢掉 28% 路由专家不影响 GSM8K
dai_app · reddit · 2026-07-25
这条帖做了一个小型实证:MoE 路由尾部可能比想象中更冗余。
- 在一个 35B MoE、top-8-of-256 的设置里,推理时丢掉约 28% 的低权重 routed experts,GSM8K 准确率没有下降。
- 基线是 12/15,而所有测试阈值里最激进的一档也都是 13/15。
- 15 道题里有 12 道在所有配置下最终答案完全一致,回复长度也没有变长或变短。
实验使用 greedy decoding,因此结果差异只来自是否跳过 expert。作者也强调样本很小,不能证明“普遍成立”,但它说明:当瓶颈在 内存流量 时,路由尾部可能是一个值得继续挖的推理加速点。
「Infra」频道最新
- Kimi K3 登陆 Together,预留吞吐成本低 65% — togethercompute · 2026-07-27
- OpenAI 可能撞上算力上限,Codex 和 ChatGPT Work 四个月涨到 1000 万 — JoshuaJBouw · 2026-07-27
- NVIDIA 称 Vera CPU 正加速下一代 CPU 和 GPU 设计 — nordicinst · 2026-07-27
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- NVIDIA 说 Vera CPU 让部分 EDA 工作负载提速 1.5 倍 — NVIDIA Blog · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27