Qwen 38B 专家剖析:半数专家几乎闲置,仅 64 个承载半算力
EyalToledano · x · 2026-08-27
- 实验方法:作者使用约 70 万 token 的 Claude 代码会话追踪数据,在 4-bit 量化下通过 M4 Max 推理 Qwen3.8-flash-next,记录路由器对每个专家的依赖程度。
- 关键发现:在中位数层,512 个专家中仅 64 个承担了 50% 的路由权重,256 个承担了 91%。这意味着模型中有一半的专家是“乘客”,未被有效利用。
- 工程推论:剪枝专家虽不能直接加速解码,但能显著降低显存(VRAM)占用。作者正探讨调整 top-k 路由策略(如减少活跃专家数提速或增加以提升推理能力)。
所属事件:实测 Qwen3.8 专家分布 半数专家几乎闲置(2 条相关)→
「Infra」频道最新
- 两套 Blackwell vLLM 方案:NVFP4 KV 缓存换来 26 万上下文 — SeanHighness · 2026-08-27
- 为提升 SlimServe 性能,开发者修改 Nvidia 驱动解锁 PCIe P2P — QuixiAI · 2026-08-27
- 观点:单人持 200 张 B300 或可战大厂团队 — kalomaze · 2026-08-27
- GLM 5.3 Flash 跑分实测:双 DGX 达 881 tok/s — teortaxesTex · 2026-08-27
- 资深工程师建议:如果你有 CPU 节点,请务必留住 — rakyll · 2026-08-27
- OpenRouter 累计服务 2000B Token,新增 Qwen 3.5 35B — gajesh · 2026-08-27