Qwen3.8-Flash-Next 仅用 37GB 显存运行全专家
EyalToledano · x · 2026-08-29
作者分享了一项针对 Qwen3.8-Flash-Next 模型的 MoE 推理优化突破。他将 60% 的专家权重存储在磁盘上,并按需流式传输到内存(类似 n-gram streaming 技术)。
实测显示,在使用全部专家(无剪枝)的情况下,仅需 37GB 内存即可在 M4 Max 上以 40 tok/s 的速度进行解码。
「Infra」频道最新
- MiniMax H3 Max 视频生成快 24 倍,刷新帕累托前沿 — JenniferHli · 2026-08-29
- Ruff 引入 PGO 优化,性能提升 8-15% — charliermarsh · 2026-08-29
- 预测市场:英伟达年底蝉联最大公司概率 76% — Polymarket · 2026-08-29
- FreeToken 引擎:8G 显存本机流畅跑 35B 模型 — rohanpaul_ai · 2026-08-29
- Stripe 员工呼吁共建 Agent 友好的互联网基础设施 — jeff_weinstein · 2026-08-29
- 实测:开启 NCCL 反致 llama.cpp 性能下降 8% — jirka642 · 2026-08-29