Expert-lookahead 让低内存 Mac 跑 MoE 提速 10%
carloslfu · reddit · 2026-09-15
开发者 carloslfu 为低内存 Mac 上的 MoE 模型专家卸载/SSD 流式加载(slotstream)实现了 expert-lookahead 优化,在 Qwen 3.8 flash 上获得 10%+ 的额外性能提升。
核心思路:本想训练小模型提前预测 N 层后的专家,实验后发现模型自身就是最好的预测器——最终采用 N=2,即在当前计算进行时,用当前隐状态提前运行 2 层后的 router,预加载将用到的专家到内存。目前正在训练叠加其上的小修正模型,可再带来约 3-4% 提升。
文档与实现已开源在 slotstream 的 GitHub 仓库。
「Infra」频道最新
- Helion 聚变能源 G 轮超额认购,最终募足 5 亿美元 — ycombinator · 2026-09-16
- nginx 1.31.6 修复 HTTP/3 堆缓冲区溢出漏洞 CVE-2026-90439 — jedisct1 · 2026-09-16
- AWS Trainium 原生跑 PyTorch,PyTorch Con 公布主题演讲 — PyTorch · 2026-09-16
- 长文详解:为什么本地跑推理模型是刚需,你需要无审查模型 — HankYeomans · 2026-09-15
- DGX Spark 本地跑 TRELLIS.2:铅笔草图一键转 3D GLB — jasonkneen · 2026-09-15
- 放弃再买 5090:本地推理用户改投 Spark,省心还能跑更大模型 — ideamaker321 · 2026-09-15