LayerStoRm:多消费级显卡通过 PCIe 流式跑大 MoE
CharacterBumblebee99 · reddit · 2026-08-25
LayerStoRm 是一个开源的 MoE LLM 推理引擎,专为显存受限的多 GPU 系统设计,利用 RAM 和 PCIe 传输来运行前沿规模的模型。它针对每一层求解最佳传输策略,仅获取 Token 实际路由到的 Expert,并将预取的 VRAM 作为智能缓存。目前支持 GLM 5.2、DeepSeek V4 等架构,在 RTX 5090/5080 系统上测试,生成速度约 10 tok/sec。采用 MIT 协议,支持 OpenAI 兼容 API、KV Cache 卸载、PagedAttention 等特性,目前处于早期实验阶段。
「Infra」频道最新
- AI供应链遭遇牛鞭效应,硬盘价格开始上涨 — AccBalanced · 2026-08-25
- 从 Notebook 到生产:15 天 MLOps 系统学习路线 — _jaydeepkarale · 2026-08-25
- 辟谣数据中心争议:不耗尽水电,占地仅 3% — AndyMasley · 2026-08-25
- Strix Halo 外接 dGPU 实测:低上下文跑分有水分 — Hrethric · 2026-08-25
- Fal 推出微调版 H3 模型,推理栈优化实现极速 — isidentical · 2026-08-25
- 4060Ti 16GB 跑 Qwen 27B 极限量化,独立完成整条特性分支 — o0genesis0o · 2026-08-25