LayerStoRm:多消费级显卡通过 PCIe 流式跑大 MoE

CharacterBumblebee99 · reddit · 2026-08-25

LayerStoRm 是一个开源的 MoE LLM 推理引擎,专为显存受限的多 GPU 系统设计,利用 RAM 和 PCIe 传输来运行前沿规模的模型。它针对每一层求解最佳传输策略,仅获取 Token 实际路由到的 Expert,并将预取的 VRAM 作为智能缓存。目前支持 GLM 5.2、DeepSeek V4 等架构,在 RTX 5090/5080 系统上测试,生成速度约 10 tok/sec。采用 MIT 协议,支持 OpenAI 兼容 API、KV Cache 卸载、PagedAttention 等特性,目前处于早期实验阶段。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →