LayerStoRm 开源引擎:96GB 显存跑 186GiB MoE,1M 上下文 24.5 tok/s
CharacterBumblebee99 · reddit · 2026-09-07
Reddit 用户发布了 MIT 协议的实验性推理引擎 LayerStoRm:通过把 MoE 专家权重固定在主机内存、按 token 逐个取用到 GPU,实现在远超显存容量的模型上推理。
- 实测:GLM-5.3-Flash UD-Q4KXL(186 GiB 权重)在 2×RTX 5090 + 2×RTX 5080(共 96 GB VRAM,约 208 GB pinned 主机内存)上以 1M 上下文运行,8k 上下文解码 24.5 tok/s,27k 上下文 prefill 159 tok/s
- CPU 不参与计算,只负责喂数据;传输 NUMA-aware,最终瓶颈在 PCIe 带宽
- 针对 agentic coding 优化:prefix caching 支持中途 checkpoint,98% 深度处的编辑从最近 checkpoint 重新 prefill,8k TTFT 从 67.5s 降到 18.4s,97k 从约 923s 降到 79s
- 提供单命令 autoconfig,根据权重和硬件自动推导配置;目前仅支持 NVIDIA SM120(RTX 50 系)
仓库:github.com/kkontosis/LayerStoRm
「编程与Agent」频道最新
- 白嫖 20 小时:Kaggle 免费跑 Qwen3 27B 供 Agent 调用 — TheMoonMidas · 2026-09-07
- 开发者实测 Eve 官方教程连翻车:工具报假成功、文档过时踩坑一堆 — philnash · 2026-09-07
- Google 发布 MaxKernel:多智能体系统自动写 TPU kernel 达专家级 — google · 2026-09-07
- NUS 研究:LLM 修代码常过度编辑,RL 可提升编辑保真度 — NationalUniversityofSingapore · 2026-09-07
- Iris 开源搜索智能体:SFT+在线搜索 RL 刷新开源最佳成绩 — AllSpark-Research · 2026-09-07
- 实测 7246 个托管 MCP 服务器:46% 存活,26% 只是被 OAuth 锁住 — Eiji-Himura · 2026-09-07