SGLang 社区项目加速 MoE 支持
BanghuaZ · x · 2026-07-13
一个社区项目正在给 **SGLang** 加上 **MoE 支持**,并提供可配置的 **offloading** 和 **SM120 kernels**。 转发内容强调,这个方向“非常值得关注”,尤其要看它的基准测试是否能兑现速度承诺。引用里还提到,它兼容 SGLang,可在 VRAM 中运行 **2.7bpw**,通过把部分内容 offload 到 **DDR / NVMe** 来换取更好的质量恢复,但代价是速度下降。项目灵感来自 **vllm-moet**,并声称当前 benchmark 表现“非常快”。
所属事件:SGLang社区项目新增MoE支持与加速(2 条相关)→
「Infra」频道最新
- 共享 SLURM GPU 集群,可能成为研究者更便宜的算力入口 — Sauers_ · 2026-07-21
- Reddit 用户设计四层本地 AI 机房:vLLM 到 OPNsense 全分层 — povedaaqui · 2026-07-21
- 现货内存价飙升 140%,合约重定价开始滞后 — tengyanAI · 2026-07-21
- 有人把 AI 使用方式指向异步长周期实验而非单买算力 — voooooogel · 2026-07-21
- PrismML Bonsai 27B 量化后仅 3.8GB 可手机运行 — tony10000 · 2026-07-21
- 有人主张给模型独立 micro VM,少用 tool calling — joecole · 2026-07-21