SGLang 推 SSD Expert Pack:RTX 5090 本地跑 DeepSeek-V4-Flash

ying11231 · x · 2026-09-19

SGLang 与 WiCi AI 团队发布 SSD Expert Pack 方案,让消费级硬件运行远超内存容量的超大模型:将路由专家(routed experts)存放在 NVMe SSD 上,运行时仅把 router 选中加载到 GPU 缓存,实现类似 Hugging Face 对本地部署的探索之外的方案。

实测配置为 1 块 RTX 5090、32 GB 内存、2 TB SSD:DeepSeek-V4-Flash MXFP4 解码速度约 1.85–1.99 tokens/s;Kimi-K3 社区 Q2K 量化(纯文本)约 0.29 tokens/s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →