SGLang 推 SSD Expert Pack:RTX 5090 本地跑 DeepSeek-V4-Flash
ying11231 · x · 2026-09-19
SGLang 与 WiCi AI 团队发布 SSD Expert Pack 方案,让消费级硬件运行远超内存容量的超大模型:将路由专家(routed experts)存放在 NVMe SSD 上,运行时仅把 router 选中加载到 GPU 缓存,实现类似 Hugging Face 对本地部署的探索之外的方案。
实测配置为 1 块 RTX 5090、32 GB 内存、2 TB SSD:DeepSeek-V4-Flash MXFP4 解码速度约 1.85–1.99 tokens/s;Kimi-K3 社区 Q2K 量化(纯文本)约 0.29 tokens/s。
「Infra」频道最新
- Pedro Domingos:反对数据中心就是让国家变蠢 — pmddomingos · 2026-09-19
- Pedro Domingos:OpenAI 与 Anthropic 真正的护城河是算力储备 — pmddomingos · 2026-09-19
- 全本地私有计算机操作 Agent 来了,3060Ti 12GB 即可跑 — WolframRvnwlf · 2026-09-19
- AWS 年内推 13 项 SageMaker 推理更新,启动延迟最高降 65% — AWS ML Blog · 2026-09-19
- 单卡 5090 实时跑世界模型:LingBot-World 16 FPS,比 SGLang 快 2.5 倍 — Kaarel_Kaarelson · 2026-09-19
- AMD 计算分析器用紫色区分 wave 分支走向的小技巧 — salykova_ · 2026-09-19