DwarfStar 利用异构内存实现 3000 t/s 推理
antirez · x · 2026-08-18
开发者展示了在 DGX Station 上通过 DwarfStar 编排技术运行 DeepSeek v4 PRO 的效果。尽管模型大于显存容量,但利用主机 RAM 与 VRAM 混合设置的 peculiar 方案,实现了 3000 tokens/s 的疯狂预填充速度。作者强调需要特定的推理引擎才能充分利用特定硬件进行本地 AI。
所属事件:DeepSeek v4 本地部署预填充速度飙至 3000 t/s(2 条相关)→
「Infra」频道最新
- Kimi K3 Kernel 实现超官方 2 倍性能 — ChengleiSi · 2026-08-19
- 实测:UnifyGTM 在发布前两周将模型成本降低 90-95% — LangChain · 2026-08-19
- 光互连普及速度将慢于预期,制造是瓶颈 — BenBajarin · 2026-08-19
- Modular 宣布 MAX 平台与 Mojo 语言更新 — carrycooldude · 2026-08-19
- CoreWeave 宣布 2026 年 Fully Connected 大会 — wandb · 2026-08-19
- Databricks:下一代数据库将为 Agent 而构建 — matei_zaharia · 2026-08-19