DwarfStar 利用异构内存实现 3000 t/s 推理

antirez · x · 2026-08-18

开发者展示了在 DGX Station 上通过 DwarfStar 编排技术运行 DeepSeek v4 PRO 的效果。尽管模型大于显存容量,但利用主机 RAM 与 VRAM 混合设置的 peculiar 方案,实现了 3000 tokens/s 的疯狂预填充速度。作者强调需要特定的推理引擎才能充分利用特定硬件进行本地 AI。

所属事件:DeepSeek v4 本地部署预填充速度飙至 3000 t/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →