DeepSeek-V4-Flash本地部署优化:单机推理提速27%
antirez · x · 2026-08-09
开发者借助 DwarfStar 引擎在单台 DGX Spark 上成功优化了 DeepSeek-V4-Flash 的本地推理性能,实现同权重下速度提升 27%。
- 解码速度:从 22.5 提升至 28.6 tok/s
- Prefill 速度:稳定在约 1060 tok/s
- 优化细节:v0.5.6 版本加入了针对 Spark 的快速路径,并在思考阶段成功启用投机解码,草稿接受率达 74%。
该方案让 284B 参数的模型完全脱离云端,在桌面级设备上流畅运行。
「Infra」频道最新
- AI算力打破美国用电停滞,终结反增长思维 — AndyMasley · 2026-08-09
- 亚马逊为德州数据中心建专属电厂,或成全美最大温室气体排放源 — The Verge AI · 2026-08-09
- 升级 PyTorch 2.13 与 CUDA 13,Blackwell 显卡视频渲染分辨率翻倍 — Chemical-Bicycle3240 · 2026-08-09
- 训练10万亿参数模型需5万张以上GB300 — AccBalanced · 2026-08-09
- 亚马逊数据中心成全美最大污染源,AI算力扩张代价凸显 — geox · 2026-08-09
- 投资人 Matt Turck 呼吁:不应无视社区对 AI 数据中心的抵触 — mattturck · 2026-08-09