47美元单卡运行DeepSeek-V3-Flash 实现47 tok/s
GitHub 一项目展示如何在约 47 美元预算下运行 DeepSeek-V3-Flash 模型(部分帖子误称 v4),通过剪枝加 EXL3 量化的优化方案,使模型在单台 DGX Spark 设备上流畅运行,实现 47 tok/s 的生成速度,并支持约 40 万 token 的长上下文,引发社区对低成本本地部署大模型的关注。
2026-08-21 ~ 2026-08-23 · 2 条相关
- DeepSeek v4 单卡跑出 47 tok/s,通过 37 万针测 — EAccelerate_42 · 2026-08-21
- 47 美元运行 DeepSeek-V3:剪枝加量化实现 47 tok/s — StefanoGogioso · 2026-08-23