47美元单卡运行DeepSeek-V3-Flash 实现47 tok/s

GitHub 一项目展示如何在约 47 美元预算下运行 DeepSeek-V3-Flash 模型(部分帖子误称 v4),通过剪枝加 EXL3 量化的优化方案,使模型在单台 DGX Spark 设备上流畅运行,实现 47 tok/s 的生成速度,并支持约 40 万 token 的长上下文,引发社区对低成本本地部署大模型的关注。

2026-08-21 ~ 2026-08-23 · 2 条相关