DGX Spark 本地跑大模型实测:DeepSeek V4 Flash 夺魁
andersonbcdefg · x · 2026-08-03
一位开发者分享了在 NVIDIA DGX Spark(128GB内存)上实际部署和运行主流大模型的测试结果与排名。
- 第一名:DeepSeek V4 Flash 0731。采用 3bit 量化,运行速度为 16.5 tok/s。虽然速度最慢,但它是 128GB 显存/内存下能装载的最大参数模型(284b 总参/13b 激活),在处理复杂问题时具备最强的“脑力”。
- 第二名:Laguna S 2.1。采用 NVFP4 量化,速度 19.8 tok/s(代码任务可达 37 tok/s)。该模型在长周期的 Agent 任务中表现最可靠,能够自主建立待办事项列表并追踪进度,不会在长上下文中丢失线索。
不过,原推被另一位网友引用吐槽,认为这种繁琐的折腾反而成了“千万别买 DGX Spark”的绝佳反向广告。
所属事件:DeepSeek V4 Flash多硬件本地实测出炉(3 条相关)→
「Infra」频道最新
- Nemotron 3 Nano Omni 本地实测:单机跑出 264 tok/s — ivan_bezdomny · 2026-08-03
- 全球AI算力将达2亿枚H100,Agent循环加速ASI进程 — 新智元 · 2026-08-03
- tinybox 推出双卡版主机,跑 DeepSeek 达 245 tok/s — AccBalanced · 2026-08-03
- Agent 多次工具调用导致 KV Cache 失效的排查与探讨 — CentrifugalMalaise · 2026-08-03
- Wafer 用 AMD MI355X 服务 Kimi K3,吞吐提升 3.8 倍、成本降 71% — SumitGup · 2026-08-03
- 亚马逊Graviton承诺收入环比增近3倍 — Beth_Kindig · 2026-08-03