GB10边缘设备跑DeepSeek-V4-Flash:实测超23 tok/s配置教程
lilian_moraru · reddit · 2026-08-05
开发者分享了在 Spark GB10 边缘设备上使用 llama.cpp 部署 DeepSeek-V4-Flash 模型的详细配置与优化过程。
- 性能表现:通过升级至 Nvidia 610.43.02 驱动和 CUDA 13.3.1,配合 UD-IQ3XSS 量化与 DSpark BF16 投机解码,模型生成速度可达 23-27 tok/s,代码生成场景甚至能飙升至 25-33 tok/s。
- 部署细节:文章提供了从固件更新、环境变量配置到源码编译 llama.cpp 的全套命令。
- 权衡取舍:为了在有限显存中容纳 400K+ bf16 KV cache 并使用 DSpark,不得不采用 UD-IQ3XXS 量化策略,以此牺牲部分模型质量来换取代码生成的速度。目前 Prompt 处理速度仍有优化空间。
「Infra」频道最新
- SpaceX 拟购数千兆瓦算力,机构预估可为英伟达增收超千亿美元 — nwilliams030 · 2026-08-05
- Proxmox VE 正式发布 ARM64 版本,全面支持英伟达 GH 平台 — jedisct1 · 2026-08-05
- TensorSharp MoE卸载实测:大模型显存占用暴降,速度远超llama.cpp — fuzhongkai · 2026-08-05
- 牛津经济学家:AI 军备竞赛驱动数据中心狂飙 — carlbfrey · 2026-08-05
- Cerebras 创始人详解 AI 芯片供应链与推理迁移 — mattturck · 2026-08-05
- 苹果求购便宜内存遭拒,长鑫反报高价 — firstadopter · 2026-08-05