MacBook 联手 DGX Spark:实测异构分离推理与 KV Cache 传输
HankYeomans · x · 2026-08-11
开发者进行了一项异构推理实验:将 DGX Spark 用于处理预填充,而将 M4 Max MacBook Pro 用于解码,以发挥各自硬件优势。
- 核心思路:利用 Spark 高达 1.5-2.3k tok/s 的预填充速度,解决 Mac 在长上下文处理时的算力瓶颈。随后将生成的 KV Cache 文件传输给 Mac 进行解码。
- 网络传输预估:DeepSeek 的缓存大小为 86 KB/token。在 10GbE 有线网络下,传输 128k 上下文(约 5.8 GB)仅需约 5 秒;500k 上下文需 20 秒;100 万上下文需 42 秒。无线网络下耗时则显著增加。
- 当前进展:目前正在进行 WiFi 测试,有线连接数据为理论推算。
「Infra」频道最新
- ComfyUI 插件优化 LoRA 加载,MiniMax-H3 显存直降 38GB — marres · 2026-08-11
- 一台 NVIDIA DGX 能否彻底取代你的所有 AI 订阅? — jackedAJ · 2026-08-11
- 传英伟达 50 系 Super 显存大增:5070 Ti 望升至 24GB — PROfil_Official · 2026-08-11
- RTX 3060 实测:显存分配如何改变 LLM 推理执行策略 — Abhishekcur · 2026-08-11
- 长鑫 17nm DDR5 良率超 90%,美系大厂限制采购 — teortaxesTex · 2026-08-11
- 专家:开源模型推理成本降 8 倍,算力基建成新瓶颈 — latticecut · 2026-08-11