两台桌面 DGX Spark 跑起 462GB DeepSeek 模型,专家压到 2.77bit
Teknium · x · 2026-10-06
开发者 sudoingX 用 @0xSero 的方案,把传闻中的 DeepSeek v4.1 flash 部署到了两台 DGX Spark 上(未证实版本号):
- 462GB 检查点跨两台机器加载,routed experts 用 EXL3 压到 2.77 bits,engram 表格直接从 NVMe 流式读取,462GB 模型跑在 256GB 总显存里,约 15 分钟通过 ConnectX 线缆拉起
- 262k 上下文,单流开 dspark k=7 draft:代码 34.8 tok/s、散文 22.5 tok/s,略低于原方案作者的 41/29
- 为 agent 工作重调了 serving:精简 KV cache 给构建工具、浏览器和测试留内存,并锁死早前构建防止 agent 抄近路
- 配 Hermes agent harness 跑完整任务流程,文本、工具调用和视觉均通过冒烟测试
这也是一套可复现的双机桌面推理配方:源码构建 vLLM fork(含 exllamav3 与 b12x kernels)、NCCL 指向 RoCE 网口等细节都写明了。
「编程与Agent」频道最新
- Google Drive 与 Docs 原生支持 Markdown 文件预览与协作 — HamelHusain · 2026-10-06
- 开发者做原生 Mac 应用一键群发消息给多个 AI Agent — msg · 2026-10-06
- 开发者用 GitHub Copilot 应用一键生成 60 秒产品宣传视频 — DanWahlin · 2026-10-06
- 代理网络巨头 Oxylabs 首次引入 1.3 亿美元投资,估值 36 亿押注 AI Agent — Ronangmi · 2026-10-06
- 产品经理开源 GitDocket:用 Git 管理 AI 编程的 epic、任务与 wiki — bjorgen · 2026-10-06
- AI 仍是「终端时代」:从 GUI 回到命令行的界面启示 — Wattenberger · 2026-10-06