单台 DGX Spark 跑 510GB 的 DeepSeek V4.1 Flash:113.6GB 量化底座+40MB 领域侧挂件
Physical_Toe_2499 · reddit · 2026-10-06
作者展示了自研 C/CUDA 推理引擎 YoungAi,把原版约 510GB 的 DeepSeek V4.1 Flash 压缩到单台 NVIDIA DGX Spark(GB10,128GB 统一内存)上运行,核心是「小底座+微侧挂件」的三文件架构:
- 量化底座:VQ-8 方案,每 8 个连续专家权重编成一个 12/13-bit 码本索引,码本按层训练、跨 384 个专家共享,FP8 存储;零语料训练,113.6GB,单独即是完整模型。
- 领域侧挂件:每个领域约 40MB,存每专家下投影的逐通道乘性增益(FP4)加路由偏置,用引擎自身 prefill 钩子逐层求解,目标是在领域文本上复现原版 MoE 块输出。
- 实验性后训练文件:把偏好转成对最后一层专家增益的线性方程,共轭梯度求解,训练请求上的决策点翻转率从 55% 升到 88%,但跨交易日不泛化。
实测:金融/代码/法律/医学/科学五个领域,加侧挂件后对原版的 top-1 一致率提升 2.83.7 个百分点(如代码 78.61%→82.26%);英文 WikiText-2 不降反升。速度方面,投机解码在 14.1k token 的真实 Agent 请求上达 43 tok/s,12.5k prompt prefill 1055 tok/s,解码已达 GB10 约 235GB/s 内存带宽理论上限的 82%。
作者坦承局限:参考标签来自 teacher-forced 对齐而非人类评测,后训练文件尚不泛化。
「Infra」频道最新
- TensorFold 绑定双 TB5 连接,Apple Silicon 推理吞吐提升 83% — AIFlow_ML · 2026-10-06
- 双卡 RX 6800 跑 Qwen3 27B:换 Linux+ROCm 后速度提升明显 — SaGa31500 · 2026-10-06
- DeepSeek 开源 GPU BLAS 内核库 DeepGEMM,GitHub 破 8500 星 — deepseek-ai · 2026-10-06
- AMD 苏姿丰:未来几年芯片需求将持续「非常高」 — AryHHAry · 2026-10-06
- 光子 AI 芯片可自校准:利用误差信号原位梯度下降,MSE 降至 0.0013 — bravo_abad · 2026-10-06
- Qwen3.8-Flash-Next 4-bit 本地机配置单:96GB 内存+二手 3090 混合推理 — Confident-Truth3607 · 2026-10-06