510GB 模型跑进 128GB 小机器:DeepSeek 新模型端侧加载妙招
pbaylies · x · 2026-09-14
推主 @0xBakeer 演示在单台 128GB 内存的 NVIDIA DGX Spark 上跑 510GB 的 DeepSeek-V4.1-Flash,开启 256k 上下文和思考模式,不用小模型也不上云。
核心技巧是利用 MoE 架构的稀疏性:每个 token 只激活 384 个专家中的 6 个,于是预先按目标任务「筛选」模型该擅长什么,只保留该任务真正需要的专家,大幅裁剪需加载的权重。
「Infra」频道最新
- Oracle 大裁员同时狂招数据中心与 AI 人才,团队被砍两位数比例 — mkheck · 2026-09-14
- Strix Halo 128GB 双 GPU 同跑两模型遇 OOM,参数全公开 — El_90 · 2026-09-14
- 马斯克:四五年内 AI 将占 SpaceX 价值的 99% — XFreeze · 2026-09-14
- HBM 与先进封装企业需求或降温,DRAM/NAND 价格有望回归正常 — eyishazyer · 2026-09-14
- Depot 详解如何在 GitHub 之外运行 GitHub Actions 流水线 — jcran · 2026-09-14
- LangSmith 推出 LLM Gateway:可按密钥锁定可用模型 — LangChain · 2026-09-14