510GB 模型跑进 128GB 小机器:DeepSeek 新模型端侧加载妙招

pbaylies · x · 2026-09-14

推主 @0xBakeer 演示在单台 128GB 内存的 NVIDIA DGX Spark 上跑 510GB 的 DeepSeek-V4.1-Flash,开启 256k 上下文和思考模式,不用小模型也不上云。

核心技巧是利用 MoE 架构的稀疏性:每个 token 只激活 384 个专家中的 6 个,于是预先按目标任务「筛选」模型该擅长什么,只保留该任务真正需要的专家,大幅裁剪需加载的权重。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →