456GB 的 DeepSeek v4.1 本地跑出 40 tok/s,混合推理方案公开
HankYeomans · x · 2026-09-22
一位开发者在本地成功混合部署 DeepSeek v4.1 MXFP4:模型约 456GB,达到 40 tok/s。
配置与做法:
- 2 张 RTX 6000 Pro Max-Q 放不下全部专家,溢出部分交给 Threadripper Pro CPU + 256GB CL32/6400MT 内存。
- Engrams 存放在 Samsung 9100 NVMe 上。
- 作者自述目的是把现有 GPU 周边硬件推到极限,展示 Threadripper 大内存平台在本地大模型上的价值。
「Infra」频道最新
- 24G 内存 MacBook 跑 Qwen-Image 本地生图:一张要 5-6 分钟 — vista8 · 2026-09-22
- Cerebras CEO:做到 500 亿营收才懂黄仁勋五万亿有多难 — rohanpaul_ai · 2026-09-22
- 腾讯混元把 770B 模型压进 214 GiB:四权重五比特 — TencentHunyuan · 2026-09-22
- 开源项目 Agent Substrate:子秒级挂起恢复,大规模智能体运行时 — rakyll · 2026-09-22
- 阶跃 Step 5 Preview 评测 44 分,成本仅同级模型 1/2.8 — ArtificialAnlys · 2026-09-22
- SemiAnalysis 抢先拆解 A20:A20 基于 TSMC N2,封装内藏 DRAM — dylan522p · 2026-09-22