Threadripper PRO 实测:24 核即可喂饱 8 通道 DDR5 的 MoE offload
mr_il · reddit · 2026-09-10
作者为搭建「显存外跑超大 MoE 模型」的 PC,在 vast.ai 租用 Threadripper PRO 9975WX(32 核 Zen 5,8 通道 DDR5),用 FreeToken 的生产级 W4A8 dsfp4 GEMV 内核,按 DeepSeek V4.1 Flash 的几何结构(384 个路由专家 × 18.8MB ≈ 6.7GiB,每 token 6 专家)实测 CPU 侧专家计算性能。
核心结论
- 24 核以上核数不再重要:32 核相对 24 核爆发模式仅 +2.2–2.4%,持续模式为 0%;瓶颈在内存子系统而非核数。便宜约 $1200 的 9965WX 是理性之选。
- FP4 内核可达 STREAM 带宽的约 80%(24 核时 178–182 GB/s vs STREAM 222 GB/s)。
- 内存热节流不可忽视:持续压榨约 8 分钟后吞吐从 182 降到 150 GB/s(-17%),时钟未变,指向 DRAM/IMC 热节流——给 DIMM 散热气流可能值 20% 的解码速度。
换算成 tokens/s(每 token 约 4.5GB 路由专家,24 核):0% 缓存命中约 33 tok/s,60% 命中约 83 tok/s,75% 命中约 133 tok/s。对比 PCIe 5.0 x16 流式读取(约 50 GB/s),CPU 路径对未命中专家快 3–3.7 倍,这正是 FreeToken 混合模式把多数 miss 放 CPU 算的原因。
TL;DR:买内存通道数和内存散热,别买核数;24 核已饱和 8 通道 DDR5,升 32 核最多 +2%。 注意事项:租用单机、容器环境、方法与原始 CSV 在仓库公开。
「具身」频道最新
- Skild AI 用 NVIDIA Physical AI 让机器人看一个视频就学会新任务 — nordicinst · 2026-09-11
- Play2Perfect 获 CoRL 2026 接收:先玩后精修,零样本迁移到真实装配 — leto__jean · 2026-09-11
- SimWorld Studio:用进化式编码 Agent 自动生成具身训练环境 — ZhitingHu · 2026-09-11
- 不裁一人,团队从 175 缩到 3:「可自动化即自动化」的铁律 — cen6wkf · 2026-09-11
- 小马智行在萨格勒布开启欧洲首个全无人 Robotaxi 试运营 — nvidia · 2026-09-11
- 路人解救洛杉矶人行道被困配送机器人,全网热议 — chrismattmann · 2026-09-11