三台旧设备拼内存跑 40B 模型:16 tok/s,还发现 CPU 争用反常识结论
Medicine_Blogscanner · reddit · 2026-09-16
作者用自研开源工具 ramdeck-core 把家里的三台设备(带 RTX 3060 的迷你主机、16GB Mac Mini、一台老旧笔记本)组成集群,成功加载约 25GB 的 40B 模型——三台设备单独谁都装不下。
分片逻辑先把 3060 显存占满,再溢出到 Mac 统一内存,剩余给 CPU。反常识发现:把 CPU 溢出部分路由到旧笔记本反而比留在迷你主机本机 CPU 上更快——推测同一设备同时跑 GPU+CPU 推理会拉低 GPU 利用率,整体卸载到另一台更慢的机器反而赢。
总加载约 2.5 分钟,推理 16 tok/s、延迟约 3.6 秒,达到「真的可用来聊天」的水准。代码开源,附视频演示,作者想征集其他人对 CPU 争用现象的经验。
「Infra」频道最新
- NVIDIA 在 AI Infra Summit 公布 Vera 平台更多新数据 — karlfreund · 2026-09-16
- Evercore 预测 2030 年年 token 用量将达 4 quintillion — Beth_Kindig · 2026-09-16
- Periodic Labs 用 1300 张 H200 打造实验-模型闭环,材料分析超越 GPT-6 Astra — vwxyzjn · 2026-09-16
- NVIDIA 在 AIInfraSummit 公布 Groq 推理性能对比数据 — karlfreund · 2026-09-16
- MLPerf Inference v6.1 即将揭晓:30 家提交者与新加速器同台竞技 — TheKanter · 2026-09-16
- Lambda 用 NVIDIA DSX MaxLPS:同功率预算多跑 3 节点,吞吐增 24% — TheZachMueller · 2026-09-16