三台旧设备拼内存跑 40B 模型:16 tok/s,还发现 CPU 争用反常识结论

Medicine_Blogscanner · reddit · 2026-09-16

作者用自研开源工具 ramdeck-core 把家里的三台设备(带 RTX 3060 的迷你主机、16GB Mac Mini、一台老旧笔记本)组成集群,成功加载约 25GB 的 40B 模型——三台设备单独谁都装不下。

分片逻辑先把 3060 显存占满,再溢出到 Mac 统一内存,剩余给 CPU。反常识发现:把 CPU 溢出部分路由到旧笔记本反而比留在迷你主机本机 CPU 上更快——推测同一设备同时跑 GPU+CPU 推理会拉低 GPU 利用率,整体卸载到另一台更慢的机器反而赢。

总加载约 2.5 分钟,推理 16 tok/s、延迟约 3.6 秒,达到「真的可用来聊天」的水准。代码开源,附视频演示,作者想征集其他人对 CPU 争用现象的经验。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →