RAM 涨价逼出的土办法:跨设备拼接闲置内存跑 30B 本地模型
Medicine_Blogscanner · reddit · 2026-09-25
面对 RAM 价格持续上涨,Reddit 用户不再买新机器,而是把多台旧设备的闲置内存池化来跑更大的本地模型。
实测:将一个 30B 模型拆分到 mini PC(12GB)与 Mac mini(5.5GB)上,通过普通 LAN 达到 30+ tokens/sec、约 1 秒延迟。作者还测试了知识库:模型对一种新批准的罕见病药物胡编乱造,喂入研究 PDF 后文档分片直接存于两台设备的内存中(不落盘),同一问题即答对。
关键发现:跑模型的设备与存知识库的设备可以是不同机器——强机专注推理,弱机后台持有文档分片;分片设备掉线时有恢复机制,会拉回备份并重新切分。作者征询更多人关于全内存 RAG 索引替代磁盘向量库的经验。
「Infra」频道最新
- 扩散架构推理提速:Augment Code 换用 Mercury 2.5,延迟降 82% 成本降 90% — cen6wkf · 2026-09-25
- Oracle 回应数据中心不可抗力通知:交付预期未变,租金照付 — AIFlow_ML · 2026-09-25
- SemiAnalysis 看好中国半导体设备国产化进程 — zephyr_z9 · 2026-09-25
- Meta Muse 模型仅用 AMD EPYC 服务器 CPU 两个核心运行 — firstadopter · 2026-09-25
- M5 Ultra 80 核跑 GLM-5.3-Flash:大内存爽,GPU 成瓶颈 — dreamingwell · 2026-09-25
- 传 AMD 四季度 AI GPU 与消费卡全线涨价约 10% — Beth_Kindig · 2026-09-25