万亿模型塞进个人电脑:热权重驻内存,专家放 NVMe
carrigmat · x · 2026-08-27
carrigmat 解释该方案的核心原理:权重并不全放内存。
- 现代 LLM 的大多数参数是稀疏激活的专家(experts),只是间歇性被访问,这部分留在 NVMe 固态盘上。
- 只有持续被访问的「热」权重驻留内存。这样用 128-192GB 内存 + 多块 NVMe 就能承载万亿参数模型,绕开内存容量墙。
所属事件:六千美元纯CPU方案本地全量跑前沿万亿模型(14 条相关)→
「Infra」频道最新
- Niklas 提出 Prefix Sliding,降低推理时显存消耗实现高效扩容 — Niklas Muennighoff · 2026-08-27
- LightningAI 推出即时 H100 租赁,无需等待排队 — LightningAI · 2026-08-27
- Cohere 推出 Parse 5 模型,号称最强性价比企业解析方案 — irombie · 2026-08-27
- M7 Ultra 或搭载原生 FP8,GLM 5.3-flash 性能有望飞跃 — Brilliant-Hall1387 · 2026-08-27
- ChronoScale 联手微软部署 50MW GB300 算力,主打企业推理平台 — r_jegaa · 2026-08-27
- 工程实践:混合精度矩阵乘法 mxfp8 与 mxfp4 提速 — zephyr_z9 · 2026-08-27