AirLLM 逐层流式加载:4GB 显存跑 70B 模型,2.8T Kimi K3 不到 4GB
alex_verem · x · 2026-09-14
Gavin Li 的开源项目 AirLLM(26.9k stars,活跃维护)能让小显存显卡运行超大开源模型:70B Llama 只需单张 4GB GPU,DeepSeek-V3(671B)约 12GB,Kimi K3(2.8T)不到 4GB 显存。
核心技巧很简单:不做量化、蒸馏或剪枝,而是一次只把一层模型放在 GPU 上,从磁盘流式加载,显存需求取决于单层大小而非整个模型。对稀疏 MoE 模型则逐 expert 流式加载,因此 2.8T 模型能塞进比 70B 更小的内存。一行代码即可支持 Llama、Qwen、DeepSeek、Mistral、Phi、Gemma 等主流开源模型,还新增了小显存训练支持(125B 模型 6GB 内训练)。
代价是速度:从磁盘流式读层很慢,不能替代真正的推理部署,但意味着游戏本也能把玩前沿规模开源模型。
「Infra」频道最新
- Q2 全球前十大晶圆厂营收 535 亿美元,台积电独占 72.5% 份额 — Beth_Kindig · 2026-09-14
- RTX 3090 24G 单卡跑 Qwen3.8 27B INT4,144K 上下文 71/75 评测 — Altruistic_Heat_9531 · 2026-09-14
- Nvidia 单季净利 597 亿美元,日均赚约 6.6 亿美元 — himanshustwts · 2026-09-14
- 极客用 Claude Code 造超小神经网络,M4 芯片跑出 1500 tok/s — GregoryDiamos · 2026-09-14
- 10 美元开发板跑 10 亿参数 LLM:纯 C、零依赖、256MB 内存离线推理 — tom_doerr · 2026-09-14
- 开源项目 JAX-QNN:让 JAX 原生跑在高通骁龙 AI 引擎上 — carrycooldude · 2026-09-14