AirLLM 靠分层流式加载,让 70B 模型跑进 4GB 显存
techNmak · x · 2026-10-03
35K star 的开源项目 AirLLM 无需量化、蒸馏或剪枝,就能在单张 4GB GPU 上运行 70B 大模型。
核心思路是改变权重进入显存的时机:
- 将 checkpoint 切成独立的层分片存放在磁盘上,用 PyTorch 的 meta device 创建完整 HF 模型(参数不占实际内存)
- 通过 hook 机制,在某层计算前才把该层权重从磁盘加载进 GPU,算完立刻移除;同时预加载下一层,实现流水线
- 因此整个 70B 权重无需同时驻留显存
对 MoE 模型更进一步:按 expert 粒度流式加载,只加载 token 实际路由到的专家。仓库称可在此方式下运行 2.8T 参数的 Kimi K3。
「Infra」频道最新
- DGX Spark 一货难求:筹款 8800 美元捐机计划因缺货濒临流产 — cyrus_zei · 2026-10-03
- Perplexity 宣布绑定 NVIDIA Vera CPU,自建沙盒推 Perplexity Computer — AravSrinivas · 2026-10-03
- 实测 5090 跑 Qwen3.8 27B:ninfer 达 147 t/s,胜过 llama.cpp — theexile1337 · 2026-10-03
- 用户算账:ChatGPT 白跑 30 分钟算力才报限额,单次约浪费 3-5 美元 — CautiousMagazine3591 · 2026-10-03
- GPU 是不是印钞机?SemiAnalysis 拆解推理经济与 Vera Rubin vs Blackwell — AccBalanced · 2026-10-03
- gufo 推出 Windows 免编译包,Strix Halo 用户开箱即用跑本地大模型 — hiImMate · 2026-10-03