AirLLM 逐层流式加载:4GB 显存跑 70B 模型,2.8T Kimi K3 不到 4GB

alex_verem · x · 2026-09-14

Gavin Li 的开源项目 AirLLM(26.9k stars,活跃维护)能让小显存显卡运行超大开源模型:70B Llama 只需单张 4GB GPU,DeepSeek-V3(671B)约 12GB,Kimi K3(2.8T)不到 4GB 显存。

核心技巧很简单:不做量化、蒸馏或剪枝,而是一次只把一层模型放在 GPU 上,从磁盘流式加载,显存需求取决于单层大小而非整个模型。对稀疏 MoE 模型则逐 expert 流式加载,因此 2.8T 模型能塞进比 70B 更小的内存。一行代码即可支持 Llama、Qwen、DeepSeek、Mistral、Phi、Gemma 等主流开源模型,还新增了小显存训练支持(125B 模型 6GB 内训练)。

代价是速度:从磁盘流式读层很慢,不能替代真正的推理部署,但意味着游戏本也能把玩前沿规模开源模型。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →