AirLLM 靠分层流式加载,让 70B 模型跑进 4GB 显存

techNmak · x · 2026-10-03

35K star 的开源项目 AirLLM 无需量化、蒸馏或剪枝,就能在单张 4GB GPU 上运行 70B 大模型。

核心思路是改变权重进入显存的时机:

对 MoE 模型更进一步:按 expert 粒度流式加载,只加载 token 实际路由到的专家。仓库称可在此方式下运行 2.8T 参数的 Kimi K3。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →