AirLLM 逐层推理:4GB 显存跑 70B 模型,8GB 可上 405B

JensHonack · x · 2026-10-11

开源项目 AirLLM 用「Layer-wise Inference(逐层推理)」方式,不一次性加载整个模型,而是每次只加载、计算并释放一层,从而在极低显存下运行大模型:4GB GPU 可跑 70B 模型,8GB VRAM 可扩展到 Llama 3.1 405B。

要点:

被引者称「我没有 GPU」时代正式终结;评论者猜测代价主要是推理延迟。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →