AirLLM:4GB 显存零量化无损运行 70B 大模型

petrusenko_max · x · 2026-08-04

开源项目 AirLLM 展示了在极低显存环境下运行超大参数模型的突破性能力。

通过以流式方式逐个加载专家层,该框架无需任何量化或剪枝即可在单张 4GB 显存的 GPU 上运行 70B 参数的 LLM。其扩展能力极为惊人:支持在 8GB 显存运行 405B 的 Llama 3.1,在 12GB 运行 671B 的 DeepSeek-V3,甚至在不到 4GB 显存上运行高达 2.8T 参数的 Kimi K3。

所属事件:AirLLM开源:4GB显存无损运行70B大模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →