AirLLM:4GB 显存零量化无损运行 70B 大模型
petrusenko_max · x · 2026-08-04
开源项目 AirLLM 展示了在极低显存环境下运行超大参数模型的突破性能力。
通过以流式方式逐个加载专家层,该框架无需任何量化或剪枝即可在单张 4GB 显存的 GPU 上运行 70B 参数的 LLM。其扩展能力极为惊人:支持在 8GB 显存运行 405B 的 Llama 3.1,在 12GB 运行 671B 的 DeepSeek-V3,甚至在不到 4GB 显存上运行高达 2.8T 参数的 Kimi K3。
所属事件:AirLLM开源:4GB显存无损运行70B大模型(2 条相关)→
「Infra」频道最新
- Kimi K3 公开 2.8 万亿参数、百万上下文和 B200 吞吐数据 — TheZachMueller · 2026-08-04
- Formula 1 用 AWS Agent 把数据接入从 8 周压到 40 分钟 — AWS ML Blog · 2026-08-04
- Anthropic 携手 AWS 探索印度数据驻留,Claude 也将本地推理 — HimanshiET · 2026-08-04
- Google Cloud 推出跨云 Lakehouse,让 Gemini Enterprise 直连多家数据源 — rseroter · 2026-08-04
- Exa 已覆盖 800 亿网页、跟踪 1.4 万亿 URL — yoimnotkesku · 2026-08-04
- Omdia 预计今年 NAND 收入达 3600 亿美元,较 2025 年增 400% — Beth_Kindig · 2026-08-04