AirLLM 更新: 4GB 显存可跑 2.8T 参数 Kimi K3
pmttyji · reddit · 2026-08-20
AirLLM 发布更新,大幅降低大模型推理显存占用。新版本支持 Qwen3.8-27B(3.33GB VRAM)和 2.8T 参数的 Kimi K3(3.72GB VRAM),甚至能在 12GB 显存上运行 DeepSeek-V3 (671B)。该工具利用 MoE 模型的逐专家流式加载技术,无需量化、蒸馏或剪枝,即可在消费级显卡上运行超大规模模型。
「Infra」频道最新
- Modular 开源平台仓库:集成 MAX 引擎与 Mojo 语言 — modular · 2026-08-20
- vLLM 混合精度导致 GRPO 不收敛的发现 — SergioPaniego · 2026-08-20
- GeoLibre 发布浏览器端图形化模型构建器 — giswqs · 2026-08-20
- ComfyUI 跑 Flux 2 Klein 与 Qwen Image:几次迭代后推理暴涨近 4 倍 — ROBOTTTTT13 · 2026-08-20
- 硬核折腾:16 张 5060Ti 运行 DeepSeek V4 — Primary_Exchange21 · 2026-08-20
- FrankenGit:纯Rust实现的Git托管服务内存安全宪章 — doodlestein · 2026-08-20