ATSInfer优化llama.cpp:24G显存跑百亿大模型解码提速3倍
TeksEdge · x · 2026-07-19
介绍了一种名为 ATSInfer 的新技术,该技术通过扩展 llama.cpp,大幅提升了超出显存(VRAM)容量的大模型在本地运行时的推理速度。 - **核心机制**:不同于传统将整个网络层或 MoE 专家粗暴放置在 GPU 或 CPU 上的做法,ATSInfer 深入到张量级别进行细粒度调度。它会评估每个张量在 CPU 和 GPU 上的性能表现,将性价比最高的张量保留在显存中,并动态调整计算与 PCIe 传输的重叠。 - **实测性能**:在相同的显存预算下对比原版 llama.cpp,预fill速度最高提升 1.94 倍,整体解码速度最高提升 3.29 倍(在 RTX 4090 上提升 3.12 倍),GPU SM 利用率平均提升约 70%。 - **测试硬件与模型**:在 RTX 3060 6GB 和 RTX 4090 24GB 系统上,成功高效运行了 Llama 3.1-70B、Qwen3.5-122B 等大模型。 - **本地部署意义**:这意味着通过更智能的软件调度,普通开发者可以利用廉价的系统内存配合有限的显存,跑起远超显存容量的超大模型。目前该研究暂未公开代码。
所属事件:ATSInfer 优化本地大模型推理速度(2 条相关)→
「Infra」频道最新
- Merve Noyan:更多开源模型和 llama.cpp 更新在路上 — mervenoyann · 2026-07-21
- 加第二家 LLM provider,坏的往往不只是接口 — Ok_Extension6373 · 2026-07-21
- 英国 AI 数据中心因热量、噪音和占地遭到反弹 — nordicinst · 2026-07-21
- Fluidstack 融资 8.3 亿美元,估值 75 亿美元并承接 Anthropic 500 亿美元算力项目 — rohanpaul_ai · 2026-07-21
- Krea2 低显存 Gradio WebUI 已可在 6GB 机器测试 — Fluid_Kaleidoscope17 · 2026-07-21
- Z.AI 启动 1 吉瓦 AI 数据中心,全部采用国产芯片 — Polymarket · 2026-07-21